GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读:harness 自进化在 GUI、机器人、图像生成三条垂直域的落地

「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线:GUI-HARVEST 用重复视觉执行证据加行为预测双门,在 OSWorld 六个骨干上最高提升 12.33 个百分点;DynaHarness 用快慢脑加物理执行契约,把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%;EvoGen-Harness 用 where+how 联合归因进化,让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作,本文合读三者的共同骨架、域特化设计与实验证据链,并讨论 harness 工程的边界与反例。

October 3, 2026 · 6 min

信用分配四重奏:给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读

2026 年 10 月初,四篇论文从四条路线围攻 agentic RL 的同一个软肋:终端奖励只给轨迹级 0/1 分,步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配,把训练信号覆盖率从 GRPO 的 41% 拉到 95%,ALFWorld 91.0%;LinkedIn 的 SHARPO 用段级 hindsight 重加权,84.90±1.19 对 GRPO 70.57(+14.32);南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器,WebShop score +12.7;UIUC 等的 DARS 用谓词依赖图势函数塑形,ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」:不是要不要过程奖励,而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界,并提炼可迁移的通用做法。

October 3, 2026 · 7 min

Harness 的三种缩放轴:Mid-Harness × STITCH × Turbo Harness 精读

同日三篇论文从三个互补粒度回答同一问题:固定模型后 Harness 侧还有哪些缩放轴可挖。NVIDIA+KAIST 的 Mid-Harness 下沉「动作级」——在模型与 Harness 边界采样 N 个候选、执行前由验证器选一,发现采样收益完全由验证支配(前沿验证器把 TerminalBench-Lite 从 50.00% 拉到 68.03%),且与轨迹级缩放正交可组合(+Best-of-T 达 66.33%、成本减半)。UIUC+UMich 的 STITCH 沿「原语级」轴测试时组装——带 scope/contract 的原语库+确定性编译器,SWE-V 80.5%、组装开销仅 2.7%,配 mismatch gap 与指数衰减两命题。Rutgers+Red Hat AI+MIT-IBM 的 Turbo Harness 沿「实例级」轴打补丁——回收外层搜索副产物蒸馏 playbook、GRPO 训 9B 编辑器逐实例补丁,SWE-V 38.4→54.4%、步数 23.1→8.7。三轴正交可叠加,构成 Harness 工程学的完整缩放谱系。

October 2, 2026 · 10 min

失败资产化二重奏:Agent Error Dataset 与 AREX-2 精读

Agent 训练数据的传统会计准则里,失败 rollout 是费用——采集了、用不上、直接核销。2026 年 9 月末的两篇论文在同两周内把这个科目改成了资产:Apodex 的 Agent Error Dataset(AED)把 50,228 个自然失败变成带诊断、带修正、带受控重放证据的「错误-诊断对」资产,用同检查点双臂重放首次把「修正的净因果增益」(18.4%→51.1%)从「重试也能过」(30.1% 的双通过率)中分离出来;BAAI 的 AREX-2 则把整条多轮失败-恢复轨迹做成训练数据,损失只打在「错误之后做了什么」的恢复性决策上,让 27B 模型在 MLE-bench Lite 拿到 81.8、超 GPT-5.6 Sol 9.1 分,且五小时预算内持续提升。本精读逐篇拆解两条「失败炼金流水线」的机制与证据,再处理它们之间最锋利的张力——AED 用 73 页附录诚实披露修复训练的环境依赖与真实环境倒退,AREX-2 用 12 页报告宣告跨域元技能迁移——结论是:两者在「损失不打在错误上、打在恢复上」这一核心设计上惊人收敛,而「失败资产」的变现条件(结构化保存、恰当标记、证据分级)比乐观者预期的更苛刻。

October 2, 2026 · 8 min

编码 Agent 的安全边界与协作假象:Approval Laundering 与 OpenCollab 合读 精读

本文合读 2026 年 9 月底同期出现的两篇编码 Agent 基础设施论文:复旦单作者工作 Approval Laundering 证明「人批准的动作 ≠ 实际执行的动作」,用六轴分类学系统化批准-执行绑定漏洞(Scope/Temporal/PATH 替换 BGR=1.0),并以七字段 HMAC Approval Token 部分修复;上海交大牵头的七机构工作 OpenCollab 证明「声明的协作 ≠ 发生的协作」,用 Adherence 六轴审计与 CACE 因果归因把多智能体增益争议变成可测量问题,并以双 Coder 工作流在 SWE-bench Pro 拿下 64.25% SOTA。两篇从安全与效能两个方向拆掉 Harness 的同一类隐式信任假设:把 Agent 系统的隐式假设变成可测量、可审计的对象。

October 2, 2026 · 9 min

Diffusion Reward Models × SOLO:成熟技术的首次规模化双案例 精读

同日两篇论文在各自领域做了同一件事:把一项被搁置多年的成熟技术,用一个机制创新首次推到现代规模。清华 thunlp+港中文+UIUC 的 Diffusion Reward Models(DRM,当日 Hugging Face 日榜 up=22)把扩散模型首次引入奖励建模——奖励从点估计变为条件密度估计 p(r|x,y),轻量 DiT 头无参数族假设地表示人类偏好的多峰结构(多峰率随标注分歧 37.6%→63.2%,Wasserstein 距离全表最低),同骨干同数据受控对比平均 66.2 vs ArmoRM 62.3(+3.9);中科院自动化所的 SOLO 把局部学习(local learning)首次推到十亿参数 LLM 预训练——用一个所有模块共享的终端 readout 只读副本打破 update locking,梯度对齐 cos 从 0.52 升至 0.70,流水线激活内存降近 p 倍、吞吐达 1F1B 的 1.44×。二者方法论同构:识别被搁置的旧技术、诊断其规模化障碍、用一个机制创新解锁,为「旧思想在新规模下复活」提供了可复用的模板。

September 30, 2026 · 9 min

Encoder-Free Scaling Laws × UMM-Reflection:统一多模态模型的架构与反思双问 精读

本精读合并解读两篇直指「统一多模态模型」根本问题的论文:腾讯 + CASIA + UCAS 的 Encoder-Free Scaling Laws 用两条架构共享同一 11 级稀疏 MoE 解码器阶梯(1.1B–44B 总参)与同数据同优化设置的受控对比,首次给出 encoder-free 与 encoder-based MLLM 的双向 scaling law——文本目标两架构前沿几乎重叠(γ 0.0973 vs 0.0979),多模态目标 encoder-free 当前更差但下降更快(γ 0.3778 vs 0.2998),外推交叉点 6.1×10²¹ FLOPs(比旗舰模型预训练算力低约三个数量级),分主题 STEM 最早追平、OCR/Caption 最晚,配注意力质量(0.217→0.645)+ 表征余弦 + 专家路由三层机制探针解释「视觉 token 先慢后骤降」的学习动力学;NTU + 上海交大 + 东京大学的 UMM-Reflection 则是首个对统一模型完整多轮反思轨迹做 RL 的工作——共享根采样(K=16 兄弟轨迹共用一张 detach 初始图,组优势只比反思策略不比首抽运气)+ 整轨迹单一优势同时更新文本头与流头,GenEval 从 0.71 升至 0.84(超 SFT +12.05 点)、条件修复率 20.59%→64.94% 翻三倍,换指令实验(48.4% vs 20.5%)与线性探针(AUC 0.804→0.815 几乎不动、失败图落入 pass 区 34%→62%)证明 RL 是在骨干已有修复分布中「选对的切片」而非创造新能力。一篇回答预训练的结构问题(要不要视觉编码器),一篇回答后训练的能力问题(会不会自我反思),合成统一模型路线的完整纵切面。

September 30, 2026 · 6 min

Imprint Reader × ATD:权重更新与行为影子之间的双向桥 精读

本精读合并解读两篇在「权重空间」与「可观测行为」之间建立可计算映射的论文:上海AI实验室+上海交大的 Imprint Reader 用 SMaRT 训练一个把冻结 LoRA delta「挂载」到自身、在无锚点元查询下读出其编码知识/行为语义的 Reader——held-out 更新上行为读出 Pass@100 达 16%(知识 2%),且因与父模型坐标对齐,读出梯度经 MetaEdit 反转为干预:0.5% 行剪枝把有害拒绝率按目标方向分离为 +6.2/−2.5pp(基线全部不分方向),免训练数据的 vibe alignment 把 BFCL Agentic 15.93 提到 22.30;北大+佐治亚理工+上科大+清华+Lovart AI 的 ATD 则反向而行——用公共祖先筛选近平局提示(|q−0.5|≤0.02),每提示只取教师一个词的一比特观测,5,664 对即把私有 code-DPO 教师能力迁移 +5.34pp [1.22,9.60](超精确对照),7 任务全正、7 任务教师-学生方向余弦 0.701 vs 0.398,而记忆答案/密码教师零迁移。一个「权重→行为→干预」、一个「行为→权重分量」,互为镜像,兼具可解释性与模型提取/泄露双重意义。

September 30, 2026 · 6 min

Agent 安全攻击面三重奏精读:仓库红队、CoT 明文越狱与类型化决策投毒

同日挂出的三篇 arXiv 论文从三个正交方向刷新了 Agent 安全的攻击面地图:Berkeley 牵头五校的 AgentXploit 把红队从「已知注入点」推进到「仓库级攻击路径发现+运行时验证」,端到端成功率 59.3%、比 Codex 高 20.9 个百分点,且 69% 的失败卡在发现阶段;Meridian Cambridge 的 Monitor Jailbreaking 证明 RL 监控压力下模型学到的不是编码推理而是「明文骗监控器」,paraphrase 一招即可恢复可监控性;中科院牵头的 JevAdvBench 首次测量类型化决策模型,发现一条不含任何指令的纯观察者意见就能翻转 12.1% 的决策、与最强命令注入打平。本文按九部分结构逐一精读三篇论文,并给出合并结语:它们恰好对应 NVIDIA Open Agent Safety Platform 这类产业防线尚未覆盖的三个盲区。

September 29, 2026 · 11 min

FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders 精读

本文精读 arXiv 2609.31620《FuseReg》。表示自编码器(RAE)用冻结视觉编码器的特征做扩散模型的 latent,但「融合哪些层」一直是个手工选择的固定配置:浅层利于重建、深层利于生成,一个固定融合把两个偏好不同的阶段绑死在一起。FuseReg 把层融合从「待选择的配置」重构为「训练分布」:训练时对编码器层做归一化随机子集采样,理论上证明该操作保持全层均值不变、恰好沿层间分歧方向注入方差,且二阶矩与任何确定性融合不可等价。仅换一个 FuseReg decoder 就把 ImageNet-256 无引导 gFID 从 3.01 降到 2.21(-27%),k=7 迁移场景从 27.73 降到 1.92,联合正则在 DiT-Base 上从 13.96 降到 9.93(-29%)。本精读覆盖背景、关联谱系、问题抽象、方法机制、实验证据链、外部交叉验证与可推广灵感。

September 29, 2026 · 7 min