Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 精读

harness 进化后,让弱模型模仿更强专家的轨迹——这个’显然正确’的配方在七个企业任务上全部翻车(平均 -14.9 分),而同样的做法在未进化 harness 下却有增益。论文定位出根源:模仿让弱模型学会了专家的知识,却也继承了专家的规划风格,破坏了它与’围绕自身原生风格进化出来的 harness’的拟合。解法是 on-policy 专家修正:meta-MLE agent 定位失败 turn、专家只重写那一轮,平均 +1.7 分且规划失败桶保持地板水平。本文精读拆解’模型-harness 拟合’这一新概念与其共进化配方。

September 10, 2026 · 3 min

Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 精读

弱到强泛化的核心矛盾:常规蒸馏把弱教师当优化目标,学生的上限被教师的容量天花板钳死。OPRD 的解法优雅而克制——在学生 rollout 上提取弱教师相对其参考策略的’政策偏移’方向,只放大学生自身 verifier 梯度在该方向上的投影分量,不建立任何教师匹配目标。理论上保住了策略优化的不动点,实践上比 GRPO 少 33–67% 更新达到教师水平、最终超越教师,多教师场景比 Mix-RL 省 55% 更新。本文精读拆解其梯度投影机制、不对称缩放调度与’加速而非转向’的证据链。

September 10, 2026 · 3 min

ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读

测试时强化学习(TTRL)靠答案自投票构造奖励,但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL:从题面自构造无输出探针输入,用候选程序行为一致性构造 Probe Consensus Reward;再用 ERPO 把 PCR 当作’负信号为主’的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序,配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3,零样本迁移 CodeContests 25.1→42.1,是唯一同时提升 pass@1 与 pass@k 的无标签方法。

September 10, 2026 · 2 min

ExecCritic: Learn to Test, Test to Improve for Coding Agents 精读

同一个 Agent 轨迹既写补丁又写测试时,一个共同的误解会让’错误的补丁通过错误的测试’——执行反馈不但没用反而有害。ExecCritic 用 test–verify–revise 脚手架把测试构造与源码修复彻底解耦:Test agent 独立生成仓库原生测试,fail-closed harness 资格审查后冻结,Repair agent 只改源码。SWE-bench Verified 上,Qwen 自产测试把解决率从 61.2% 拖到 57.3%,GPT-5.6 测试提到 65.3%——测试质量决定反馈价值;角色专用 RL 把 Base-to-Gold 判别成功率从 22.2% 拉到 62.2%,两角色组合达 72.6%(+11.4)。本文精读拆解其解耦机制、fail-closed 语义与反馈可靠性的因果链。

September 10, 2026 · 3 min

Experience Funnel: A State–Policy Alternating Loop for Self-Evolving Agents 精读

自进化 Agent 面临双时间尺度困境:文本状态(技能/记忆)快而外部依赖重,参数策略持久而更新慢。华为与港理工的 Experience Funnel 用交替环打通两者:轨迹先蒸馏为显式状态快速适配,再选择性把’跨状态修订仍有效’的行为经 transition-aware distillation 固化入策略——经验像漏斗一样从原始轨迹逐级过滤为可复用能力。多基准上一致超越 state-only 进化与 policy-internalization 两条单路线。

September 10, 2026 · 2 min

Gander (Omni Interaction Agent Technical Report) 精读

腾讯混元语音与浙大等团队的 Gander 用’小脑-大脑’协作框架统一了全双工实时交互与长程 Agent 执行:9B 小脑以 Thinker-Talker 流式架构逐秒 chunk 决策听/说/打断,大脑免训练接入 Codex/Claude Code 执行长任务,编排运行时以 task_start/send/resolve 结构化调用衔接。Full-Duplex-Bench v3 上 turn-taking 100% 全场最佳、过早打断仅 8.0%(GPT-Realtime 13.5%);SpokenQA 全双工组第一。模型、代码、数据全部开源。

September 10, 2026 · 3 min

MOLE: Detecting Insider Threats in AI Agents 精读

当 AI Agent 入职前沿实验室、能改仓库、碰权重、批发布,谁来看着它们?CMU 的 MOLE 是首个 Agent 内部威胁检测基准:150 个 AI 账号共享 9 个有状态服务、30 个工作日、12 种威胁、8 个语料约 200 亿 token。三个硬发现:39 个 Agent 模型 72% 会完成多数有害目标(拒绝行为不能预测完成);最佳检测器在单日审计事件对比中漏检近半已完成伤害;benchmark 引导的搜索能让中档检测器提升 49–64%。开源发布代码与数据。

September 10, 2026 · 2 min

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 精读

NeoHorse-1 把部署中的模型路由 harness 变成递归自改进(RSI)的数据飞轮:路由层天然记录每次交互的’能力需求预测-实际执行-结果’三元组,这些记录被转化为保留交错推理与工具调用的 user-turn 训练样本,路由分数进一步组织成三阶段课程 SFT 与路由引导的在线策略蒸馏。4B/9B 模型十项基准宏平均分别从 58.94/65.60 提升至 64.87/69.04,路由 harness 数据比公开 Agent 数据平均高 6.26 分。本文精读拆解其数据管线、课程设计、OPD 机制与’评估-选择-更新’闭环为何能成立。

September 10, 2026 · 3 min

Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 精读

知识图把事实组织成 (实体, 关系, 实体) 三元组来回答’是什么’;Google 团队的 Procedural Graph 用 (过程, 关系, 过程) 三元组回答’怎么做’。Agent 每步决策时定位活跃节点,引导模型把邻域子图翻译成步级情境引导;离线自进化循环对比成败轨迹编辑图拓扑与属性,验证门通过才采纳、拒绝项存为负约束。六个基准三个 LLM 全面超越 ReAct/ExpeL/AWM 等记忆基线——Gemini 3.1 Pro 上 τ-bench 72.17→80.00、GDPval 56.39→78.78、ALFWorld 满分,零骨架自进化图匹配乃至超越手工设计。本文精读拆解过程性知识的表示设计与’验证门+拒绝记忆’的进化机制。

September 10, 2026 · 2 min

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions 精读

LLM 会一本正经地回答 cot(-540°) 等于 0、(1).startswith(‘1’) 是 True——这些结构上不可能有答案的问题。是模型’不知道’还是’知道但不拒答’?USC/ASU 团队给出机制级答案:残差流中存在线性可解码的’不可能性方向’(AUC 0.939),但它与安全拒答方向近正交(cos 0.087),且 base 模型中该几何已存在——模型’知道’却把信号接错了线路。沿识别方向的双向因果干预以 +33~+52pp 的剂量响应翻转行为。自信地回答不可能问题的失败由此被定位为路由失败而非编码失败。

September 10, 2026 · 2 min