ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读

测试时强化学习(TTRL)靠答案自投票构造奖励,但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL:从题面自构造无输出探针输入,用候选程序行为一致性构造 Probe Consensus Reward;再用 ERPO 把 PCR 当作’负信号为主’的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序,配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3,零样本迁移 CodeContests 25.1→42.1,是唯一同时提升 pass@1 与 pass@k 的无标签方法。

September 10, 2026 · 2 min

Experience Funnel: A State–Policy Alternating Loop for Self-Evolving Agents 精读

自进化 Agent 面临双时间尺度困境:文本状态(技能/记忆)快而外部依赖重,参数策略持久而更新慢。华为与港理工的 Experience Funnel 用交替环打通两者:轨迹先蒸馏为显式状态快速适配,再选择性把’跨状态修订仍有效’的行为经 transition-aware distillation 固化入策略——经验像漏斗一样从原始轨迹逐级过滤为可复用能力。多基准上一致超越 state-only 进化与 policy-internalization 两条单路线。

September 10, 2026 · 2 min

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 精读

NeoHorse-1 把部署中的模型路由 harness 变成递归自改进(RSI)的数据飞轮:路由层天然记录每次交互的’能力需求预测-实际执行-结果’三元组,这些记录被转化为保留交错推理与工具调用的 user-turn 训练样本,路由分数进一步组织成三阶段课程 SFT 与路由引导的在线策略蒸馏。4B/9B 模型十项基准宏平均分别从 58.94/65.60 提升至 64.87/69.04,路由 harness 数据比公开 Agent 数据平均高 6.26 分。本文精读拆解其数据管线、课程设计、OPD 机制与’评估-选择-更新’闭环为何能成立。

September 10, 2026 · 3 min

TGOPD:在策略蒸馏前先验证教师——提示级可靠性门控 精读

AllSpark 团队推出 TGOPD:对每个提示用少量验证器打分的教师探针估计可靠性,通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD,35B LiveCodeBench 64.0(其他蒸馏方法全部负迁移),探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。

September 9, 2026 · 2 min

Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读

Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象:每条推理轨迹仅监督 1–2 个关键 token(占全部生成 token 的 0.05%)即可匹配甚至超越全 token 训练的推理激励,跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一’有效学习不需要 token 密集’的证据链及其对后训练范式的改写意义。

September 8, 2026 · 2 min

RISE 之外的第二条线:When Models Edit Too Much — 代码过编辑与最小编辑保真度 精读

NUS 团队构造 400 个带已知最小补丁的修复任务(BigCodeBench 注入 AST 级损坏),首次系统量化 LLM 代码修复的’过编辑’:GPT-5.5 等前沿模型普遍重写过度。保持性指令使超额 Levenshtein 距离 0.195→0.131、认知复杂度 -26.6%、Pass@1 +2.3;SFT 过拟合损坏模式而 RL 取得最佳 OOD 保真。本文精读’最小性’作为修复一等目标的评测与训练路径。

September 8, 2026 · 2 min

RISE: 自外推策略蒸馏把 on-policy 蒸馏变成递归自我改进 精读

RISE 从模型自身 RLVR 训练轨迹外推合成教师:以当前检查点与滑动锚点的位移放大(β>1)构造未来教师,在 logit 或权重空间实现,教师随学生每轮刷新。OLMo3-7B AIME'24 从 30.2 提至 46.9(+16.7),ALFWorld +9.4、WebShop +10.9 vs GRPO,OOD 不降反升。本文精读’教师从哪来’这一 OPD 根本问题的第一性解法及其递归改进机制。

September 8, 2026 · 2 min

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 精读

滑铁卢大学×哈佛的 Compile by Training 把’编译’概念引入神经函数:教师模型从自然语言规格合成监督数据,训练 LoRA 适配器特化冻结的 Qwen3-0.6B 解释器,产出可存储、可版本化、可组合的 .paw 程序。在 PAW 快速编译器零精确匹配的 FuzzyBench-Hard 上语义准确率从 0.224 提升至 0.836,编译仅需约 50 秒。本文精读其’训练即编译’范式、分钟级编译服务工程与速度-精度新权衡点。

September 7, 2026 · 3 min

Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training 精读

自主 LLM 后训练系统不断积累’过去什么更新有效’的经验,但父模型一旦变化,旧经验就可能是毒药。本文把这一困境形式化为条件经验迁移问题,提出 BCIT:把效果绑定到源上下文、更新前检查适用性、具名硬冲突否决、必要时小预算试验取证。等预算对比中 BCIT 更少授权有害更新、最终模型质量更高,为自进化 Agent 补上’免疫排异’机制。

September 7, 2026 · 2 min

Rethinking On-Policy Distillation II: One Training Example 精读

on-policy 蒸馏到底需要多少数据?本文把实验推到’一条训练样本’的极限:单条查询即可驱动 OPD 持续改进数百步,覆盖全数据 OPD 71.5% 的状态空间;16 个语义多样查询覆盖 98.9% 并匹配全数据训练。提出状态覆盖率度量解释现象——OPD 是’数据过饱、算法饥饿’,瓶颈在步数效率而非数据规模。

September 7, 2026 · 2 min