Iris: Climbing to the Search Frontier — 开源搜索智能体的数据反构造与 SFT-RL 攀爬配方 精读

AllSpark 团队发布 Iris-mini/pro 两个开源搜索智能体(35B-A3B 与 397B-A17B):从网页超链接实体图反向构造多跳任务,把非答案实体改写为描述性引用以杜绝字符串匹配作弊;提出 SFT-RL climbing 交替训练——每轮 RL 把最难与最高效轨迹回流进下一轮 SFT。BrowseComp 88.6 / HLE 56.4,同参数段开源最强。本文精读其’不可作弊任务合成’与’爬坡式两阶段循环’的完整配方。

September 8, 2026 · 2 min

RISE 之外的第二条线:When Models Edit Too Much — 代码过编辑与最小编辑保真度 精读

NUS 团队构造 400 个带已知最小补丁的修复任务(BigCodeBench 注入 AST 级损坏),首次系统量化 LLM 代码修复的’过编辑’:GPT-5.5 等前沿模型普遍重写过度。保持性指令使超额 Levenshtein 距离 0.195→0.131、认知复杂度 -26.6%、Pass@1 +2.3;SFT 过拟合损坏模式而 RL 取得最佳 OOD 保真。本文精读’最小性’作为修复一等目标的评测与训练路径。

September 8, 2026 · 2 min

RISE: 自外推策略蒸馏把 on-policy 蒸馏变成递归自我改进 精读

RISE 从模型自身 RLVR 训练轨迹外推合成教师:以当前检查点与滑动锚点的位移放大(β>1)构造未来教师,在 logit 或权重空间实现,教师随学生每轮刷新。OLMo3-7B AIME'24 从 30.2 提至 46.9(+16.7),ALFWorld +9.4、WebShop +10.9 vs GRPO,OOD 不降反升。本文精读’教师从哪来’这一 OPD 根本问题的第一性解法及其递归改进机制。

September 8, 2026 · 2 min

TROVE: 轨迹锚定的最小充分路线编辑 — 智能体编排的运行时修正 精读

TROVE 把智能体编排的结构决策从’执行前锁定’改为’运行时最小充分编辑’:离线把工作流搜索轨迹蒸馏为原子/复合技能+结果条件转移图,在线对挂起路线执行保留/插入/替换失效后缀三操作。代码生成、QA、数学推理上质量-效率权衡全面优于 AFlow/MaAS/LAS。本文精读’route 即临时品’的编排新原则。

September 8, 2026 · 2 min

What Does Multi-Harness RL Learn? — 评测 Harness 是 Agent RL 的主导变量 精读

本论文在同一 Qwen3-8B 热启动上回放相同任务-harness 记录(Aider/OpenHands/Qwen Code/SWE-agent),对比 GRPO 的 Within/Cross 两种分组规则,用 24,000 次密封 SWE-bench Verified 评估发现:评测 harness 使解决率从 2.14% 摆到 9.27%(4.3 倍),训练配方仅移动 1.16,分组规则不显著(+0.25pp,CI 含 0)。harness 工程对 Agent RL 的影响碾压算法选择。

September 8, 2026 · 2 min

τ^τ-Bench: 把'构建智能体'变成任务的端到端基准 精读

Sierra×Princeton 的 τ^τ-Bench 把’交付一个生产级客服智能体’本身作为评测任务:开发智能体拿到真实业务记录、需求方客户、生产 API 与继承代码库,须在成本与模型限制下交付完整 agent,再用 held-out 模拟用户评分。最强配置 Claude Opus 5 + Claude Code 仅通过 23.9%,专家参考上限 82.2%,banking 域低至 5.9%。本文精读这一’元任务’基准的设计哲学与失败模式解剖。

September 8, 2026 · 2 min

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 精读

流式视频理解的主流范式是’存历史、按需检索’,但外部证据永远只是临时上下文。南京理工×蚂蚁×NUS×港中文的 LatentStream 把范式翻转为’检索并内化’:分层流记忆 + 渐进扩张感受野的 latent token 把历史证据固化进固定长度潜记忆,用熵构造的渐进置信奖励在测试时联合优化。OVO-Bench 64.2%、StreamingBench 76.9%、MLVU +6.1,全部 SOTA。

September 7, 2026 · 2 min

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 精读

滑铁卢大学×哈佛的 Compile by Training 把’编译’概念引入神经函数:教师模型从自然语言规格合成监督数据,训练 LoRA 适配器特化冻结的 Qwen3-0.6B 解释器,产出可存储、可版本化、可组合的 .paw 程序。在 PAW 快速编译器零精确匹配的 FuzzyBench-Hard 上语义准确率从 0.224 提升至 0.836,编译仅需约 50 秒。本文精读其’训练即编译’范式、分钟级编译服务工程与速度-精度新权衡点。

September 7, 2026 · 3 min

Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training 精读

自主 LLM 后训练系统不断积累’过去什么更新有效’的经验,但父模型一旦变化,旧经验就可能是毒药。本文把这一困境形式化为条件经验迁移问题,提出 BCIT:把效果绑定到源上下文、更新前检查适用性、具名硬冲突否决、必要时小预算试验取证。等预算对比中 BCIT 更少授权有害更新、最终模型质量更高,为自进化 Agent 补上’免疫排异’机制。

September 7, 2026 · 2 min

LatentPress: Context Compression Beyond Text and Vision 精读

压缩后的上下文通常仍以文本或图像这两种’给人看’的形式存在。LatentPress 提出第三种表示:小型 writer 把对话/文档直接写成连续记忆 token,冻结解码器经输入嵌入接口读取,推理时零文本重建。LongMemEval 上 7.7× 压缩反而比未压缩证据更准(0.504 vs 0.490),写入 43ms 比摘要快一个量级——机器原生的记忆表示从此有了实证立足点。

September 7, 2026 · 3 min