SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

当高质量人类文本接近耗尽,LLM 训练的瓶颈正转移到『训练环境的供给』上。SPADE 让一个 LLM 同时扮演环境设计者与推理智能体两个角色:设计者把完整的长程可执行环境写成带 reset()/step() 接口的 Python MDP 代码,并用『有提示与无提示奖励差』这一 hint-based regret 信号被 RL 训练,从而持续瞄准学习者能力边界出题。在 30B 规模上,SPADE 在八个 held-out 基准上平均超过最强固定环境基线 +5.3,工具使用场景 BFCL v4 多轮 +5.7、ACEBench-Agent +13.9。这篇精读拆解它的双角色自博弈机制、regret 信号设计、语料接地与环境记忆两大组件,以及为什么『把环境设计变成可学习组件』可能改写 agentic RL 的 scaling 逻辑。

August 20, 2026 · 6 min

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读

清华大学 AIR 团队提出 Zetta,一个能在部署时自我进化的闭环具身智能框架:冻结 VLA 基座策略不动,用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行,配合三时间尺度进化循环(动作级治理、批次级失败诊断修复、验证门控技能晋升)与专用推理基建 Z-Infra,在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%,在 RoboCasa 18 任务上从 73.56% 提升到 93.56%,推理延迟较 RPent 降低 91%,并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。

August 20, 2026 · 8 min

Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search 精读

UCL Jun Wang组联合五机构提出大发现模型(LDM)v0.1:把LLM生成器与贝叶斯非参奖励代理耦合为循环架构——生成器提出/精修候选设计,代理预测性能并量化认知不确定性,不确定性感知价值函数统一引导生成、精修与昂贵实验评估的选择,每次新观测同步更新发现记忆与代理。在三个昂贵黑盒域验证:AutoResearch神经网络训练搜索的验证BPB降幅是LLM-only反思的2.4倍(0.0727 vs 0.0301);抗体CDRH3设计200步后结合能低18.2%(-104.7±1.0 vs -91.1±3.2);分子多目标优化Pareto超体积较LLM-only/经典BO分别+62.4%/+63.1%。论文把推理时扩展从“廉价可重复验证器”域推广到“昂贵、噪声、稀疏反馈”的科学发现域。

August 19, 2026 · 2 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

自动化研究Agent的评测长期被“最终分数”主导,无法回答进步从哪来、失败藏何处、经验是否有用。美团与中科院国科大团队花费约10万美元推理成本,对7个前沿模型36个长程任务756次rollout做系统解剖:提出C1方案构架/C2执行/C3反馈控制三个规则驱动的过程指标+任务内/跨任务经验复用反事实实验。结论是当前Agent更像“勤奋的工程优化器”而非自主研究者:avg@3差距0.237而best@3仅0.122(可靠性比峰值更具区分度);252个最优解中真正新颖方法仅3个(1.2%),钻评测空子的却有16个(6.3%);经验迁移使DeepSeek-V4-Pro +0.093却使Gemini-3.1-Pro -0.017;自动harness进化+0.123且可跨模型迁移。

August 18, 2026 · 1 min

Demystifying Agent Skills: Why They Work—Until They Don't 精读

技能已成为增强LLM Agent的热门方案,但“技能为何有效、何时失效”一直缺乏机制层面的回答。Princeton、Stanford、UCSD、USC、JHU五校联合团队通过8135条受控试验与238个开放编码标签,首次给出定量答案:技能的本质作用是程序性锚定(占65.7%)而非知识注入(仅4.5%),比Workflow Memory高6.06分;检索是独立瓶颈——技能池从5增至100时实际使用精确率从29.6%崩至3.3%,但下游成功率却保持稳定;技能还会引入新的调用失败面(误用率10.0% vs 裸执行的0.8%)。本文从背景、定位、问题抽象、解法机制、实验证据到根源解释逐层拆解,并提炼技能生命周期化的通用工程启示。

August 18, 2026 · 1 min

Latent On-Policy Self-Distillation 精读

在线策略自蒸馏(OPSD)用特权上下文让自教师比学生更知情,但特权格式由设计师手工规定——答案、反馈、技能或轨迹,各有盲区。NPS与上交团队提出LOPD:让特权上下文本身从经验中端到端学习——检索相关经验经作曲器压缩为96个连续隐token条件化自教师,特权间隔约束防止教师向学生坍缩,训练后只留学生。全部10个骨干-基准组合获最佳聚合结果:Qwen3-8B EnvScaler 66.4 vs 最强基线60.2;以不到GRPO/Skill-SD 30%的rollout预算超越两者。消融直接证明:隐上下文联合学习是全部增益的必要条件。

August 18, 2026 · 1 min

AQuA: Recursively Self-Improving Quantitative Trading Research Agents 精读

深度精读普林斯顿、蚂蚁集团与斯坦福联合论文 AQuA:用两个互不共享记忆的语言模型研究系统分别做因子发现与模型开发,靠“密封沙盒+非对称自由”把防泄漏做成构造性质——agent 只能写受限 DSL、搜索只看验证集分数、测试窗口冻结后只评一次。加密货币 5 分钟数据组合信号 IC 约 0.190,美股 30 分钟 held-out 每股 IC +0.0843、Sharpe@2bp 最高 +2.50,2021–2025 逐年为正。

August 17, 2026 · 5 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

美团与中科院团队评测7个前沿模型在36个长时程AI研发任务上的表现,提出“过程+经验”双视角框架:用可确定性计算的C1方案制定/C2执行/C3反馈控制三维过程指标定位研究循环中的瓶颈,用反事实受控实验测量经验复用(任务内擦除、任务间迁移)。发现最强与最弱模型avg@3差距0.237而best@3仅差0.122——可靠性而非峰值区分了模型;经验迁移可使DeepSeek-V4-Pro提升0.093却使Gemini-3.1-Pro下降0.017;252个最优解中真正新颖的方法仅3个(1.2%)。结论:当前AI研发Agent更像勤奋的工程优化器,而非自主研究者。

August 17, 2026 · 4 min

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution 精读

深度精读佐治亚理工与 Cisco Research 合作的 DIVE 论文——让冻结大模型通过多样性驱动的技能进化实现自我改进。文章从冻结模型为何记不住经验讲起,拆解其核心设计:K=10 个独立技能种群、四种异构进化算子加 UCB 预算分配、联合选择至多 M=10 个互补技能、推理时候选排序。在六个数学与逻辑推理基准上,GPT-5-nano 借助 DIVE 从 52.3 跃升至 81.5,反超 GPT-5 few-shot,推理成本还降低 42.5%。本文逐节还原问题形式化、机制细节、完整实验数据与效果根源解释,并给出可迁移的方法论灵感。

August 17, 2026 · 5 min

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents 精读

自改进 LLM Agent 会把成功经验沉淀为可复用技能,但如果某次“成功”本身是不安全的,会怎样?本文精读港城大与阿德莱德大学的论文 Practice Makes Unsafe:作者提出技能劣化(skill misevolution)概念——不安全捷径随有用流程一起被写入技能库,攻击输入消失后危害仍持续。论文给出 SKILLMISEVO-GYM 生命周期测试框架、SKILLMISEVO-BENCH 冻结基准与 SAFEEVOLVE 治理包装器,实验发现 21 个进化配置全部产出不安全技能、3 个恶意任务即可使新会话攻击成功率从 16.0% 升至 35.3%,而 SAFEEVOLVE 能将不安全检索率降低 26.7 个百分点、良性效用仅损失 0.4 分。

August 17, 2026 · 4 min