Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science 精读

语言模型能产出看似合理的短证明,但在长程研究问题(不确定且相互依赖的决策序列)上不可靠——短证明能力与长程研究能力之间存在结构断层。Stellar Colosseum(CMU×Google Research)给出 model-agnostic 的多 Agent harness:策略探索后 readiness gate 决定何时分解、证明计划表示为 section 级相互依赖子问题、verifier 反馈路由回受影响部分;并行候选生成+定向证伪+重叠随机采样树聚合。已在数学与理论计算机科学问题上产出实际研究进展。本精读覆盖’长程=决策序列管理’的问题重构、readiness gate 的推理分配经济学与树聚合的抗噪声机制。

September 16, 2026 · 2 min

EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning 精读

复旦大学针对开放 RL 的奖励系统自进化框架 EvoRS:rubric 奖励与 policy 构成动态反馈回路——policy 优化当前奖励时,初始有用的奖励系统会因 reward hacking 或区分度退化而失效。EvoRS 把奖励系统表示为可执行 Reward-DAG,agentic designer 从 on-policy rollout 与奖励轨迹更新它。写作/角色扮演任务上三种 judge 下质量最佳,超固定奖励 policy 2.107/4.767 分,reward hacking 与覆盖失败双降。

September 15, 2026 · 2 min

The Last AI Built by Humans 精读:RSI 五级自治框架与“结构递归 vs 有效递归”的证伪标准

Theseus Lab 32 人团队(含清华/上交,腾讯混元等六家工业案例)发布 RSI 系统综述:以改进闭环为分析单元、L1-L5 自治分级框架,用 HCI 指数量化 2023-2026 能力轨迹(工具 Agent 39.9 vs 数学 86.4——交互能力 headroom 最大),区分“结构递归”与“有效递归”,并给出安全继承/自治归因/可靠验证三大挑战的判定标准。

September 12, 2026 · 2 min

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 精读

harness 进化后,让弱模型模仿更强专家的轨迹——这个’显然正确’的配方在七个企业任务上全部翻车(平均 -14.9 分),而同样的做法在未进化 harness 下却有增益。论文定位出根源:模仿让弱模型学会了专家的知识,却也继承了专家的规划风格,破坏了它与’围绕自身原生风格进化出来的 harness’的拟合。解法是 on-policy 专家修正:meta-MLE agent 定位失败 turn、专家只重写那一轮,平均 +1.7 分且规划失败桶保持地板水平。本文精读拆解’模型-harness 拟合’这一新概念与其共进化配方。

September 10, 2026 · 3 min

Experience Funnel: A State–Policy Alternating Loop for Self-Evolving Agents 精读

自进化 Agent 面临双时间尺度困境:文本状态(技能/记忆)快而外部依赖重,参数策略持久而更新慢。华为与港理工的 Experience Funnel 用交替环打通两者:轨迹先蒸馏为显式状态快速适配,再选择性把’跨状态修订仍有效’的行为经 transition-aware distillation 固化入策略——经验像漏斗一样从原始轨迹逐级过滤为可复用能力。多基准上一致超越 state-only 进化与 policy-internalization 两条单路线。

September 10, 2026 · 2 min

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 精读

NeoHorse-1 把部署中的模型路由 harness 变成递归自改进(RSI)的数据飞轮:路由层天然记录每次交互的’能力需求预测-实际执行-结果’三元组,这些记录被转化为保留交错推理与工具调用的 user-turn 训练样本,路由分数进一步组织成三阶段课程 SFT 与路由引导的在线策略蒸馏。4B/9B 模型十项基准宏平均分别从 58.94/65.60 提升至 64.87/69.04,路由 harness 数据比公开 Agent 数据平均高 6.26 分。本文精读拆解其数据管线、课程设计、OPD 机制与’评估-选择-更新’闭环为何能成立。

September 10, 2026 · 3 min

Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 精读

知识图把事实组织成 (实体, 关系, 实体) 三元组来回答’是什么’;Google 团队的 Procedural Graph 用 (过程, 关系, 过程) 三元组回答’怎么做’。Agent 每步决策时定位活跃节点,引导模型把邻域子图翻译成步级情境引导;离线自进化循环对比成败轨迹编辑图拓扑与属性,验证门通过才采纳、拒绝项存为负约束。六个基准三个 LLM 全面超越 ReAct/ExpeL/AWM 等记忆基线——Gemini 3.1 Pro 上 τ-bench 72.17→80.00、GDPval 56.39→78.78、ALFWorld 满分,零骨架自进化图匹配乃至超越手工设计。本文精读拆解过程性知识的表示设计与’验证门+拒绝记忆’的进化机制。

September 10, 2026 · 2 min

FlowBalance:验证器锚定的自改进——把符号门控装进轨迹平衡 精读

腾讯 HY LLM Frontier×UPenn 推出 FlowBalance:冻结的特权后见视角对已采样轨迹打密集分,验证器组相对优势用符号门控决定引导方向(正保留/负反转/零关闭),profiled trajectory balance 拟合归一化目标分布。Qwen3-8B 五基准平均 67.61 超 GRPO/OPSD/RLSD/FlowRL,AIME24 达标 100 步 vs GRPO 143 步,四条目标级定理精确刻画反自确认机制。

September 9, 2026 · 2 min

CoSkill: 把元技能变成可学习智能体 — 分层技能库的联合强化学习 精读

中科院自动化所×人大的 CoSkill 把静态元技能工作流重构为可学习的 Meta-Skill Agent,与 Reasoning Agent 共享单骨干联合 RL:推理智能体条件于检索到的任务技能与子技能,任务表现反向指导元技能精炼。ALFWorld 98.4%(+3.5pp)、WebShop 90.6%(+6.2pp),样本效率与墙钟效率全面占优。本文精读’技能从被动对象到主动协作者’的范式转变。

September 8, 2026 · 2 min

EvoHarnessBench: 智能体能跟上不断进化的 Harness 吗 精读

Salesforce Research×UNC Chapel Hill×UW–Madison 的 EvoHarnessBench 把非平稳性从任务流转移到 harness 本身:17 条受控 harness 进化流(802 任务、520 工具、42 技能、62 智能体),分部署评估(能力保持)与自进化适应两设定。基准回答一个此前无人系统提问的问题:当工具、技能、子智能体持续增加时,已部署 agent 的既有能力何去何从。

September 8, 2026 · 2 min