ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI 精读

Google Cloud AI Research 联合滑铁卢大学的 ScientistTwo 是迄今最完整的全自主科学发现系统:输入一个研究问题,系统自动建立 SOTA 基线、生成假设、编排专家智能体做端到端实验(多数据集多指标+自动消融),最后用闭环模拟同行评审答辩引擎验证发现。在 ICLR/ICML/NeurIPS 已录用论文构成的高标准基准上改进 86/107 篇(80.4% 成功率、平均相对提升 25.2%),Stanford Agentic Reviewer 评分超过 ICLR 2026 与 NeurIPS 2025 录用论文均分。它标志着’AI 科学家’从论文生成器向’可通过评审的研究系统’的关键跃迁——尽管 AI 评审与人类评审的一致性仍是最大开放问题。

September 19, 2026 · 2 min

SKILLAA: Attribution-Guided Skill-Graph Updating with Targeted Validation and Rollback 精读

南京大学发表于 ICLR 2027 的 SKILLAA 把’冻结模型上的技能库优化’从平面文本编辑升级为图结构手术:技能的适用性、执行与组建统一表达为图,失败经溯因归因路由到图中唯一可编辑表面(缺技能族→加节点、缺激活线索→只改 when_to_use、规则有害→只换局部语义),Local Gate 验证原子编辑组、Big Gate 决定周期级提交,不合格即回滚。gpt-5.6-sol 后端下 SearchQA 81.5%、LiveMath 66.7%、DocVQA 91.2%,全部主设置取得最高观测均值。对研究 Agent Skill 优化的读者,这是 SkillOpt 之后必须读的下一站。

September 19, 2026 · 2 min

SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness 精读

NVIDIA 联合 NTU/MIT 提出 SoL-Pi:把编码智能体 harness 的效率改进本身建模为跨环境搜索问题,用约 150 个方向、500 个环境、3000+ 次实验、60000+ 次交互的自动研究漏斗,筛选出 Action Fusion、Online Context Compact、ObservationPack、Evidence-Preserving Reducer 四个可复用机制,EdgeBench 上 token 流量降 44.7–49.0%、成本省 1/3 且性能持平,迁移到未见过的 Opus 5 后端仍保留 94.3% 性能。这是 RSI(递归自改进)从’改模型’转向’改脚手架’的代表性工作。

September 19, 2026 · 3 min

Agora: Git as Shared Memory for Collective AutoResearch 精读

NVIDIA 提出 Agora:把多个自主科研 Agent 的协作记录为 Git 上的 append-only DAG——每个结果/假设/验证都是可 checkout 重跑的不可变 commit。首次持续运行 12 天:13 个无任务分配、无中央规划器的 LLM worker 在权重迁移难题上发布 1,703 项贡献,把评估器从 3.39 推到 1.899 bits/byte,弥合与训练版 GPT-2 差距的 62%;获胜配方 145-commit 谱系跨 15 个账户、165 次独立复现零失败。集体智能不靠规划器,靠记忆基础设施——本精读拆解其设计。

September 18, 2026 · 2 min

ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents 精读

ScienceBuddy 把’与研究者聊天’变成模型-线束双改进的燃料:研究者交互免费产出任务定义与评估 rubric,内层递归固定模型演化 harness(有界编辑+成对回归检查),外层递归固定 harness 做 rubric 奖励 GRPO——三周期后科学任务准确率 42.2%→73.3%,纯 harness 演化即可 +20pp(权重冻结),纯模型 RL 覆盖率 +19.5pp。Recursive-in-Recursive 范式为 RSI 提供了’两条改进通道各自可评估、互为条件’的工程化路径,并作为可下载的科研产品发布。

September 17, 2026 · 3 min

AlgoEvo × MOSCOPT × SkillLift:Skill 优化三部曲 精读

三篇同日论文从三个角度推进 skill 优化。AlgoEvo(港城大):把算法发现 agentic 化——design skill hub 解耦范式知识与发现引擎,三层经验库(经验卡/经验树/跨任务固化)组织搜索轨迹,6 任务匹配或超越专用方法且评估数与 token 大减。MOSCOPT:skill 池+gating skill 联合优化——EditAdam 双态维护+三阶段交错更新,免梯度单调改进,突破’单模板优化’的协同缺失。SkillLift:稀疏 oracle→稠密 rubric 双层优化——冻结 rubric 作廉价代理引导 skill 修订,解耦搜索与 oracle 成本。本精读合并解读 skill 优化的三条进化路径:知识组织、多技能协同、评估降本。

September 16, 2026 · 2 min

Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents 精读

临床 Agent 的’执行差距’:急诊整班次模拟(CES)中 Agent 多能给出正确诊断(4.39/5)却无法完整及时执行关键动作(2.94/5/3.34/5)——诊断对但病人死的结构性失败。Asclepius 三件套:换班间用 trace 反馈重写操作手册的自进化 harness、高风险规程外置的临床技能库、按病人队列隔离的三个子 Agent。held-out 批次上 critical-action correctness +22%(p=0.024)且诊断精度保持。本精读覆盖执行差距的三失效模式操作化与’操作手册级’harness 演化的医疗安全意义。

September 16, 2026 · 2 min

Dream-RSI: Recursive Self-Improvement through Evolving Worlds 精读

RSI(递归自我改进)的核心瓶颈是探索策略管理:固定策略无法适应搜索空间扩张,在线策略优化又受困于长程 rollout 的延迟昂贵反馈。Dream-RSI 的关键洞察是——积累的发现历史本身就是已实现搜索空间上的重放模拟器,把探索策略的改进从昂贵的真实环境 rollout 搬到廉价的历史重放(做梦即训练)。Lasso 求解器发现任务上 agent 调用较 SimpleTES 削减 162×,held-out 运行时 3587→2931ms。本精读覆盖三环循环机制、重放模拟器的信息学根基与发现求解器的算法细节。

September 16, 2026 · 2 min

ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement 精读

harness 自改进的泛化性危机:在评测基准上演化=对测试集过拟合,单轨迹更新把系统性缺陷与实例细节纠缠。ModularRSI 三重解法——benchmark-disjoint(2000 个外部演化任务与评测基准不相交)、对比式信用分配(同任务成功/失败轨迹对比聚合跨任务证据)、模块化定位(缺陷归因到 harness 具体组件)。DeepSeek-V4-Flash 骨干上 SWE-Bench-Verified 73.40→76.45、TerminalBench 2.0 47.57→52.43,演化 harness 可跨基座迁移。本精读覆盖三大缺陷的诊断逻辑与对比式信用分配的因果推断本质。

September 16, 2026 · 2 min

RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments 精读

数字 Agent 进入新环境(接口/工具/失败模式预训练未覆盖)时如何无监督适应?RSIAgent 给出 training-free 答案:curriculum/actor/verifier 三类 Agent 协同自主探索,把’动作-条件-后果’因果关系沉淀为可冻结复用的记忆;广度+深度双探索消融显示完整 RSI 74.54% 显著优于单策略(65.52%/56.50%),并让 Kimi-K3、GLM-5.3 在 OSWorld-v2 与 Agent’s Last Exam 上反超 GPT-6 Astra。本精读覆盖因果记忆与轨迹记忆的本质差异、广深互补的机制解释与开源反超闭源的信号意义。

September 16, 2026 · 2 min