ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI 精读

Google Cloud AI Research 联合滑铁卢大学的 ScientistTwo 是迄今最完整的全自主科学发现系统:输入一个研究问题,系统自动建立 SOTA 基线、生成假设、编排专家智能体做端到端实验(多数据集多指标+自动消融),最后用闭环模拟同行评审答辩引擎验证发现。在 ICLR/ICML/NeurIPS 已录用论文构成的高标准基准上改进 86/107 篇(80.4% 成功率、平均相对提升 25.2%),Stanford Agentic Reviewer 评分超过 ICLR 2026 与 NeurIPS 2025 录用论文均分。它标志着’AI 科学家’从论文生成器向’可通过评审的研究系统’的关键跃迁——尽管 AI 评审与人类评审的一致性仍是最大开放问题。

September 19, 2026 · 2 min

Agora: Git as Shared Memory for Collective AutoResearch 精读

NVIDIA 提出 Agora:把多个自主科研 Agent 的协作记录为 Git 上的 append-only DAG——每个结果/假设/验证都是可 checkout 重跑的不可变 commit。首次持续运行 12 天:13 个无任务分配、无中央规划器的 LLM worker 在权重迁移难题上发布 1,703 项贡献,把评估器从 3.39 推到 1.899 bits/byte,弥合与训练版 GPT-2 差距的 62%;获胜配方 145-commit 谱系跨 15 个账户、165 次独立复现零失败。集体智能不靠规划器,靠记忆基础设施——本精读拆解其设计。

September 18, 2026 · 2 min

ComPO 零阶偏好对齐 与 SpectralShift 线性注意力长上下文扩展 精读(二重奏)

两篇训练方法学论文合并精读。UC Berkeley×NYU×阿里达摩院的 ComPO 提出 LLM 偏好对齐的零阶范式:不在偏好对上直接优化可微损失,而是用 comparison oracle 提取方向信息——规避 DPO 类方法在低似然边际对上的 likelihood displacement 失效,五个模型家族上改进含长度控制胜率,并给出收敛与性能保证。人大高瓴×MSRA 的 SpectralShift 从转移矩阵谱视角重新审视 Gated DeltaNet 的长上下文扩展:慢谱带宽度决定长程检索、快衰减模式负责状态清理,重参数化 alpha 投影初始化+学习率缩放即可让 10B 模型 8K→128K 课程扩展持续增益(RULER 64K +4.2)。

September 18, 2026 · 2 min

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence 精读

Stable AI 与清华大学联合发布 LimiX-2,用「上下文机制网络(CMN)」范式重新定义表格基础模型:预训练目标从 PFN 的『预测指定标签列』改为 CCMM 的『对任意掩码列做联合分布建模』,让每个样本内所有列都成为监督源。在 TabArena 上以 Elo 1935 领先第二名 TabFM+ 117 分、参数量却只有对方四分之一,还意外获得了因果骨架恢复能力。本精读拆解其『从预测标签到建模机制』的范式转移、SCM 合成数据引擎设计,以及这一思路对结构化数据智能的普适意义。

September 18, 2026 · 3 min

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 精读

上海AI Lab 联合上海交大、西湖大学等七校发现 PPO 在 LLM 强化学习中的系统性失效——『价值平坦化』:蒙特卡洛估计的状态价值在响应内剧烈变化,critic 预测却近乎水平线。诊断出两大根因(MSE 隐含方差惩罚+相邻状态冗余更新)后提出 SP3O:每条响应只监督 3 个位置分离的锚点。数学推理 +7.97pp、OOD +7.33pp,K=3 优于 K=64,越稀疏越好——一个『少即是多』的教科书式发现。

September 18, 2026 · 3 min

ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments 精读

AItonomy 基金会联合 Oxford、Berkeley、Stanford 等 25 家机构发布 ScienceIDE:把全球科学代码库(PLUTO、Athena++、MITgcm 等天体物理/等离子体/海洋模拟器)改造成 64 个可执行环境、2,812 个经验证任务、1,076 项数值检查的 Agent 训练基础设施。ScienceIDE-Hard 上 15 个前沿模型横评显示 Claude Fable 5.1 仅 67.1%——科学代码仍是 Agent 洼地;而用验证轨迹 SFT 小模型,修复奖励最多 +33 分且正向迁移到 HumanEvalFix/BBH 等通用基准。本精读拆解『环境即基础设施』的设计哲学与『科学经验 bottleneck』的解法。

September 18, 2026 · 3 min

SSD-LLaMA 精读:单张 RTX 5090 跑万亿参数 MoE 的 SSD 原生推理系统

港科大联合中科院深圳先进院、南科大发布 SSD-LLaMA:面向万亿参数 MoE 的 SSD 原生本地推理系统——SSD I/O 流水线优化专家投递、SSD-RAM-VRAM 三层存储动态驻留、CPU-GPU 均衡混合执行,保证每个选中专家无剪枝无替换。三大前沿 MoE 家族上 prefill 提速 1.52–4.19×、decode 提速 2.10–15.58×,单张 RTX 5090+32GB RAM 实现万亿模型 >1 token/s。本精读拆解『把带宽受限问题转化为层次调度问题』的系统设计。

September 18, 2026 · 2 min

敢把钱包交给AI吗:Agent交易爆发前夜,卡住的不是模型是信任

2026外滩大会主论坛首场圆桌,蚂蚁韩歆毅、万事达卡Jorn Lambert、OPPO刘作虎、阿里周靖人同台讨论「当Agent成为交易主体」。最真实的细节是:台上四人只有韩歆毅真让Agent付过钱——用「阿福」买了40多元坚果。行业共识是Agent交易落地比去年四季度的乐观预期慢很多,卡点不在模型,而在授权、身份(KYA)、能力评估、资金安全、可追溯五层信任基建;支付网络正为「没有银行卡的交易者」重构,流量逻辑从时长转向意图。本文梳理机制、各方立场与三个可跟踪信号。

September 18, 2026 · 1 min

大脑归基模,小脑归自己:24 岁首席科学家王家伟的具身下注

GPT-6 Astra 直接驱动机械臂刷屏、‘基模降维打击具身’之说盛行的当口,深朴智能首席科学家王家伟(24 岁,少年班—MSRA—DeepSeek—Seed 路径)给出分层答案:大脑已收敛给基模,实时可控的动作模型与场景数据闭环仍是创业公司的自留地。本文梳理他的数据性价比账、zero-shot 泛化信号与具身评估真空里的噪音辨别,并给出可迁移的判断框架。

September 17, 2026 · 2 min

Atria Dawn: The Dawn of Agentic Superintelligence 精读

上海人工智能实验室发布 744B MoE 开源 Agent 基座 Atria Dawn Preview:以 Verifiable Experience Pipeline 把训练信号锚定在可执行环境与外部可验证结果上,16 基准中 5 个登顶(Terminal-Bench 2.1 = 90.2、SWE-bench Pro = 74.7);更独特的是把自身 769 条任务记录的 R&D 过程作为人机协作案例研究——1/3 任务被人类评为无 AI 不可行。本精读覆盖可验证经验管线的设计逻辑、五榜登顶的机制根源、以及模型报告与 HAI 研究双重身份的方法论价值。

September 16, 2026 · 2 min