LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence 精读

Stable AI 与清华大学联合发布 LimiX-2,用「上下文机制网络(CMN)」范式重新定义表格基础模型:预训练目标从 PFN 的『预测指定标签列』改为 CCMM 的『对任意掩码列做联合分布建模』,让每个样本内所有列都成为监督源。在 TabArena 上以 Elo 1935 领先第二名 TabFM+ 117 分、参数量却只有对方四分之一,还意外获得了因果骨架恢复能力。本精读拆解其『从预测标签到建模机制』的范式转移、SCM 合成数据引擎设计,以及这一思路对结构化数据智能的普适意义。

September 18, 2026 · 3 min

ProgramDistill 精读:从交互式 Web 应用逆向蒸馏可验证的 SWE 任务基准

KAIST × Microsoft Research Montréal 发布 ProgramDistill:现有 SWE 基准用 issue 文本规定行为,但真实 Web 开发中 Agent 需要从能运行的参考应用反推行为并实现到残缺应用里。mine-craft-patch 流水线把 26 个交互式应用因子化为特性,经 gold patch 回放验证产出 1,975 个可回放行为、4,063 个任务,全程零人工。9 个前沿编码 Agent 评测:GPT-6 Astra 全应用重建 49.2%、Opus 5 28.8%;恢复深度从 1 到 8,成功率从 100%→64% 崩落——难度首次可参数化调控。

September 18, 2026 · 2 min

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 精读

上海AI Lab 联合上海交大、西湖大学等七校发现 PPO 在 LLM 强化学习中的系统性失效——『价值平坦化』:蒙特卡洛估计的状态价值在响应内剧烈变化,critic 预测却近乎水平线。诊断出两大根因(MSE 隐含方差惩罚+相邻状态冗余更新)后提出 SP3O:每条响应只监督 3 个位置分离的锚点。数学推理 +7.97pp、OOD +7.33pp,K=3 优于 K=64,越稀疏越好——一个『少即是多』的教科书式发现。

September 18, 2026 · 3 min

ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments 精读

AItonomy 基金会联合 Oxford、Berkeley、Stanford 等 25 家机构发布 ScienceIDE:把全球科学代码库(PLUTO、Athena++、MITgcm 等天体物理/等离子体/海洋模拟器)改造成 64 个可执行环境、2,812 个经验证任务、1,076 项数值检查的 Agent 训练基础设施。ScienceIDE-Hard 上 15 个前沿模型横评显示 Claude Fable 5.1 仅 67.1%——科学代码仍是 Agent 洼地;而用验证轨迹 SFT 小模型,修复奖励最多 +33 分且正向迁移到 HumanEvalFix/BBH 等通用基准。本精读拆解『环境即基础设施』的设计哲学与『科学经验 bottleneck』的解法。

September 18, 2026 · 3 min

SSD-LLaMA 精读:单张 RTX 5090 跑万亿参数 MoE 的 SSD 原生推理系统

港科大联合中科院深圳先进院、南科大发布 SSD-LLaMA:面向万亿参数 MoE 的 SSD 原生本地推理系统——SSD I/O 流水线优化专家投递、SSD-RAM-VRAM 三层存储动态驻留、CPU-GPU 均衡混合执行,保证每个选中专家无剪枝无替换。三大前沿 MoE 家族上 prefill 提速 1.52–4.19×、decode 提速 2.10–15.58×,单张 RTX 5090+32GB RAM 实现万亿模型 >1 token/s。本精读拆解『把带宽受限问题转化为层次调度问题』的系统设计。

September 18, 2026 · 2 min

XConf(Confidence Comes from Experience)与 Not All Agents Are Equal 精读:Agent 可信性的两翼

本篇合并精读两篇互补的 Agent 可信性研究:剑桥×Google DeepMind 的 XConf 提出『置信度不该只看当前推理,还要检索自身历史经验』——Recall 相似任务的过往胜率、Reflect 命名复发失败模式后重述置信度,以 1/10 成本在 24 组对比中 23 组追平/超越 10-sample 自一致性,弃答最不确定 10% 换来 Agent 成功率最高 +8.7 分;德州理工的 Not All Agents Are Equal 则用 37,623 个溯源 PR 首次大规模量化『AI 编码 Agent 的代码落地后发生了什么』——Codex 的 revert 率只有人类一半、Devin 反而更高,质量差异是厂商特定的而非『AI 代码更差』的笼统印象。

September 18, 2026 · 3 min

After the Party: Growth, Governance, and Security Scanning in the OpenClaw Agent Skill Ecosystem 精读

OpenClaw 技能注册表 91 天近翻倍(33,399→65,175)后热潮退去,留下什么治理遗产?Monash 大学的三快照纵向研究给出冷峻答案:下载量 Top10% 占 46.93%(Gini 0.528);77.86% 的 skill 零星标零评论,但 85.06% 携带特权证据(shell 执行 58.08%)——4.2 万个零审查特权工件;7 个基线元数据关联在 pre-cutoff 队列 0/7 存活、下载量关联符号反转;三大安全扫描器对 23,702 个 skill 互相分歧,人工裁决参考标准下灵敏度仅 21.67%-61.06%。‘派对之后,账单由治理信号从未被验证过的注册表支付’——Goodhart 定律的 skill 生态版。

September 17, 2026 · 2 min

Agentic Societies Need a Social Harness 精读

当不同主人的 AI 智能体开始自主协作,会发生什么?华盛顿大学的系统实验给出冷峻答案:即使全部诚实的 agent 也会因上下文分裂与信道争用大量失败(7 人群组排程成功率最低 0%),恶意 agent 凭’言论’即可让欺骗攻击 100% 成功、日历侧信道 100% 泄露。论文提出五层 Social Harness 协议栈(身份→有序通信→个人防火墙→协作规范→社会机构),把人类社会协作的制度智慧移植为 agent 社会基础设施。本精读覆盖’诚实 agent 也失败’的失败解剖与’协议栈防类别性失败’的设计哲学。

September 17, 2026 · 3 min

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries 精读

SWE-bench Verified 榜首之争还是能力之争吗?对 254 个公开提交的逐实例审计给出否定答案:Top10 系统 500 题中 285 题全对、51 题全错,仅 164 题有区分力;29 对相邻排名精确 McNemar 检验 0 对可分;同模型换 scaffold 分差可达 29.8pp 而前十总差距仅 8.8pp。论文提出 n_eff 有效规模、对基线嵌套系数两个新构造,证明’解集嵌套’是分辨率丧失的机制,并给出五步审计协议与修复方案(报 n_eff、记录 model×scaffold、发布 tier、按不一致预算纳新题)——对一切正在构建内部评测选型基准的团队有直接方法论价值。

September 17, 2026 · 3 min

Continual Learning Mechanisms Compose for Long-Horizon Memorization 精读

让模型依次学 100 个知识任务且不留旧例、不给任务 ID——‘长程记忆化’设定下,任何单一持续学习机制都崩盘(保留率普遍个位数)。Johns Hopkins 的系统学研究证明机制要’组合’:锚点类型(data 复演/function 蒸馏/权重正则——保留什么)×低秩分配(merged LoRA——保留在哪)两维设计,任务级逐次减半搜索组合空间+因子实验量化交互。最优组合(三锚点+merged LoRA)把最终保留率从 1.2% 拉到 34.9%(28 倍),且 data 锚点×merged LoRA 在三个数据集上一致超可加——遗忘来源互补,组合解决结构问题。HF 日榜 281 赞当日第一。

September 17, 2026 · 2 min