SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness 精读

NVIDIA 联合 NTU/MIT 提出 SoL-Pi:把编码智能体 harness 的效率改进本身建模为跨环境搜索问题,用约 150 个方向、500 个环境、3000+ 次实验、60000+ 次交互的自动研究漏斗,筛选出 Action Fusion、Online Context Compact、ObservationPack、Evidence-Preserving Reducer 四个可复用机制,EdgeBench 上 token 流量降 44.7–49.0%、成本省 1/3 且性能持平,迁移到未见过的 Opus 5 后端仍保留 94.3% 性能。这是 RSI(递归自改进)从’改模型’转向’改脚手架’的代表性工作。

September 19, 2026 · 3 min

【每日AI前沿追踪】2026年09月18日 核心技术与产业动态速递

昨日双主线:递归自我改进(RSI)从论文走向产业——智谱 Infra Agent 在 10 万国产加速器上两周将 GLM-5.3-Flash 吞吐提升 3 倍,DeepMind Dream-RSI 冻结权重只改进探索策略最多省 162 倍调用;Agent 安全研究爆发——OpenAI 首发模型失准披露框架(6 起事故),腾讯流行病学失控模型、UW 基准投毒攻击、CHASE 反事实评测同日上线。结构化决策模型 Jev 开辟新品类;Mozilla 报告称开源权重仅落后前沿 4 个月、中国模型占 OpenRouter token 45%。论文侧 LimiX-2 表格基础模型登顶 TabArena(Elo 1935)、ScienceIDE 把全球科学代码库变成 Agent 训练环境、SP3O 发现 PPO 价值平坦化失败模式。

September 18, 2026 · 11 min

ActionPiece 精读:用『物理秩一致性』拯救动作 tokenization 的关系保真

华中科大×DeepCybo 等七机构联合提出 ActionPiece:自回归 VLA 模型的动作 tokenizer 传统上只用 MSE 评估重建精度,但点态误差小不等于关系保真——压缩后『不同情境所需的差异化动作』可能被压缩、扭曲甚至反转。论文提出 Physical Rank Consistency(PRC)度量局部物理距离排序的保持,并通过对表示学习与量化的联合监督(物理秩保持+量化正则)让离散 token 保留连续动作空间的局部序结构。同一 Qwen3-VL-4B 策略训练设置下:LIBERO 94.8%、未见 LIBERO-Plus 68.8%、SimplerEnv 71.9%。

September 18, 2026 · 2 min

Agent 安全四重奏精读:TrustPoison、Collective Loss of Control、CHASE 与 First Token Matters

同一日上线的四篇 Agent 安全论文构成完整攻防图景:UW×Georgetown 把 Thompson 1984 编译器后门攻击移植到自我修改编码 Agent(投毒自评基准即可诱导后代禁用 HTTPS 验证,且污染跨代持续);腾讯朱雀实验室用流行病学建模多智能体失控(注入后伤害 0-5%→40-95%,隐式 Docker 通信路径验证传染通路);中科院×NUS 的 CHASE 用反事实约束生成治理 benchmark 作弊的 harness 进化;哈工大发现推理模型拒绝信号在第一个生成 token 处崩塌(ORC)并用单 token 安全锚修复。四篇合并精读,看懂 Agent 安全的攻击面全景。

September 18, 2026 · 3 min

Agora: Git as Shared Memory for Collective AutoResearch 精读

NVIDIA 提出 Agora:把多个自主科研 Agent 的协作记录为 Git 上的 append-only DAG——每个结果/假设/验证都是可 checkout 重跑的不可变 commit。首次持续运行 12 天:13 个无任务分配、无中央规划器的 LLM worker 在权重迁移难题上发布 1,703 项贡献,把评估器从 3.39 推到 1.899 bits/byte,弥合与训练版 GPT-2 差距的 62%;获胜配方 145-commit 谱系跨 15 个账户、165 次独立复现零失败。集体智能不靠规划器,靠记忆基础设施——本精读拆解其设计。

September 18, 2026 · 2 min

ComPO 零阶偏好对齐 与 SpectralShift 线性注意力长上下文扩展 精读(二重奏)

两篇训练方法学论文合并精读。UC Berkeley×NYU×阿里达摩院的 ComPO 提出 LLM 偏好对齐的零阶范式:不在偏好对上直接优化可微损失,而是用 comparison oracle 提取方向信息——规避 DPO 类方法在低似然边际对上的 likelihood displacement 失效,五个模型家族上改进含长度控制胜率,并给出收敛与性能保证。人大高瓴×MSRA 的 SpectralShift 从转移矩阵谱视角重新审视 Gated DeltaNet 的长上下文扩展:慢谱带宽度决定长程检索、快衰减模式负责状态清理,重参数化 alpha 投影初始化+学习率缩放即可让 10B 模型 8K→128K 课程扩展持续增益(RULER 64K +4.2)。

September 18, 2026 · 2 min

EvoSkill-GUI 精读:技能不是静态文档,而是能自我修订的活知识

浙大×电子科大提出 EvoSkill-GUI:现有 Agent 技能框架把技能当部署前写好的静态文档,但 GUI 环境的弹窗、延迟加载、控件迁移让静态技能迅速过期。EvoSkill 把技能做成结构化多文件包(检索元数据+可执行计划+备份定位+失败恢复规则+失败案例),通过 reflect-revise-reuse 循环在部署时从执行反馈中持续修订,全程零训练。Mobile-World/AndroidWorld/OSWorld 三大基准最大增益 +16.2%/+6.0%/+10.5%,进化出的技能库还能反哺相关任务。

September 18, 2026 · 2 min

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence 精读

Stable AI 与清华大学联合发布 LimiX-2,用「上下文机制网络(CMN)」范式重新定义表格基础模型:预训练目标从 PFN 的『预测指定标签列』改为 CCMM 的『对任意掩码列做联合分布建模』,让每个样本内所有列都成为监督源。在 TabArena 上以 Elo 1935 领先第二名 TabFM+ 117 分、参数量却只有对方四分之一,还意外获得了因果骨架恢复能力。本精读拆解其『从预测标签到建模机制』的范式转移、SCM 合成数据引擎设计,以及这一思路对结构化数据智能的普适意义。

September 18, 2026 · 3 min

ProgramDistill 精读:从交互式 Web 应用逆向蒸馏可验证的 SWE 任务基准

KAIST × Microsoft Research Montréal 发布 ProgramDistill:现有 SWE 基准用 issue 文本规定行为,但真实 Web 开发中 Agent 需要从能运行的参考应用反推行为并实现到残缺应用里。mine-craft-patch 流水线把 26 个交互式应用因子化为特性,经 gold patch 回放验证产出 1,975 个可回放行为、4,063 个任务,全程零人工。9 个前沿编码 Agent 评测:GPT-6 Astra 全应用重建 49.2%、Opus 5 28.8%;恢复深度从 1 到 8,成功率从 100%→64% 崩落——难度首次可参数化调控。

September 18, 2026 · 2 min

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 精读

上海AI Lab 联合上海交大、西湖大学等七校发现 PPO 在 LLM 强化学习中的系统性失效——『价值平坦化』:蒙特卡洛估计的状态价值在响应内剧烈变化,critic 预测却近乎水平线。诊断出两大根因(MSE 隐含方差惩罚+相邻状态冗余更新)后提出 SP3O:每条响应只监督 3 个位置分离的锚点。数学推理 +7.97pp、OOD +7.33pp,K=3 优于 K=64,越稀疏越好——一个『少即是多』的教科书式发现。

September 18, 2026 · 3 min