SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

上海创新研究院与复旦大学联合发布 SWE-bench Science:覆盖 20 个科学领域、98 个真实仓库的 119 个任务,以 Issue 驱动、专家探索、工程集成三种范式考察 coding agent 在科学软件上的真实修复能力,并用隐藏预言机与反校准协议狙击伪修复。结果所有最强 agent 的 Pass@1 均不足 50%,四类失败机制归因与科学信息双向消融揭示了科学知识与代码推理交织处的深层瓶颈。

August 22, 2026 · 3 min

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See 精读

当低资源语言推理微调只被一个准确率数字评判时,我们到底在测什么?Sophea AI 在三家 MoE、四个模型上用 11.8 万行希腊语语料做 SFT 与 RLVR 实验,发现最佳微调 arm 76.5 分竟低于基线 77.2 分,而随机种子的噪声地板高达 7.7 分——翻译基准准确率被训练噪声主导,几乎不携带信息。改用六维行为度量后结论完全翻转:SFT 让 98% 推理轨迹切换为问题语言、token 省 3 倍;RLVR 把格式违规从 24% 修到 2.5%、答案泄漏清零,且希腊语思考习惯 98.2% 保真。一篇把 null 结果写成方法学的罕见论文。

August 22, 2026 · 4 min

Agent Lightning v1.0: Towards Harnessed Agentic RL 精读

微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0,首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时,训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战,以约3500行代码给出参考实现,仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%(+14.6个百分点),并公开完整数据清洗管线与防reward hacking脚手架。

August 20, 2026 · 3 min

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements 精读

新加坡国立大学、南方科技大学与牛津大学团队论证:在长程agent微调场景中,进化策略(ES)不只是更便宜的RL替代品,而是结构性更优的选择。Agentic ESOpt以参数空间扰动+奖励加权更新实现免反传全参优化,GPU显存与推理持平(8.41GB,比GRPO低85.7%),在可控Sudoku实验中呈现horizon-dependent crossover——H*=15时超最强GRPO 12.5个百分点;WebArena-Lite上完成27B模型全参适配(29.47%→36.16%),并支持prompt-参数协同进化。

August 20, 2026 · 3 min

ASI-Bench: At the Dawn of Artificial Superintelligence 精读

清华联合MIT、哈佛、CMU等13机构40余位专家、投入31000+工时构建ASI-Bench——首个联合评估AI创新探索与自主科研能力的基准。核心设计是在同一研究项目内渐进撤除人类方法学指导:B1给完整方法、B2只给方法名、B3需自主定方法、B4加干扰。18个agent×模型配置的评估揭示了关键瓶颈:平均分从B1的50.91骤降至B2的29.10(-21.82),而B2到B3仅再降2.48——瓶颈不在选方法而在把方法变成完整可执行研究流程的方法操作化。

August 20, 2026 · 2 min

Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents 精读

北京大学提出’本体信任’(ontological trust)这一新问题定义:长程agent的关键监督问题不是每步是否合规,而是不断演化的轨迹前缀是否仍对应用户授权的任务——漂移可以静默累积,每步都合规但整体已偏离。RGE监视器沿Role/Goal/Evidence三轴分解信任,LLM仅用于推导结构化表示,状态更新与干预决策全部确定性,输出可重放可审计的信任轨迹。在OSWorld/FinanceBench/EICU-AC跨域语料上,RGE的Drift F1超过93%且良性覆盖率≥95.8%,并实证了伪一致性检测受任务完成是否外部可见的结构性限制。

August 20, 2026 · 1 min

Bounded Agents: Delegation Security for Multi-Agent AI Systems 精读

独立研究者 Xabier Muruaga 提出 Agentic Principal Chain(APC),把提示注入的安全后果定性为授权架构问题而非模型鲁棒性问题:有外部通信工具权限的 agent 可被诱导渗出文档,没有该权限的 agent 无论注入什么都渗不出。APC 沿 principal 到 principal 的委派链跟踪会话级授权状态,用六项授权检查对照累积会话状态评估每个请求,范围与预算沿链继承且只收不扩,composition closure 拦截’每步合法但组合违禁’的动作序列,决策在模型之外强制执行。3154 实例评测显示:AgentDojo 四域渗出率 75-100%→0%,InjecAgent 全部 544 个数据窃取案例被阻断,意图绑定使破坏类攻击 38.6%→4.0%、操纵类 90.5%→12.1%,授权延迟 P99 仅 0.24ms,代价是 949 个任务-注入对上效用下降 8.6/13.9 个百分点。

August 20, 2026 · 6 min

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读

当推理能力超越人类可靠评估的范围,真值标签反而成为最稀缺的资源。Co-RL 给出的答案是:让多个不共享参数、来自不同家族的模型组成『学习共同体』,彼此用多数票伪标签互为奖励源。理论上,论文证明自奖励 RL 受 sign(p-1/2) 自确认动力学支配——错误会被系统性自我强化;而交叉监督把正确收敛盆从『每题各自 p>1/2』扩大到『pA+pB>1』,互补性可以直接兑换正确性。实验上,4 款 LLM 在 7 个纯文本基准平均提升 3.0–8.6%,5 款 VLM 在 4 个多模态基准平均提升 2.3–7.2%,Gemma-3-12B 甚至反超有真值监督的 GT-Reward。

August 20, 2026 · 7 min

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 精读

AnalogyAI 发布 FM-Bench:让 LLM agent 经营一家足球俱乐部 20 个游戏年,通过 26 个工具在约 340-400 个决策节点上转会、谈判、投资、排阵容,由确定性引擎累计出唯一终分(无 LLM judge)。基准将管理者的四大压力——隐藏信息、累积后果、反适应市场、多目标压力——全部机制化,并以 Solo(1 模型对 15 脚本)与 Arena(15 个 LLM 同世界头对头)双轨评测 15 个前沿模型。结果:claude-fable-5 以 90.94 登顶(达特权 oracle 的 95%),规模、价格、厂商均不预测排名,token 花费与得分零相关;区分模型的是管理行为——终局前削减慢回报投资、保持现金部署、提前开启续约。Arena 中联赛冠军在 10 个模型间轮换,首次游玩的人类垫底模型榜。

August 20, 2026 · 5 min

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents 精读

UIC、华盛顿大学、McGill、MBZUAI与UCLA五校联合完成首个把记忆底座(substrate)作为受控变量的统一harness评测:11类底座×3个骨干模型×4组基准×26项指标。核心发现颠覆选型直觉——没有任何底座全面称雄,QA任务的前沿(图+向量混合)与决策任务的前沿(扁平检索/精炼蒸馏)完全不相交;检索宽度k在QA上单调涨分、在决策任务上反向往下跌分,注意力探针揭示同一稀释机制在不同任务中后果相反。这为记忆系统按工作区间路由底座提供了实证基础。

August 20, 2026 · 2 min