Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements 精读

新加坡国立大学、南方科技大学与牛津大学团队论证:在长程agent微调场景中,进化策略(ES)不只是更便宜的RL替代品,而是结构性更优的选择。Agentic ESOpt以参数空间扰动+奖励加权更新实现免反传全参优化,GPU显存与推理持平(8.41GB,比GRPO低85.7%),在可控Sudoku实验中呈现horizon-dependent crossover——H*=15时超最强GRPO 12.5个百分点;WebArena-Lite上完成27B模型全参适配(29.47%→36.16%),并支持prompt-参数协同进化。

August 20, 2026 · 3 min

ASI-Bench: At the Dawn of Artificial Superintelligence 精读

清华联合MIT、哈佛、CMU等13机构40余位专家、投入31000+工时构建ASI-Bench——首个联合评估AI创新探索与自主科研能力的基准。核心设计是在同一研究项目内渐进撤除人类方法学指导:B1给完整方法、B2只给方法名、B3需自主定方法、B4加干扰。18个agent×模型配置的评估揭示了关键瓶颈:平均分从B1的50.91骤降至B2的29.10(-21.82),而B2到B3仅再降2.48——瓶颈不在选方法而在把方法变成完整可执行研究流程的方法操作化。

August 20, 2026 · 2 min

Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents 精读

北京大学提出’本体信任’(ontological trust)这一新问题定义:长程agent的关键监督问题不是每步是否合规,而是不断演化的轨迹前缀是否仍对应用户授权的任务——漂移可以静默累积,每步都合规但整体已偏离。RGE监视器沿Role/Goal/Evidence三轴分解信任,LLM仅用于推导结构化表示,状态更新与干预决策全部确定性,输出可重放可审计的信任轨迹。在OSWorld/FinanceBench/EICU-AC跨域语料上,RGE的Drift F1超过93%且良性覆盖率≥95.8%,并实证了伪一致性检测受任务完成是否外部可见的结构性限制。

August 20, 2026 · 1 min

Bounded Agents: Delegation Security for Multi-Agent AI Systems 精读

独立研究者 Xabier Muruaga 提出 Agentic Principal Chain(APC),把提示注入的安全后果定性为授权架构问题而非模型鲁棒性问题:有外部通信工具权限的 agent 可被诱导渗出文档,没有该权限的 agent 无论注入什么都渗不出。APC 沿 principal 到 principal 的委派链跟踪会话级授权状态,用六项授权检查对照累积会话状态评估每个请求,范围与预算沿链继承且只收不扩,composition closure 拦截’每步合法但组合违禁’的动作序列,决策在模型之外强制执行。3154 实例评测显示:AgentDojo 四域渗出率 75-100%→0%,InjecAgent 全部 544 个数据窃取案例被阻断,意图绑定使破坏类攻击 38.6%→4.0%、操纵类 90.5%→12.1%,授权延迟 P99 仅 0.24ms,代价是 949 个任务-注入对上效用下降 8.6/13.9 个百分点。

August 20, 2026 · 6 min

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读

当推理能力超越人类可靠评估的范围,真值标签反而成为最稀缺的资源。Co-RL 给出的答案是:让多个不共享参数、来自不同家族的模型组成『学习共同体』,彼此用多数票伪标签互为奖励源。理论上,论文证明自奖励 RL 受 sign(p-1/2) 自确认动力学支配——错误会被系统性自我强化;而交叉监督把正确收敛盆从『每题各自 p>1/2』扩大到『pA+pB>1』,互补性可以直接兑换正确性。实验上,4 款 LLM 在 7 个纯文本基准平均提升 3.0–8.6%,5 款 VLM 在 4 个多模态基准平均提升 2.3–7.2%,Gemma-3-12B 甚至反超有真值监督的 GT-Reward。

August 20, 2026 · 7 min

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 精读

AnalogyAI 发布 FM-Bench:让 LLM agent 经营一家足球俱乐部 20 个游戏年,通过 26 个工具在约 340-400 个决策节点上转会、谈判、投资、排阵容,由确定性引擎累计出唯一终分(无 LLM judge)。基准将管理者的四大压力——隐藏信息、累积后果、反适应市场、多目标压力——全部机制化,并以 Solo(1 模型对 15 脚本)与 Arena(15 个 LLM 同世界头对头)双轨评测 15 个前沿模型。结果:claude-fable-5 以 90.94 登顶(达特权 oracle 的 95%),规模、价格、厂商均不预测排名,token 花费与得分零相关;区分模型的是管理行为——终局前削减慢回报投资、保持现金部署、提前开启续约。Arena 中联赛冠军在 10 个模型间轮换,首次游玩的人类垫底模型榜。

August 20, 2026 · 5 min

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents 精读

UIC、华盛顿大学、McGill、MBZUAI与UCLA五校联合完成首个把记忆底座(substrate)作为受控变量的统一harness评测:11类底座×3个骨干模型×4组基准×26项指标。核心发现颠覆选型直觉——没有任何底座全面称雄,QA任务的前沿(图+向量混合)与决策任务的前沿(扁平检索/精炼蒸馏)完全不相交;检索宽度k在QA上单调涨分、在决策任务上反向往下跌分,注意力探针揭示同一稀释机制在不同任务中后果相反。这为记忆系统按工作区间路由底座提供了实证基础。

August 20, 2026 · 2 min

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety 精读

UNC教堂山分校Tianlong Chen组联合UCF、密歇根州立发布HarnessRisk——首个覆盖agent harness全生命周期的安全基准:把harness安全组织为配置/能力扩展/运行时/状态持久化/动作控制/事件恢复六个运营阶段,128个沙箱案例每个配对良性用户目标与嵌入不可信工作流制品的对抗指令。14个模型-harness配置的评估揭示:攻击成功率12.6%-80.9%波动,配置阶段最脆弱,同一模型跨harness的ASR差4.3倍——安全是部署配置的属性而非模型属性,且风险识别不等于安全行动。

August 20, 2026 · 2 min

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents 精读

华为LegoX团队联合港中文发布LEGO-RL——在不修改原生编码agent harness内部控制流的前提下接入可扩展策略梯度训练。三大支柱:进程内LLM代理捕获原始生成流实现token级对齐与训练端logprob重算(即使harness压缩/重序列化上下文)、Nydus镜像缓存+分级防御抑制reward hacking、插件化校验监控+Live UI轨迹诊断。训练Qwen3.5-35B-A3B(GSPO)在三大harness上全面提升:OpenHands SDK 64.0%→70.4%、Claude Code 62.4%→68.2%、OpenCode 57.2%→66.6%,rollout-训练概率相关性保持0.99以上。

August 20, 2026 · 2 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

NUS 与牛津团队提出 OmniScientist——一个全生命周期感知驱动的全模态跨学科 AI 科学家。论文诊断现有系统的通病:workflow-complete 却 evidence-incomplete——数据经由人选择的文本/代码/标签/摘要进入 agent,科学上决定性的空间、时序、跨通道、程序性关系在接口处丢失。框架由感知层加三个自主 agent(ideation/experiment/writeup)组成,外层是确定性管线,配以 idea/rigour/claim 三重代码化检查(OpenAlex 先行检索、统计校正、数值溯源)。36 个真实数据案例覆盖 5 学科族与 4 类证据模态,Claude Sonnet 5 在全部案例完成『原始数据→编译 PDF』全流程,综合均分 6.3/10;配对盲评中感知版全 7 维占优、直接胜率 85%。机制分析显示感知系统把研究问题锚定在原始观测独有属性上——这是文本接口系统原则上无法到达的假设空间。

August 20, 2026 · 5 min