Agentic Transaction: Towards ACID-Compliant Agent Systems 精读

清华大学Guoliang Li数据库组提出“智能体事务”概念——把数据库五十年的ACID正确性理论重释为agent执行语义:原子性=置信度引导的原子语义事务单元(探索→只读执行→append-only执行→一致性校验→提交/重试)、一致性=置信度驱动的证据整合、隔离性=依赖感知的子agent隔离调优(独立/协作/竞争三档)、持久性=仅追加工作区记忆演化。配套开源ACID-Agent框架并给出面向agent全生命周期的开放问题清单。这是“用数据库理论为agent可靠性提供形式化骨架”的问题定义级工作——把agent失败从“提示工程问题”重新定义为“正确性问题”。

August 19, 2026 · 1 min

ClawGym II: Exploring Black-Box RL on Agent Harness 精读

人大高瓴AI学院与IQuest Research联合提出首个面向复杂agent harness的黑盒RL统一框架:用临时沙盒把任务环境与harness整体隔离包装(对训练侧完全黑盒),以忠实轨迹恢复机制从沙盒遥测中重建树状执行轨迹并回传环境奖励,使PPO/GRPO能稳定优化“harness+模型”整体。在OpenClaw与Claude Code两种结构迥异的harness上验证:30A3B骨干较初始策略分别+9.98/+14.81分,超SFT基线5.80分,PinchBench外部迁移87.32;训练在200-400步内保持稳定,且首创混合harness联合训练——单一模型在两种harness上持平甚至超过各自单独训练版。配套发布ClawGym-Bench(六域)与PinchBench双评测体系。

August 19, 2026 · 2 min

HarnessEval-W: Agentifying the Evaluation of Visual Worlds 精读

北大、清华、上海AI Lab等机构30余位作者联合提出HarnessEval-W,把LLM生态的harness范式首次引入世界模型基准测试:父Agent解释每个评测案例的语境并路由到技能库(记录激活与跳过理由),技能把问题分解为可测子问题、交给配备诊断工具的专职子Agent,证据经校验后聚合为分数——每次评测产出一棵可回溯到具体子问题与工具证据的证据树。在330案例×18个世界模型上,与5000次人类A/B判断拟合的Bradley-Terry排序对比达Spearman 0.93(Intentional)/0.87(Physical);对照最接近的WBench协议,Physical成对准确率从31.9%提至71.7%、平局率从52.2%降至1.8%。榜单揭示:Seedance 2.0综合75.5居首,视频生成器改造为世界模型会重新分配能力而非均匀提升。

August 19, 2026 · 2 min

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills 精读

上海AI Lab联合上交大、西工大、复旦、浙大提出JailbreakSkill——技能中心的自动化红队框架:把攻击策略沉淀为结构化技能资产(SKILL.md+脚本+引用三件套),两阶段循环中Stage 1用风险条件化UCB规划器在16个初始技能中路由排序(每次攻击选性价比最高的技能先试),Stage 2以失败记忆驱动技能进化(精修/组合/发现新技能,准入标准为救回至少一个未解行为)。在AdvBench/HarmBench上macro-ASR@10达72.0%/68.1%(16个模型-基准设置的13个第一),平均查询成本AQC 4.14/4.63为全场最低;随机路由消融使ASR掉8.1pp验证风险条件化排序的价值。攻击能力随使用单调增长——红队从一次性脚本进化为可复利资产。

August 19, 2026 · 2 min

Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search 精读

UCL Jun Wang组联合五机构提出大发现模型(LDM)v0.1:把LLM生成器与贝叶斯非参奖励代理耦合为循环架构——生成器提出/精修候选设计,代理预测性能并量化认知不确定性,不确定性感知价值函数统一引导生成、精修与昂贵实验评估的选择,每次新观测同步更新发现记忆与代理。在三个昂贵黑盒域验证:AutoResearch神经网络训练搜索的验证BPB降幅是LLM-only反思的2.4倍(0.0727 vs 0.0301);抗体CDRH3设计200步后结合能低18.2%(-104.7±1.0 vs -91.1±3.2);分子多目标优化Pareto超体积较LLM-only/经典BO分别+62.4%/+63.1%。论文把推理时扩展从“廉价可重复验证器”域推广到“昂贵、噪声、稀疏反馈”的科学发现域。

August 19, 2026 · 2 min

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures 精读

中科院计算网络中心联合清华、阿里通义等七机构发布LongRCA Bench——首个面向长时程Agent失败“责任角色归属+精确根因定位”双任务基准:1140条来自SWE-bench Pro/Terminal Bench 2等五域的真实失败轨迹(中位145步、无注入错误、人工独立标注责任角色与最早决定性根因步骤)。配套提出训练无关的RCTA方法(分段摘要检索候选错误步→回溯更早handoff指令),达责任角色准确率51.1%、精确根因步骤24.1%——而最强基线仅13.2%。论文揭示:决定性错误远早于失败显现(中位根因到终点126步),角色与根因是两个独立预测目标,且“被修复的中间错误不应被选为根因”的标注准则把诊断与告警区分开来。

August 19, 2026 · 1 min

SA-MRPO: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization 精读

UCSD联合五机构提出SA-MRPO——多奖励RL后训练的饱和感知优势重加权:针对固定标量化+组标准化的两大缺陷(奖励轮廓不同的rollout获得相同优势;已饱和目标仍按固定权重占用梯度预算),按每个奖励维度的实时饱和度自适应重加权,使梯度流向“还有提升空间的未竟目标”。Qwen2.5-7B三目标设置下15项基准对比12项超GDPO(AIME24 +5.0pp、MATH500 +3.5pp);自适应推理设置平均准确率+3.8且响应更短;代码基准Codeforces从10.6%升至12.9%。机制本质:把优化预算从“维持已会技能”重新分配到“攻克未会技能”。

August 19, 2026 · 2 min

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling 精读

四位独立研究者(含 UT Austin 张satz Atlas 王)在不改模型权重的前提下,用 YAML 状态机运行时 StateM 把 GPT-5.5 在 Terminal-Bench 2.1 上从 83.1% 拉到 92.1%,冻结迁移到 GPT-5.6 Sol 达 95.28% raw,把 DeepSeek-V4-Flash 适配到 88.09% 而最终评测成本仅约 15 美元——对照 GPT 参考运行的 574.68 美元。论文提出 harness scaling 作为与 model scaling 正交的能力轴:把可变状态外置、以状态为上下文与契约双重边界、用受检转换取代 agent 自证完成,将失败分类为认知缺口/程序记忆缺口/程序遵从缺口三类并逐一施加控制点。负迁移分析(RefactorBench -2.78 分)进一步证明控制必须挂在正确的执行边界上。

August 19, 2026 · 3 min

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks 精读

马普所软件系统、EPFL、Apple与奥尔胡斯大学联合提出编码Agent的“一致性负债”(coherence debt)理论与实证框架:把仓库级任务建模为耦合事实图的重建——每次编辑所需事实要么来自近期上下文要么来自参数记忆,两通道都不覆盖的事实构成一致性负债。通过供应/扣押双通道与注入故障的因果操纵设计(虚构API迁移的闭卷/前置对照、真实Pydantic迁移及其全重命名孪生使记忆失效),在7模型×5 harness上证明:双通道皆空时无一模型能完成任务(能力下限),事实前置后即可解(瓶颈在事实可得性而非推理);上下文与记忆呈“亚可替代性”——更多上下文只在包含与当前编辑耦合的事实时才有帮助,分解只在让互相一致的事实同处一个分区时才有效。

August 19, 2026 · 1 min

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations 精读

腾讯Hy Frontier Team发布UI-Mate——开源权重GUI基础Agent及配套训练栈:闭环数据引擎(任务生成→环境构建→rollout→过滤→能力分层均衡)驱动SFT+在线RL;交互侧用上下文示范解决“同一指令多次运行漂移”问题——OSWorkerBench提供33个同任务自示范与45个变体任务人录示范配对,附进度清单harness把示范转化为里程碑-子任务结构。OSWorld-Verified上UI-Mate-27B达77.0%超Kimi-K2.6(73.1%)与Qwen3.7-Plus(73.3%)、逼近Claude Opus 4.8(83.4%);33任务自示范子集上单个示范使严格成功率17.2%→35.4%、进度67.9%→81.1%——示范把开放式意图消歧转化为对齐示例。

August 19, 2026 · 2 min