SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

当高质量人类文本接近耗尽,LLM 训练的瓶颈正转移到『训练环境的供给』上。SPADE 让一个 LLM 同时扮演环境设计者与推理智能体两个角色:设计者把完整的长程可执行环境写成带 reset()/step() 接口的 Python MDP 代码,并用『有提示与无提示奖励差』这一 hint-based regret 信号被 RL 训练,从而持续瞄准学习者能力边界出题。在 30B 规模上,SPADE 在八个 held-out 基准上平均超过最强固定环境基线 +5.3,工具使用场景 BFCL v4 多轮 +5.7、ACEBench-Agent +13.9。这篇精读拆解它的双角色自博弈机制、regret 信号设计、语料接地与环境记忆两大组件,以及为什么『把环境设计变成可学习组件』可能改写 agentic RL 的 scaling 逻辑。

August 20, 2026 · 6 min

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents 精读

哈佛大学联合Raycaster AI、斯坦福等机构提出StagedWorkspace——为知识工作agent建立版本化工作区。论文形式化workspace-state contract概念:agent检索的解析视图、编辑的原生文件、审阅的diff、提交的制品可能指向同一工作产物的不同版本,这是PDF/表格/幻灯片等非代码制品长期缺乏的契约。内容哈希绑定使视图与版本显式关联,OfficeQA Pass@1提升8.3-12.1点,SW-AGENT用Gemini 3.1 Pro达OfficeQA 63.9%(同模型已发表分数仅29.3%),证明工作区状态是被忽视的实验变量。

August 20, 2026 · 2 min

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows 精读

字节跳动Seed联合南京大学发布StartupBench——首个从市场验证的AI创业产品反推任务的E2E agent基准。方法论颠覆在于任务来源:不是研究者预设什么能力重要,而是系统研究哪些AI产品已被真实付费采用,把其工作流翻译为六领域(医疗/金融/法律/管理/STEM/教育)多格式交付任务,以细粒度rubric评分。结果揭示’高分低完成’剪刀差:Kimi-K3平均73.67%但严格达标完成率仅29.55%,无模型超1/3——瓶颈已从执行工作流转移到稳定产出可直接商用的交付物。

August 20, 2026 · 2 min

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读

阿里云端云智能计算团队发布Wuying-Browser-Agent——开源长程浏览器agent新SOTA(WebVoyager 80.6%、Online-Mind2Web 66.7%、自建BrowserBench 65.1%)。核心论点是’对齐每一层’而非单点规模:结构化浏览器harness提供稳定执行原语、RUIC-SFT显式训练错误恢复轨迹(仅用成功数据的SFT只能恢复8.5%的错误步骤)、DAO-GRPO用势函数奖励塑形+发散感知步加权解决长程功劳分配,并发布双语真实网页基准BrowserBench(350任务均37.9步)。

August 20, 2026 · 2 min

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读

清华大学 AIR 团队提出 Zetta,一个能在部署时自我进化的闭环具身智能框架:冻结 VLA 基座策略不动,用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行,配合三时间尺度进化循环(动作级治理、批次级失败诊断修复、验证门控技能晋升)与专用推理基建 Z-Infra,在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%,在 RoboCasa 18 任务上从 73.56% 提升到 93.56%,推理延迟较 RPent 降低 91%,并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。

August 20, 2026 · 8 min

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA 精读

Intellifusion(云天励飞)技术报告:验证通用代码Agent能否在无任何手写CUDA的前提下产出SOTA GPU内核。在Houmao多Agent编排框架中构建“正确性门控”的内核优化工作流——人类仅做编排(定义流程、强制正确性与反作弊约束、提供关键参考、卡住时重定向搜索),完全不审阅内核代码;起点仅为PyTorch参考实现+工作负载定义+基准命令+紧凑CUDA优化技能集。约19亿agent token在NVIDIA B200上产出:Fused MoE加速92.68×(FlashInfer库为47.08×)、DSA TopK 1101.02×(FlashInfer 52.03×)、DSA Sparse Attention 181.35×(FlashInfer 10.33×);MLSys 2026 FlashInfer竞赛官方评测中Fused MoE内核1.71×超FlashInfer基线并超过agent-assisted赛道第一名(1.68×)。

August 19, 2026 · 2 min

Agentic Transaction: Towards ACID-Compliant Agent Systems 精读

清华大学Guoliang Li数据库组提出“智能体事务”概念——把数据库五十年的ACID正确性理论重释为agent执行语义:原子性=置信度引导的原子语义事务单元(探索→只读执行→append-only执行→一致性校验→提交/重试)、一致性=置信度驱动的证据整合、隔离性=依赖感知的子agent隔离调优(独立/协作/竞争三档)、持久性=仅追加工作区记忆演化。配套开源ACID-Agent框架并给出面向agent全生命周期的开放问题清单。这是“用数据库理论为agent可靠性提供形式化骨架”的问题定义级工作——把agent失败从“提示工程问题”重新定义为“正确性问题”。

August 19, 2026 · 1 min

ClawGym II: Exploring Black-Box RL on Agent Harness 精读

人大高瓴AI学院与IQuest Research联合提出首个面向复杂agent harness的黑盒RL统一框架:用临时沙盒把任务环境与harness整体隔离包装(对训练侧完全黑盒),以忠实轨迹恢复机制从沙盒遥测中重建树状执行轨迹并回传环境奖励,使PPO/GRPO能稳定优化“harness+模型”整体。在OpenClaw与Claude Code两种结构迥异的harness上验证:30A3B骨干较初始策略分别+9.98/+14.81分,超SFT基线5.80分,PinchBench外部迁移87.32;训练在200-400步内保持稳定,且首创混合harness联合训练——单一模型在两种harness上持平甚至超过各自单独训练版。配套发布ClawGym-Bench(六域)与PinchBench双评测体系。

August 19, 2026 · 2 min

HarnessEval-W: Agentifying the Evaluation of Visual Worlds 精读

北大、清华、上海AI Lab等机构30余位作者联合提出HarnessEval-W,把LLM生态的harness范式首次引入世界模型基准测试:父Agent解释每个评测案例的语境并路由到技能库(记录激活与跳过理由),技能把问题分解为可测子问题、交给配备诊断工具的专职子Agent,证据经校验后聚合为分数——每次评测产出一棵可回溯到具体子问题与工具证据的证据树。在330案例×18个世界模型上,与5000次人类A/B判断拟合的Bradley-Terry排序对比达Spearman 0.93(Intentional)/0.87(Physical);对照最接近的WBench协议,Physical成对准确率从31.9%提至71.7%、平局率从52.2%降至1.8%。榜单揭示:Seedance 2.0综合75.5居首,视频生成器改造为世界模型会重新分配能力而非均匀提升。

August 19, 2026 · 2 min

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills 精读

上海AI Lab联合上交大、西工大、复旦、浙大提出JailbreakSkill——技能中心的自动化红队框架:把攻击策略沉淀为结构化技能资产(SKILL.md+脚本+引用三件套),两阶段循环中Stage 1用风险条件化UCB规划器在16个初始技能中路由排序(每次攻击选性价比最高的技能先试),Stage 2以失败记忆驱动技能进化(精修/组合/发现新技能,准入标准为救回至少一个未解行为)。在AdvBench/HarmBench上macro-ASR@10达72.0%/68.1%(16个模型-基准设置的13个第一),平均查询成本AQC 4.14/4.63为全场最低;随机路由消融使ASR掉8.1pp验证风险条件化排序的价值。攻击能力随使用单调增长——红队从一次性脚本进化为可复利资产。

August 19, 2026 · 2 min