Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读

清华大学 AIR 团队提出 Zetta,一个能在部署时自我进化的闭环具身智能框架:冻结 VLA 基座策略不动,用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行,配合三时间尺度进化循环(动作级治理、批次级失败诊断修复、验证门控技能晋升)与专用推理基建 Z-Infra,在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%,在 RoboCasa 18 任务上从 73.56% 提升到 93.56%,推理延迟较 RPent 降低 91%,并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。

August 20, 2026 · 8 min

从烧钱竞赛到精打细算:一个Token重度用户的Agent进化史

硅谷101对话黄东旭与张宏江:当Uber四个月烧穿全年AI预算、Meta给员工设token上限,“Token Maxing"的烧钱竞赛到达转折点。亲历者黄东旭讲述自己从日烧四五百美元的最强模型依赖,转向本地DeepSeek V4 Flash加云端Fable 5的混布组合;这场从token maxing到token efficient的转向,本质是模型能力跨过工程化门槛后,成本结构与企业KPI的重算。张宏江判断AGI奇点已至,而更深的分歧在于:单模型智商碾压与多agent蜂群,谁是终局。

August 20, 2026 · 1 min

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA 精读

Intellifusion(云天励飞)技术报告:验证通用代码Agent能否在无任何手写CUDA的前提下产出SOTA GPU内核。在Houmao多Agent编排框架中构建“正确性门控”的内核优化工作流——人类仅做编排(定义流程、强制正确性与反作弊约束、提供关键参考、卡住时重定向搜索),完全不审阅内核代码;起点仅为PyTorch参考实现+工作负载定义+基准命令+紧凑CUDA优化技能集。约19亿agent token在NVIDIA B200上产出:Fused MoE加速92.68×(FlashInfer库为47.08×)、DSA TopK 1101.02×(FlashInfer 52.03×)、DSA Sparse Attention 181.35×(FlashInfer 10.33×);MLSys 2026 FlashInfer竞赛官方评测中Fused MoE内核1.71×超FlashInfer基线并超过agent-assisted赛道第一名(1.68×)。

August 19, 2026 · 2 min

Agentic Transaction: Towards ACID-Compliant Agent Systems 精读

清华大学Guoliang Li数据库组提出“智能体事务”概念——把数据库五十年的ACID正确性理论重释为agent执行语义:原子性=置信度引导的原子语义事务单元(探索→只读执行→append-only执行→一致性校验→提交/重试)、一致性=置信度驱动的证据整合、隔离性=依赖感知的子agent隔离调优(独立/协作/竞争三档)、持久性=仅追加工作区记忆演化。配套开源ACID-Agent框架并给出面向agent全生命周期的开放问题清单。这是“用数据库理论为agent可靠性提供形式化骨架”的问题定义级工作——把agent失败从“提示工程问题”重新定义为“正确性问题”。

August 19, 2026 · 1 min

ClawGym II: Exploring Black-Box RL on Agent Harness 精读

人大高瓴AI学院与IQuest Research联合提出首个面向复杂agent harness的黑盒RL统一框架:用临时沙盒把任务环境与harness整体隔离包装(对训练侧完全黑盒),以忠实轨迹恢复机制从沙盒遥测中重建树状执行轨迹并回传环境奖励,使PPO/GRPO能稳定优化“harness+模型”整体。在OpenClaw与Claude Code两种结构迥异的harness上验证:30A3B骨干较初始策略分别+9.98/+14.81分,超SFT基线5.80分,PinchBench外部迁移87.32;训练在200-400步内保持稳定,且首创混合harness联合训练——单一模型在两种harness上持平甚至超过各自单独训练版。配套发布ClawGym-Bench(六域)与PinchBench双评测体系。

August 19, 2026 · 2 min

HarnessEval-W: Agentifying the Evaluation of Visual Worlds 精读

北大、清华、上海AI Lab等机构30余位作者联合提出HarnessEval-W,把LLM生态的harness范式首次引入世界模型基准测试:父Agent解释每个评测案例的语境并路由到技能库(记录激活与跳过理由),技能把问题分解为可测子问题、交给配备诊断工具的专职子Agent,证据经校验后聚合为分数——每次评测产出一棵可回溯到具体子问题与工具证据的证据树。在330案例×18个世界模型上,与5000次人类A/B判断拟合的Bradley-Terry排序对比达Spearman 0.93(Intentional)/0.87(Physical);对照最接近的WBench协议,Physical成对准确率从31.9%提至71.7%、平局率从52.2%降至1.8%。榜单揭示:Seedance 2.0综合75.5居首,视频生成器改造为世界模型会重新分配能力而非均匀提升。

August 19, 2026 · 2 min

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills 精读

上海AI Lab联合上交大、西工大、复旦、浙大提出JailbreakSkill——技能中心的自动化红队框架:把攻击策略沉淀为结构化技能资产(SKILL.md+脚本+引用三件套),两阶段循环中Stage 1用风险条件化UCB规划器在16个初始技能中路由排序(每次攻击选性价比最高的技能先试),Stage 2以失败记忆驱动技能进化(精修/组合/发现新技能,准入标准为救回至少一个未解行为)。在AdvBench/HarmBench上macro-ASR@10达72.0%/68.1%(16个模型-基准设置的13个第一),平均查询成本AQC 4.14/4.63为全场最低;随机路由消融使ASR掉8.1pp验证风险条件化排序的价值。攻击能力随使用单调增长——红队从一次性脚本进化为可复利资产。

August 19, 2026 · 2 min

Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search 精读

UCL Jun Wang组联合五机构提出大发现模型(LDM)v0.1:把LLM生成器与贝叶斯非参奖励代理耦合为循环架构——生成器提出/精修候选设计,代理预测性能并量化认知不确定性,不确定性感知价值函数统一引导生成、精修与昂贵实验评估的选择,每次新观测同步更新发现记忆与代理。在三个昂贵黑盒域验证:AutoResearch神经网络训练搜索的验证BPB降幅是LLM-only反思的2.4倍(0.0727 vs 0.0301);抗体CDRH3设计200步后结合能低18.2%(-104.7±1.0 vs -91.1±3.2);分子多目标优化Pareto超体积较LLM-only/经典BO分别+62.4%/+63.1%。论文把推理时扩展从“廉价可重复验证器”域推广到“昂贵、噪声、稀疏反馈”的科学发现域。

August 19, 2026 · 2 min

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures 精读

中科院计算网络中心联合清华、阿里通义等七机构发布LongRCA Bench——首个面向长时程Agent失败“责任角色归属+精确根因定位”双任务基准:1140条来自SWE-bench Pro/Terminal Bench 2等五域的真实失败轨迹(中位145步、无注入错误、人工独立标注责任角色与最早决定性根因步骤)。配套提出训练无关的RCTA方法(分段摘要检索候选错误步→回溯更早handoff指令),达责任角色准确率51.1%、精确根因步骤24.1%——而最强基线仅13.2%。论文揭示:决定性错误远早于失败显现(中位根因到终点126步),角色与根因是两个独立预测目标,且“被修复的中间错误不应被选为根因”的标注准则把诊断与告警区分开来。

August 19, 2026 · 1 min

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling 精读

四位独立研究者(含 UT Austin 张satz Atlas 王)在不改模型权重的前提下,用 YAML 状态机运行时 StateM 把 GPT-5.5 在 Terminal-Bench 2.1 上从 83.1% 拉到 92.1%,冻结迁移到 GPT-5.6 Sol 达 95.28% raw,把 DeepSeek-V4-Flash 适配到 88.09% 而最终评测成本仅约 15 美元——对照 GPT 参考运行的 574.68 美元。论文提出 harness scaling 作为与 model scaling 正交的能力轴:把可变状态外置、以状态为上下文与契约双重边界、用受检转换取代 agent 自证完成,将失败分类为认知缺口/程序记忆缺口/程序遵从缺口三类并逐一施加控制点。负迁移分析(RefactorBench -2.78 分)进一步证明控制必须挂在正确的执行边界上。

August 19, 2026 · 3 min