SimVerity: When Does Simulated Agent Success Survive Physical Deployment? 精读

Agent 产品上线前,模拟器给的「绿色对勾」在真实物理部署中还能信几分?帝国理工学院的 SimVerity 给出了第一个系统化量化:判定保真度 VF 与假清关风险 FCR。在真实智能家居测试床上,先进模拟器通过了全部 240 个开灯试验,相机却抓到 42 个亚秒级物理失败——同一执行裂解为完成/上报/可观察/沉淀四种判决。更惊人的是,假清关可以被预测:评测前 SHA-256 冻结的风险画像在从未物理测量过的路径上 11/11 会话全胜盲基线;而第二台合格模拟器与第一台零分歧——共识只是换了种方式放弃覆盖。本精读拆解这套「先证明证人资格、缺证据一律弃权」的判定迁移审计方法论。

August 27, 2026 · 4 min

Skill Issue: Are Skills Language-Invariant in LLMs? 精读

深度精读 A*STAR、Weizmann、MIT-IBM Watson AI Lab、Cambridge 与 EleutherAI 合作的跨语言技能不一致性测量论文——同一模型的两个实例在规则/状态/动作空间完全固定、仅语言界面不同的文字博弈中对战,共 51.84 万局自博弈,首次把「技能的语言条件化」从知识获取问题中正交分离出来。发现英语界面一致最强、希伯来语最弱;语言敏感度因博弈而异(Colonel Blotto 平均 1.07 最大、Kuhn Poker 0.13 最小);Nim 博弈的最优策略在阿/希界面下「存在但不可达」,且多数策略提及来自中途自发切换拉丁字母推理的对局;把推理语言换成英语可恢复 Gemma 德语界面 TTT 损失的 89.4%。语言影响的是决策的多个阶段,不只是输入理解。

August 27, 2026 · 3 min

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents 精读

RL 训练的 LLM Agent 大多是’健忘’的:每个 episode 从零开始,过往经验无法沉淀。阿里高德(AMAP)团队提出的 SkillForge 让技能库在训练中持续进化——prompt 只注入紧凑技能目录,agent 用 <skill_call> 标签按需调用,每次调用成为轨迹中可观测、可归因的离散事件,GRPO 因此能同时优化环境动作与技能调用决策;证据驱动的技能验证(EMA 成功率+使用次数计算欠效分数)让低效技能被 reflexion 及时改写,多路径归纳从成功/失败/对比三通道合成新技能。在 ALFWorld/WebShop/AppWorld 三基准上全面超越 SkillRL(AppWorld SGC 近 3 倍),且 4B 小模型进化出的技能库迁移到 30B 模型能反超其自进化库——技能存的是可迁移知识而非模型私有产物。

August 27, 2026 · 4 min

SPECMINE: A Large-Scale Corpus of Spec-Driven Development Artifacts 精读

深度精读 CMU 数据集论文 SPECMINE(MSR 2027 Mining Challenge 数据集):对 GitHub 上 47 万个 spec 文件、7.3 万仓库的全面普查,配合 5992 个 spec 触碰 PR 与 242 万条类型化引用索引,首次让「AI 时代的软件如何被规格化」从诞生之日起可大规模研究——99.7% 的 spec 首次提交于 2025 年之后。

August 27, 2026 · 3 min

Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon 精读

剑桥大学与清华大学合作,用 out-of-sample 谱探测回答优化器领域的核心开放问题:Muon 为何快于 Adam?沿真实训练轨迹把动量缓冲做 SVD,在留出批次上估计每个奇异方向的最优步长,发现稳定且各向异性的谱剖面——单一「易变头」处于稳定性边缘(允许步长最小、恰等于 Muon 实际步长),「宽容主体」允许数倍步长。据此提出 SAMuon:头钉住、主体放大,比调优 Muon 少 13.3-24.0% token 达到同等验证损失。SGD→Adam→Muon→SAMuon 在统一谱分配视角下排成一条线。

August 27, 2026 · 3 min

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments 精读

深度精读 ServiceNow 与 Mila 的企业环境 harness 进化研究——在模型权重完全冻结的前提下,用分层搜索自动进化面向特定企业环境的 agent harness(提示词/工具接口/skills/MCP/子agent/执行循环)。通过按基线失败模式分层采样构建紧凑进化池、proposer 可见搜索集与隐藏选择集分离、test-flip 门控 + 严格爬山接受,在 ITBench SRE / EnterpriseOps-Gym ITSM / AutomationBench Finance 三个基准上较默认 harness 提升 20-35 个百分点,且冻结迁移到 Qwen/GPT 全系列模型仍有效。21 个被接受 patch 归结为三类修复:接口修复、环境约定显式化、压缩搜索的操作知识。

August 27, 2026 · 4 min

SwarmWorld: Stigmergic technological evolution in societies of language-model agents 精读

去中心化的同质 LLM Agent 群落,能在没有预设角色、配方与技术目录的条件下,仅靠共享一个可被改造的物理世界,构建出功能性的技术生态并超越同计算量的独立搜索吗?MIT 的 SwarmWorld 给出受控答案:Agent 只获局部观测并提主张,确定性模拟器独自判定后果(提议-后果分离);评估时移除全部 Agent、冻结世界克隆 8 份施加未见扰动。结果是「有界群体优势」:共享世界在组合韧性、验证发明数上几乎全面超越逐端点 best-of-N 独立包络(发明 5.75–7.00 vs 2.75),但最强单件仍属独立搜索(0.3488 vs 0.2380);约 95% 的技术采纳始于物理观察而非直接交流——共享物理基底而非通信本身才是群体能力的主要来源。

August 27, 2026 · 3 min

The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses 精读

深度精读南洋理工大学的 LLM Agent Harness 架构收敛研究——首个对 harness 层本身做源码级多案例研究的论文。三个来自对立哲学的开源编码 agent harness(LangChain deepagents、Earendil pi、DeepSeek dsh)反向演化却汇聚于同一五要素中间形态:商品化循环、仅追加可重放会话记录、模型怪癖数据化、上下文渐进披露、显式扩展缝隙。本文逐项拆解五要素与三类收敛机制(平行发现/扩散/字面复用),还原四条汇聚断层线缺陷分类,并解读唯一零收敛维度’外部可验证性’为何是预测性缺口。

August 27, 2026 · 4 min

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents 精读

AWS Agentic AI团队用58,000次agent运行、200万次API调用、360亿token的系统实验,测量了coding agent中途切换模型的隐性代价——Handoff Tax。核心发现呈方向二重性:升级(便宜模型→贵模型)时Raw全轨迹移交只恢复不到一半质量差距且成本可达LC的4-6倍,Claude家族下甚至被’弃用重启’严格支配;降级(贵模型→便宜模型)却是甜点区,保住大部分质量同时省下大头成本。最有工程价值的是接口反转现象:升级时应丢弃前模型的轨迹只留代码改动,降级时恰恰相反。本文从实验设计讲到成本机制分解,给出模型切换策略的实操建议。

August 27, 2026 · 2 min

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure 精读

深度精读 PST 2026 的 ToolMinimize 论文——Case Western Reserve 大学提出的 LLM Agent 工具调用隐私最小化中间件。动机研究显示三个生产 LLM 默认 prompt 下 81-88% 的工具调用包含不必要的隐私敏感数据,显式隐私指令后仍剩 36-76%(Llama 几乎无效)。现有防御全是 allow/block 门控或 token 级 PII 检测,无法改写参数值。TOOLMINIMIZE 在参数构造与工具执行之间拦截调用,用「模式+实体+语义」三段分类器识别 PSD(含隐式隐私如医院名隐含诊断)、按 JSON Schema 做必要性分析、执行删除/泛化/替代/截断四种改写。307 次真实调用验证:隐私成本降 81.2-92.0% 且 100% 任务有效(TOST 等价 p<0.001),中位延迟仅 1.77ms。

August 27, 2026 · 5 min