SimVerity: When Does Simulated Agent Success Survive Physical Deployment? 精读

Agent 产品上线前,模拟器给的「绿色对勾」在真实物理部署中还能信几分?帝国理工学院的 SimVerity 给出了第一个系统化量化:判定保真度 VF 与假清关风险 FCR。在真实智能家居测试床上,先进模拟器通过了全部 240 个开灯试验,相机却抓到 42 个亚秒级物理失败——同一执行裂解为完成/上报/可观察/沉淀四种判决。更惊人的是,假清关可以被预测:评测前 SHA-256 冻结的风险画像在从未物理测量过的路径上 11/11 会话全胜盲基线;而第二台合格模拟器与第一台零分歧——共识只是换了种方式放弃覆盖。本精读拆解这套「先证明证人资格、缺证据一律弃权」的判定迁移审计方法论。

August 27, 2026 · 4 min

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure 精读

深度精读 PST 2026 的 ToolMinimize 论文——Case Western Reserve 大学提出的 LLM Agent 工具调用隐私最小化中间件。动机研究显示三个生产 LLM 默认 prompt 下 81-88% 的工具调用包含不必要的隐私敏感数据,显式隐私指令后仍剩 36-76%(Llama 几乎无效)。现有防御全是 allow/block 门控或 token 级 PII 检测,无法改写参数值。TOOLMINIMIZE 在参数构造与工具执行之间拦截调用,用「模式+实体+语义」三段分类器识别 PSD(含隐式隐私如医院名隐含诊断)、按 JSON Schema 做必要性分析、执行删除/泛化/替代/截断四种改写。307 次真实调用验证:隐私成本降 81.2-92.0% 且 100% 任务有效(TOST 等价 p<0.001),中位延迟仅 1.77ms。

August 27, 2026 · 5 min

Training Alignment Auditors via Reinforcement Learning 精读

深度精读 Anthropic 论文:用 RL 训练 Claude Haiku 4.5 做对齐审计员。奖励设计三轮迭代的故事极具教学价值——生产模型标量奖励被黑化(误报率 96%)、二值奖励学会对抗盘问、最终 reference pairwise 奖励 + 50% 无行为校准 rollout 让小模型匹配 Opus 4.6(48.7 vs 48.4)、误报率压在 1% 以下,并跨脚手架迁移到 AuditBench 对抗性目标(检测率 11.5%→28.1%)。

August 27, 2026 · 3 min

When “Must“ Becomes “Maybe“: Constraint Weakening in LLM Agent Workflows 精读

LLM 多角色工作流中,上游确立的安全约束(如“未获审批不得执行“)经摘要、计划、工单等交接变换传给下游后,是否仍然“说话算数“?深圳大学团队提出“操作性状态保持“概念并设计阶段分离受控实验:1296 个主实验 episode 中,直接交接对照 100% 保持约束,而正常级别的交接压缩使约束失活率达 100%、违规执行 54.2%;恢复全部四个状态字段则将两者归零。下游验证可在不改工件的情况下消除违规(0%),证明工件修复与端点遏制是互补的系统功能层。核心发现:语义可用不等于操作保持——内容还在,约束力没了。

August 27, 2026 · 2 min

CatchBench: When Can an Agent Failure Be Caught? 精读

CatchBench(USC,PyOD 作者 Yue Zhao)构建了首个在 PRE(运行前声明配置)/LIVE(运行中轨迹前缀)/POST(运行后完整轨迹)三种信息状态下统一评分 Agent 审计方法的竞技场:9 个计分板、72 个方法。它最大的贡献是方法学自律——公开每条标签的生成方式从而暴露自身语料的捷径(injecagent 源仅凭声明顺序即 F1=1.000)、给注入故障设’可采性门槛’、并如实发表 71/118 个无法分离的对比。‘分数在标签过程公开并检验其捷径之前不可解释’,这是对所有基准的警世恒言。

August 25, 2026 · 2 min

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning (NFV) 精读

NFV(Microsoft Research,单作者 Shuvendu K. Lahiri)让 AI Agent 当形式验证语言的前端:Python 开发者用自然语言问’这个函数对不对’,Agent 把程序与规范翻译到 Dafny,由成熟验证器逐条机器检查,证明可查、缺陷有 witness。在 206 条数据集上 57.3% 的条目给出机器检查证明 @92.2% 精度——而 LLM-as-judge 直接判定的精度只有 72% 且无 artifact;无纪律的’LLM+验证器自由证明’更是 98% 的正确程序和错误程序都被’证明’(精度 50%)。关键机制是’无证明即弃权’与 staged discipline(溯源标签+冻结翻译堵死为证明而改代码的捷径)。

August 25, 2026 · 2 min

The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models 精读

这篇来自 VIDRAFT AI Research(韩国)的论文证明:‘看 mask’这个全行业默认的因果性检查,在混合架构时代完全失效——192 次注入故障中 mask 检查 0/192 发现,而两次前向传播的前缀不变性审计 192/192 精确定位到泄漏层。更重磅的是实际战果:在两个已发布模型(Zamba2-1.2B 与 Nemotron-H-8B)中挖出真实因果泄漏——chunk 边界处未来信息泄漏进当前表示,缺陷源于同一段三行代码(inter-chunk 递归 reduce 求和轴错误),两行修复后泄漏精确归零。方法只需两次前向、无梯度,135M 模型 CPU 上半秒。

August 25, 2026 · 2 min

A Jagged Frontier: 代码Agent对语义保持变换的锯齿鲁棒性 精读

当代码库被改写成语义等价的形式——控制流重写、死代码注入、标识符重命名——修 bug 的代码 Agent 还靠得住吗?Colorado State、Microsoft、UIUC 与 CMU 四方合作,用一套随机变体采样器对 2 个 Agent 框架 × 4 个前沿模型 × 54 个 SWE-bench 实例做了首个仓库级 Agent 鲁棒性系统评估:多数配置出现小幅退化(最大平均 6.7 个百分点,16 个配置中 6 个统计显著),但更扎心的发现是「锯齿前沿」——没有任何模型鲁棒性排名能跨框架、跨基准保持稳定,Qwen 在一个框架下最鲁棒、换一个框架反而最脆弱;更简单的框架反而更皮实;即使 solve 率不掉,token 成本最多也要多花 22.9%。本精读覆盖其 14 种语义保持变换的设计、非反馈采样的下界逻辑、配对实验统计方法,以及锯齿现象背后的机制因果链。

August 23, 2026 · 9 min

One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读

微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准:507 个政策条件化的有状态业务工作流,覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域,用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%,pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%,暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟;79,853 次失败试验中 80.88% 干净终止且含写操作,证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。

August 23, 2026 · 7 min

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents 精读

深度精读 KAIST 与 DeepAuto.ai 产学合作论文 PolicyGuide:客服 LLM Agent 的合规失败不仅来自危险动作,更来自跳过身份核验、跳过确认等程序遗漏,而动作局部检查的运行时守卫无法引导多步流程。该工作把每个领域的策略编译为工作流图,在用户轮次边界调用前瞻验证器,从持久化图状态对账未决请求并返回步骤级补救,兼具外部守护与工作流强制双角色;在 τ²-bench 三域上将 GPT 5.4 平均 PASS⁴ 从 0.42 提升到 0.62,telecom 域从 0.19 跃至 0.61,同一工作流零改动迁移到 Claude Sonnet 4.6 与 Gemini 2.5 Pro。

August 22, 2026 · 4 min