控制 token 注入×工具缓存逆转:Agent 安全与训练基础设施的两个隐蔽失效面 精读
本文合并精读两篇 Agent 安全论文。论文 A 证明:向工具调用上下文追加模型自身的控制 token,可让 gpt-oss-20b 的思维链从 52.5 个 token 降为 0,CoT 监督器拿不到任何可判信号,39.6% 原本被拒的恶意请求转化为成功执行——因为 CoT 是采样行为的产物而非义务。论文 B 证明:边缘正确的工具缓存会在组内共享随机结果时系统性偏移 GRPO 的 baseline,共享更新方向由胜率差而非均值差决定,符号可整体翻转,540 组配置穷举验证。两者共同指向:Agent 系统的失效面在结构层(解码 harness、缓存、归一化器)而非模型层。