控制 token 注入×工具缓存逆转:Agent 安全与训练基础设施的两个隐蔽失效面 精读

本文合并精读两篇 Agent 安全论文。论文 A 证明:向工具调用上下文追加模型自身的控制 token,可让 gpt-oss-20b 的思维链从 52.5 个 token 降为 0,CoT 监督器拿不到任何可判信号,39.6% 原本被拒的恶意请求转化为成功执行——因为 CoT 是采样行为的产物而非义务。论文 B 证明:边缘正确的工具缓存会在组内共享随机结果时系统性偏移 GRPO 的 baseline,共享更新方向由胜率差而非均值差决定,符号可整体翻转,540 组配置穷举验证。两者共同指向:Agent 系统的失效面在结构层(解码 harness、缓存、归一化器)而非模型层。

September 25, 2026 · 7 min

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses 精读

深度精读 Google Cloud AI Research 等提出的 RRSI——首个把机器学习正则化思想系统迁移到 Agent Harness 递归自我改进的工作。文章从 Harness 与 RSI 概念讲起,拆解过拟合问题的成因,逐一讲解提案侧 L0 式退火编辑预算、证据感知信用分配、结构化探索,与选择侧泄漏筛查、噪声调整底线、L2 式成本门槛、L1 式结构剪枝,并结合八基准三域实验与外部检索交叉验证,剖析其「为何能泛化」的根源性解释与可迁移灵感。

September 23, 2026 · 5 min

Agent 技能自进化二重奏:EVOLVE 与 GraphSkillEvo 精读

2026年9月同主题连发的两篇论文不约而同地把「Agent 技能库」当作可进化的资产:Adobe+Brown 的 EVOLVE 让冻结模型在真实用户流量中演化 SKILL.md 技能库(Widening/Deepening 两轴 + Matched Replay Gate 保守准入);港城大+NUS+南科大的 GraphSkillEvo 则把技能表示为「全局指导+有向图」,用种群进化(4算子变异/交叉)优化。本文合并精读二者,共用背景与灵感节,逐篇拆解问题定义、解法与评估,并用因果链解释优势根源(保守准入防评分漂移、图结构压缩搜索空间),交叉对照 Reflexion/ExpeL/Voyager/Safe-Policy-Improvement/GEPA 谱系。两文共同指向一条结论:把「改模型权重」换成「改模型身边的自然语言资产」,是一条更稳、更安全、可迁移的持续适应路线。

September 22, 2026 · 5 min

Agent 评测方法学三重奏:Next-Turn 指标为何失灵 精读

本文合并精读三篇同主题论文,剖析「next-turn(单轮/下一步)指标」为何无法可靠预测 Agent 的真实工作能力。A(Dialpad)用五级评测协议链证明:SFT 在金历史评测下让文本轮大幅提升,但闭环工作流成功率最高仅 10.4%、整体裁判 0/77,根源是金历史恢复了正确状态、测的是「响应预测」而非「状态构建」。B(LibreDB)用 8,199 次生产级真机运行与四类失败 taxonomy 证明:75.7% 的损失来自真正调用过工具的 run,而 5 项服务器侧(非模型侧)修复让 6/6 模型同时提升。产业基准 τ²-bench 提供「必须真实」的旁证:最强编码智能体仅过 23.9%。三篇合流结论:Agent 评测必须闭环、必须真实、必须归因到接口层。

September 22, 2026 · 6 min

AI 可信性二重奏:递归评审崩塌与模型测谎仪 精读

两篇同期 arXiv 论文从「内部表征」视角审视 AI 自我监督/递归训练的可信性。A(TrustReviewer)用受控递归实验证明:让后一代评审模型学习前一代的合成评审,会使评分分布与语义多样性单调收窄——「科学判断崩塌」;并提出「语料策展 + 配对激活引导」两阶段干预。B(PIR)把法医学的「 concealed information test(测谎)」移植到激活层,用「题内正确项与干扰项的残差流对比方向」无参考地读出模型隐藏的知识,在 sandbagging、密码锁定、电路熔断等隐瞒场景下识别率 0.70–0.93,而真正遗忘(RMU 擦除)则跌至未知基线。本文按背景、定位、问题、解法、评估、根源、知识反推、灵感八节合并解读,并附外部交叉验证表。

September 22, 2026 · 4 min

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读

CodeMidas(小米 LLM Core 联合北大、港大、人大)提出用源代码作为唯一输入,把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习(RL)环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线,CodeMidas 首次做到五项开发记录全免,覆盖 3,185 个代码库、23 种语言、15 个领域,经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5,在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升(DeepSWE +11.7pp、ProgramBench +17pp)。消融证明「质量>数量」:清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。

September 22, 2026 · 6 min

EvoOntology: A Self-Evolving Ontology Layer for Data Agents 精读

EvoOntology(中国人民大学 ruc-datalab)提出一个面向数据智能体的「自进化本体层」:把数据库的领域概念、字段映射与约束封装成可被 agent 在运行时按需查询的 MCP 服务,并用 builder agent 自动构建初版本体、用「诊断—归因—修补—门控」四步环从失败轨迹中持续进化。本文按九部分结构精读,重点拆解三层架构、四步进化环,以及为何「静态语义层全量注入反而掉分」是全篇最有证明力的实验设计,并从因果链上解释其优势根源。

September 22, 2026 · 5 min

Grounded Skill Synthesis from Code at Scale for Agentic Intelligence 精读

本文精读蚂蚁国际的 Code2Skill:一种从开源代码库大规模合成「接地(grounded)、可验证、可迁移」技能库的全自动流水线。它把 GitHub 上经过人类调试打磨的仓库代码抽象为三粒度技能卡(原子/复合/模式),并用「源码盲重建 + 源码感知裁判 + 仲裁器」的往返验证过滤不可靠记录,最终产出含 1,006,822 条记录的 CodeSkillBank。在 72 组协议匹配评测中 57 组提升、宏平均 +11.7%,并在统一接口下全面超越轨迹派技能库。文章按九部分结构,从 Skill 概念的「岗位操作手册」类比讲起,逐层拆解其问题定义、四阶段解法、实验证据、优势根源与外部交叉验证,并提炼可推广的通用性灵感。

September 22, 2026 · 4 min

RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents 精读

RecreationWorld 由阿里巴巴 Token Hub 提出,围绕「应用复刻」构建五平台可验证环境,训练并评测能融合 GUI 探索与代码实现的混合计算机使用智能体(hybrid CUA)。本文梳理其背景、与 OSWorld/WebArena 的谱系定位、任务抽象、五平台+双通道测试生成+拒绝采样训练的解法、250 任务十模型评测与 OOD 迁移,并深究「为何满分复刻仅 2.8%」及优势根源。

September 22, 2026 · 2 min

SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs? 精读

SWE-Proof 把 SWE 类基准的判定信号从「隐藏测试」升级为「机器检查的形式化证明」,提出 BENCHPROOFER 流水线(规范合成 + 环境公理化 + 13 道正确性门)与 SWE-PROOF 基准(500 例 SWE-Bench Verified 100% 过门 + 242 例 SWE-Bench Pro)。核心发现:隐藏测试只采样有限输入,会放过四分之一到一半的缺陷 patch;给定正确形式化规范可将解决率从 85.0%/81.2% 提升至 96.2%/94.4%,且对抗审计后仅损失 0.9 个百分点;但让模型自写规范对解决率零收益,瓶颈在于 faithfulness——规范只约束了部分行为面。本文按九部分结构拆解其背景、定位、问题定义、解法、评估、根源与外部交叉验证。

September 22, 2026 · 4 min