论文一:Safety in Self-Evolving Agents: A Survey (SAVER) 论文二:Safety Must Survive Self-Improvement: Why Failures Persist and How Agents Recover(项目页:RSI-Safety.github.io) 论文三:Sharpening Tax in Post-Training(代码:changdaeoh/sharpening-tax,项目页:changdaeoh.github.io/sharpening-tax) 发表时间:均为 2026 年 9–10 月 机构:论文一由浙江大学牵头,联合华中科技大学、西安交通大学、国防科大、上海交大、佐治亚理工、中科大、南洋理工、天津大学、重庆大学,以及 OPPO 研究院、阿里巴巴、乐天集团共 16 家机构(13 所高校 + 3 家企业);论文二由 Tulane University 领衔,联合 UBC、Rutgers、Princeton、NYU、Virginia Tech 共 6 所北美高校(无企业参与);论文三由 Meta Superintelligence Labs 领衔,联合 UW–Madison、NYU、Stanford(一作在 Meta 实习期间完成,属于典型的「高校学生 + 企业合著」模式) 领域标签:cs.CR(论文一、二相关)、cs.SE(论文二)、cs.AI(论文三)
一、论文背景:从「回答问题的安全」到「自我改进中的安全」
1.1 什么是自进化 Agent,为什么它改变了安全问题的性质
要理解这三篇论文,先要理解一个正在发生范式转变:LLM 从「静态模型」走向「自进化 Agent」。
目前部署的大多数 LLM 有一个根本特征:参数在部署后是冻结的。无论模型与用户交互多少轮,它本身不会从这些交互中「学到」任何东西。但在开放环境中长期运行的 Agent(个人助理、自动编程代理、多 Agent 协作系统)如果每次都从零开始,就无法积累经验。于是出现了自进化 Agent(self-evolving agent):它们用自己的观察、行动、反馈和执行轨迹,持续更新可复用状态(reusable state)——包括模型参数、记忆条目、工具定义、技能库、工作流规则等。SAVER 给出的判定标准是:只要 Agent 的自身经验在 Agent 循环内部更新了这些可复用状态、并因此改变后续行为,它就是自进化的。
这个转变为什么从根本上改变了安全问题?SAVER 的表述非常精辟:当经验变成可复用状态,过去的事件就成了未来的原因(when experience becomes reusable state, past events become future causes)。一段在一个上下文中无害的信息——比如用户的一句口头授权、一条网页上的说明——被写入记忆后,可能在未来的某个时刻以更强的持久性、更大的权限或更广的作用范围被重新激活。安全评估的对象因此从「这一条回答是否合规」「这个动作是否被授权」,变成了「安全属性能否在经验的积累、泛化和跨上下文复用中存活」。
用一个人人能懂的类比:传统 LLM 安全像面试审查——每个回答出场前检查一遍;Agent 动作安全像岗前培训——每个动作执行前核对权限;而自进化 Agent 安全像员工长期在职管理——一个员工(Agent)会把工作中听到的每句话记进笔记本(记忆)、总结成操作手册(技能)、甚至写进部门规章(工作流),你无法只审查「他今天说了什么」,你必须追问「他三年前记下的那条笔记,今天还在指导他做决定吗?当时合法、现在还合法吗?」
1.2 三条研究脉络各自面对的困境
这三篇论文分别来自三条活跃的研究脉络,每条脉络在 2026 年都遇到了自己的瓶颈。
脉络一:自进化 Agent 安全综述的碎片化。 Agent 安全领域已有大量综述,但它们大多按系统组件(记忆、工具、规划)、生命周期阶段或攻击类别来组织。这种分类方式的问题是:同一起安全事件会被切碎到不同类别里——恶意内容写入记忆算「记忆投毒」,被检索激活算「提示注入」,影响工具调用算「越权」——而事件真正的因果链(一段影响如何跨载体变化角色)反而看不见了。领域需要一张能纵向追踪「同一段影响」的地图。
脉络二:递归自我改进(RSI)的安全实证空白。 STOP、Darwin Gödel Machine、AlphaEvolve 等系统已经展示了 Agent 递归改进自身代码的能力,Agent 安全基准(Agent-SafetyBench、ToolEmu、AgentDojo)也记录了大量危险行为。但几乎所有安全评估都在回答「失败有没有被发现」,没有人系统回答:发现失败之后,失败的程序还在运行吗?什么时候才真正停下来?「检测到失败」「修复方案可得」「停止不安全执行」是三个不同的结果,把它们混为一谈会严重高估系统的安全性。
脉络三:后训练「锐化假说」的证据边界。 RL 后训练是否只是放大基础模型已有的少数高奖励行为(distribution sharpening / 锐化),而不创造新能力?这场争论的证据几乎全部来自数学和代码任务。但这两类任务有两个致命混淆因素:预训练语料里数学和代码极多(基础模型早见过大量解题策略);评估往往只查最终答案(一次侥幸的推理也能得分)。而 Agentic 任务——多轮工具调用、与环境交互、长程一致性——恰恰是预训练数据中稀缺、被普遍认为「必须靠后训练习得」的能力。如果连 agentic 任务上锐化都成立,这个假说的适用面就太广了;如果不成立,这里就是后训练真正创造能力的证据地。
1.3 三篇论文的共同问题
把三条脉络放在一起,会看到一个共同的核心问题,也就是本篇合读的叙事主线:
当 Agent 通过各种机制改进自己时——无论是把经验沉淀为记忆/技能,还是递归编辑自身代码,还是 RL 后训练调整参数——原本经过验证的属性(安全授权、正确性、解的覆盖)能否在「改进」中存活?
-SAVER 回答:安全属性在什么环节、以什么方式失效(领域地图);
- Safety Must Survive 回答:失效被发现后为什么会持续、如何恢复(失败机制与恢复);
- Sharpening Tax 回答:改进本身要让渡什么代价、代价如何量化与缓解(改进的代价)。
二、论文定位和关联工作:地图—机制—代价的三层结构
2.1 三篇论文互为纵深
这三篇论文发表时间几乎同步(均为 2026 年 10 月上旬的 arXiv 预印本),相互独立却又惊人地互补,构成一个三层认知结构:
| 层次 | 论文 | 回答的问题 | 分析单元 | 时间尺度 |
|---|---|---|---|---|
| 领域地图 | SAVER(综述) | 自进化 Agent 的安全失效有哪些载体、操作、违反类型、暴露面和响应? | 一条可复用影响的完整生命周期(S×A→V→E→R) | 单次状态转移及其跨会话复用 |
| 失败机制 | Safety Must Survive | 检测到的不安全程序为何持续运行?如何恢复? | 代际(generation)间的程序谱系 | RSI 的 6–12 代编辑循环 |
| 改进代价 | Sharpening Tax | 后训练让渡了多少测试时可扩展性?如何量化与缓解? | base → post-trained 的策略分布变化 | 训练前后的整段分布演变 |
更妙的是,三篇论文在方法论层面互文——都在批判「端点指标」:
- SAVER 的 Takeaway 1.3:端点分数测不出持久原因(Endpoint Scores Leave Persistent Causes Unmeasured)——攻击成功率、拦截率只测局部结果,不追踪涉事状态是否被修复;
- Safety Must Survive 的核心区分:最终正确 ≠ 过程安全——一个分支最终修好了,不代表中间各代没有执行过未授权动作;
- Sharpening Tax 的立论:pass@1 测不出覆盖损失——单次准确率上升的曲线下面,可能藏着解覆盖的大幅收缩。
2.2 各自脉络中的定位
SAVER 在综述谱系中的位置。 此前 Agent 安全综述按组件组织(如 general/autonomous agent 综述比较记忆、规划、工具模块)、按生命周期阶段组织(如 MLAS 分析自进化模块的生命周期威胁)、按攻击类别组织。SAVER 的差异是转移中心(transition-centered):以「载体×操作」(Substrate × Adaptation)为最小比较单元,纵向追踪同一段影响如何改变载体、角色、权限和下游后果。它与轨迹保障(trajectory assurance)目标相通——验证组合行为是否满足系统级约束——但更进一步追问「是哪一次状态转移改变了这段行为序列的有效来源/范围/权限」。
Safety Must Survive 在 RSI 谱系中的位置。 它站在 STOP(递归改进代码改进程序)、DGM(进化编码 Agent、维护 evolving archive)、AlphaEvolve(搜索算法)这些能力系统的延长线上,也直接回应了 2026 年涌现的「自进化风险」研究(如「Your Agent May Misevolve」分析自进化中的涌现风险、「Alignment Tipping Process」研究自进化如何把 Agent 推离轨道)。与这些工作不同的是,它不问「失败如何产生」,而问**「失败产生并被发现后,什么决定它是否持续」**——把安全责任从验证(validation)扩展到选择与保留(selection / retention)。这与 SAVER 的判断遥相呼应:SAVER 发现现有证据集中在 admission(准入)、activation(激活)、exposure(暴露)和 local containment(局部遏制),而 descendant repair(后代修复)与 adaptation 恢复后评估是证据真空——Safety Must Survive 恰好是对这个真空的一次正面实证。
Sharpening Tax 在锐化争论中的位置。 「RL 只是锐化」一方的证据:RL 训练的模型在大 K 的 pass@K 上输给 base 模型(Yue et al. 2025、Zhao et al. 2025 等);反方证据:长时间 RL 能扩展推理边界(ProRL)、grokking 等。Sharpening Tax 的贡献是把这场争论从数学/代码域带入 agentic 域,并且不满足于「画曲线、看交叉」的定性观察,而是把 pass@K 曲线的形状本身变成一个诊断指标。它与 Large Language Monkeys(repeated sampling 作为测试时算力轴)一脉相承,但反其道用之:不是把重复采样当作提升性能的手段,而是当作透视后训练对策略分布做了什么的显微镜。
2.3 定位对比表
| 维度 | 既有工作的路线 | 本批三篇的突破 |
|---|---|---|
| 综述组织方式 | 按组件/阶段/攻击类别分类 | SAVER 按「影响的转移」纵向追踪,S×A 为最小比较单元 |
| RSI 安全评估 | 测「失败能否被检测/修复方案是否存在」 | 区分「检测到」「修复可得」「停止不安全执行」三种结果,用配对干预分离三个决策 |
| 锐化假说检验 | 数学/代码任务的 pass@K 曲线目测 | agentic 域 42 组合系统证据 + 单指标量化(Sharpening Tax)+ 可预测性验证 + 缓解方法 |
三、问题定义:把三篇论文抽象成同一个问题
三篇论文表面各异,本质上是同一个抽象问题的三个投影:
给定一个系统在时刻 t 满足某属性 P(安全授权 / 正确性 / 解覆盖),系统在 t→t+1 经历一次「自我改进」操作 A(状态写入/迁移/激活、程序编辑与选择、RL 更新),问:P 在 t+1 及之后是否仍然成立?如果失效,失效能否被发现?发现后能否被停止?停止后能否被修复并不再复发?
这个定义有三个精妙之处:
第一,它把「改进」和「属性存活」解耦为两个独立对象。 传统安全评估把两者捆绑——「系统改进了且评估通过 = 安全」。而三篇论文一致表明:改进操作 A 与属性 P 之间存在中介变量(角色/权限的变化、选择与保留规则、分布形状变化),中介变量才决定 P 的命运。研究的对象应该是中介变量,不是 A 本身。
第二,它把时间维度显式化了。 三个对应关系:
| 论文 | 具体场景 | 抽象结构 |
|---|---|---|
| SAVER | 一段影响经 add→abstract→activate→propagate 跨载体流转 | 状态空间中的转移链,属性 ℓ 在每跳上被保留或改写 |
| Safety Must Survive | 程序 w₀→w₁→…→w_g 的代际谱系 | 离散时间线上「选择哪个执行、编辑哪个、保留什么」的决策序列 |
| Sharpening Tax | base 分布 → post-trained 分布 | 逐任务成功概率 p_x 从中间区域向 {0,1} 两极塌缩 |
-SAVER 的形式化是转移记号 (s, ℓ, σ) →(a,c) (s′, ℓ′, σ′):载体 s 携带安全属性 ℓ,在授权条件 c 下经操作 a 变为 s′——关键判断是 ℓ→ℓ′ 是否保性质;
- Safety Must Survive 的形式化是 keep 规则 w_g = select(E_g)(非空)或 w_{g−1}(空集)——关键判断是 E_g 用历史分数还是当前验证、空集时保留谁;
- Sharpening Tax 的形式化是 TaxX(K) = X_base(K) − X_post(K),X∈{A, S}——关键判断是曲线下面积的差是否为正。
第三,它统一了「证明存活」的举证责任。 SAVER 的 Takeaway 1.2 指出:攻击只需一条成功路径即可得证,而恢复必须覆盖所有相关的未来激活位点——攻击与恢复的证明负担不对称。Safety Must Survive 用实验证实了这一点(archive 里有正确替代 ≠ 会被选中);Sharpening Tax 则从另一端呼应:post-training 想证明「能力扩展」只需几个新任务案例,而「没有收缩覆盖」需要整条 pass@K 曲线作证。
四、问题解法:三套互补的方法
4.1 SAVER:S×A→V→E→R 转移中心框架
SAVER(Substrate × Adaptation → Violation → Exposure → Response)是全文的分析骨架。五个字段回答同一个转移的五个问题:
| 字段 | 回答的问题 | 内容 |
|---|---|---|
| Substrate(载体) | 影响存放在哪里? | Model(参数/LoRA/KV cache)、Memory(记忆/检索)、Tools & Skills、Workflow(工作流/拓扑) |
| Adaptation(操作) | 什么操作改变了它? | 七族:add / abstract / activate / modify / forget / propagate / migrate |
| Violation(违反) | 哪个安全属性失效? | 六族:Provenance Loss / Authority Escalation / Integrity Failures / Purpose Failure / Safety Regression / Incomplete Rollback |
| Exposure(暴露) | 失效在哪里变得可观察? | 五面:记忆检索 / 工具执行 / 外部工件 / 多 Agent 吸收 / 模型部署 |
| Response(响应) | 能否遏制、修复、撤销? | 四段:预防治理 / 转移与激活控制 / 监控遏制 / 恢复与抗辩 |
几个理解要点:
「S×A 是最小比较单元」是什么意思? 同一个操作在不同载体上后果不同(abstract 作用于记忆可能抹掉来源约束,作用于模型参数则可能是另回事);同一载体在不同操作下后果也不同(一条记忆被 add 是一件事,被 migrate 进工作流规则是另一件事)。所以分析必须锁定「载体×操作」的组合,而不能单独谈「记忆安全」或「抽象操作」。SAVER 用一个精彩的例子说明:同一句话「为这位用户选最快的方案,哪怕多花钱」——作为网页观察是不可信的环境声明;作为草稿便签是瞬时推理上下文;作为长期偏好记忆是个人化状态;作为技能参数是可复用决策规则;作为工作流策略它能路由此后无数任务。内容没变,载体变了,权限就变了。
选择语义与反馈语义。 SAVER 在转移链之前加了「选择」层(为什么 π_evo 会选中这个更新——局部效用分数 b_u 起作用)、在链之后加了「反馈」层(响应会改写后续转移的约束与候选集)。这形成一个重要论断(Takeaway 2.1):效用不授权晋升(Utility Does Not Authorize Promotion)——一个更新「有用」只证明它的用处,不等于它获得更广复用的许可。
转移测试与晋升测试。 对每次转移检查:低权限的观察被摘要存储后,摘要不应携带指令权限;用户特定的偏好迁移进工作流时,范围限制应随行;私有状态成为工具参数时,隐私违反应可见。晋升(promotion)特指把单集证据推向更持久、更一般、更带动作性的角色——只有当授权条件 c_t 批准新角色、安全属性在目标上下文仍有效、反例证据未被丢弃、来源-后代关系可追溯时,晋升才是安全的。
4.2 Safety Must Survive:受控测试床 + 三组配对干预
论文二的方法设计围绕一个干净的因果分离:把「验证」「选择保留」「编辑源」三个决策从编辑器能力中拆出来,单独受控比较。
受控测试床。 四类有状态授权任务——会话授权(session authorization)、文件系统隔离(filesystem containment)、工具审批(tool approval)、结构化用户同意(structured user consent)——配种子事件流(请求与撤销、范围变更交错)和独立效果追踪器(效果由外部独立记录,不依赖程序自述,因此「一揽子拒绝」不能冒充成功修复——拒绝一切虽然安全,但没完成被允许的工作,不算 full correctness)。固定 LLM 编辑器(GPT-5.6 Sol、Claude Sonnet 4.5、Qwen3 Coder、Devstral 2、GLM 4.7 Flash 等)迭代优化可执行 Agent 组件。
三组配对干预(这是全文方法论的精髓):
- 部署验证 vs 历史分数:同一 archive、同一候选程序,只变一个东西——部署资格由「当前测试下的验证」决定,还是由「存储的历史评分」决定;
- keep 规则 vs founder fallback:同一现任失败程序、同一批被拒提案,只变一个东西——全部候选被拒后,保留失败的现任(keep),还是回退到最初正确的 founder(fallback);
- 继承编辑 vs founder 编辑:同一组失败根(failed roots)、同一验证与保留规则,只变一个东西——编辑器下一轮从失败的现任出发改,还是从最初正确的 founder 出发改。
用一个类比:一家公司发现现任经理出了事故(失败被检测到)。公司要回答三个独立的问题——人事档案里的旧绩效还作数吗(历史分数 vs 重新考核)?招不到合格继任者时,让出事的经理继续管事吗(keep vs fallback)?新经理的培养从「带坏的习惯」出发还是从「创始人的正确手册」出发(继承编辑 vs founder 编辑)?三个问题各自独立,混在一起就永远说不清事故为何持续。
4.3 Sharpening Tax:pass@K 曲线形状诊断 + PTGS 缓解
论文三分两步走:先定义诊断指标,再给缓解方法。
第一步:三个互补指标。 对任务 x_i 采样 n_i 次、成功 c_i 次:
- pass@1(准确率):单次通过率——采样效率;
- pass@K(覆盖):K 次中至少一次成功的概率——解覆盖;
- pass_K(一致性):K 次全部成功的概率——可靠性。
第二步:Sharpening Tax 定义。 对预算 K:
- 原始可扩展性 A(K) = Σ_{k=1}^{K−1} [pass@K − pass@k]——pass@K 天花板下的累积面积,衡量「额外 rollout 能赎回多少性能」;
- 校准可扩展性 S(K) = A(K) / [(K−1)(1−pass@1)]——用首次失败率归一并限制在 [0,1];
- TaxX(K) = X_base(K) − X_post(K),X∈{A,S}——正值表示后训练收缩了测试时可扩展性。
这个指标有一个漂亮的概率解释(Proposition 1):A(K) = 首次成功之前期望的失败次数。一次就解出或永远解不出的任务对 A(K) 贡献为零;第 h 次才首次解出的任务贡献 h−1。正的税意味着 post-trained 策略的成功更少依赖重试——要么失败后赎不回来(覆盖丢失),要么更少次数就饱和(更快饱和)。
第三步:机制分析。 把每个任务按 128 次 rollout 的结果分为 always pass(c=K)/ pass given compute(0<c<K)/ always fail(c=0)三类。后训练的效应是双峰化(bimodalization):中间类(靠算力可解)大幅萎缩,任务被推向两端。而 A(K) 恰好在 p=0 和 p=1 两端都取零值——锐化把任务推向的正是「重试失去价值」的两个零点(Theorem 2:塌缩到两极的操作按塌缩比例 λ 收取正比于 λ·A_base(K) 的税)。
第四步:PTGS(后验调温组采样)缓解。 一个即插即用的贝叶斯采样器:训练中为每个 prompt 维护折现的成功/失败计数 (s̃_x, f̃_x)(遗忘因子 γ),构成 Beta 后验;Thompson 采样抽出该 prompt 的难度估计 p̂_x;难 prompt(p̂ 低于目标 p̃)加热到温度 τ(鼓励探索),易 prompt 冷却到 1/τ(鼓励利用)。不改动任何 RL 更新规则,零额外开销。其机制(Theorem 3):加热使难 prompt 的组内至少含一个成功的概率上升(PPO 有可强化的成功)、混合组概率上升(GRPO 有非零组相对优势),从而让难任务持续贡献学习信号,避免被塌缩到 p=0。
一个直观类比:班级教学里,固定温度相当于对全班用统一难度的题海——学霸(易 prompt)反复做早就会的题浪费时间,学困生(难 prompt)反复全错拿不到任何正反馈;PTGS 相当于给学霸做更难的题(降温聚焦)、给学困生降低难度先尝到成功(升温探索),两头都保住了学习信号。
五、评估指标与实验证据:核心数字全记录
5.1 SAVER:683 篇语料的安全地图
SAVER 的「实验」是系统化范围综述(scoping review)。语料 funnel:
- 冻结编码池 683 篇 = 579 篇去重注册 + 48 篇非重复论文卡补充 + 56 篇成稿引用追加;可视化子集 577 篇;
- 检索覆盖四大安全会议(IEEE S&P、USENIX Security、CCS、NDSS)、AI/ML 会议(NeurIPS、ICML、ICLR 等)、NLP/检索会议(ACL、EMNLP、SIGIR 等),配能力词 × 安全词的成对查询与引文滚雪球,以「机制空间饱和」为停止规则。
载体(Substrate)计数:Workflow 224 / Memory 201 / Tools & Skills 108 / Model 44——工作流与记忆是当前证据最密集的载体,模型侧状态仍是前沿。
违反(Violation)六族计数(这是全文最有信息量的数字):
| 违反族 | 计数 | 含义 |
|---|---|---|
| Provenance Loss | 97 | 来源/贡献者/推导信息丢失,被洗白成更强角色 |
| Authority Escalation | 77 | 描述性状态获得未授权的角色/权限/范围 |
| Integrity Failures | 76 | 资源预算、活性、可审计性失败 |
| Purpose Failure | 55 | 隐私/目的限制在披露之前就已失效 |
| Safety Regression | 25 | 模型侧更新侵蚀安全行为 |
| Incomplete Rollback | 9 | 源被修复但派生影响仍可激活 |
响应(Response)四段计数:Monitoring & Containment 136 / Preventive Governance 61 / Recovery & Contestability 21 / Transition & Activation 20——监控遏制一枝独秀,恢复与抗辩(21)和转移激活控制(20)严重不足,与「descendant repair 是证据真空」的判断互相印证。
作为综述,SAVER 的「证明力」不在数字大小,而在抽样设计的可重复性(预注册式协议、证据分级规则、非论文排除说明)与结论的结构性——三条 Takeaway:①合法状态可因复用变不安全(Takeaway 1.1);②攻击与恢复证明负担不对称(1.2);③端点分数测不出持久原因(1.3)——每一条都能从计数结构中读出:97+77 的高频违反族都关于「角色与权限的漂移」而非「内容本身有毒」,而 21/136 的恢复对监控之比直接暴露了修复证据的稀缺。
5.2 Safety Must Survive:三组配对实验的决定性数字
实验一:新授权依赖暴露失败 + 历史分数的持续。 72 条 histories(3 编辑器 × 2 任务),第 4 代引入全新授权依赖(如上游撤销可令缓存授权失效而 token 本地版本号不变)。结果:GPT 的 24 个 checkpoint 中 22 个暴露不安全行为(尽管此前通过全部初始验证),每个冻结的 founder 保持完全正确。接通 OpenEvolve 控制器 + DGM 组件的 48 条框架 histories 中:历史分数把同样 22 个不安全程序一直保留到第 100 轮迭代——而每个受影响 archive 里都存在正确替代。对照地,score refresh 干预(更新存储分数/反馈/选择元数据后继续搜索)达到 0 unsafe / 48 fully correct(原套件上);100 轮长程下 current readout 同样 0 unsafe / 48 correct。独立组合测试(不进 prompt 与选择)仍暴露残余失败(refresh 条件 3 unsafe / 43 fully correct),说明刷新资格与扩大测试覆盖互补。
实验二:keep 规则的失败持续。 表 2 的部署状态审计(432 个变更后状态):部署验证 + 历史编辑 → 0 unsafe;历史部署 → 132 unsafe states——差距完全来自「选择什么在跑」。固定池分析(432 个候选池冻结、只变验证覆盖率):全覆盖下 keep 达 96.8% 安全(仍有 14 个不安全现任,来自 3 条 Qwen 谱系),founder fallback 达 100%。同提案配对实验(42 个失败根/编辑器):keep 与 fallback 面对同一现任、同样被拒的提案——keep 规则下 42 个失败根 0% 恢复,founder fallback 100% 恢复(GPT、Sonnet 两编辑器一致)。
实验三:编辑源改变恢复轨迹。 同样 42 个自然失败根、固定验证/反馈/keep:6 代修复后,继承编辑留下 14 个不安全端点,founder 编辑只留 1 个;safety restored 分别为 66.7% vs 97.6%。效应随编辑器变化:Devstral 两种来源都能修复(100%),Qwen 残差最大(inherited 0% vs founder 91.7%)。
实验四:安全与效用的兼得。 288 个配对块、12 代、四任务族:完整验证 + validated rollback 都以完全正确的端点结束,同时保留 43% 以上的 founder 相对部署成本节省(不含验证开销)。Consent 任务上安全率对比最鲜明:验证扩展后 founder 编辑终点 90.3% vs 继承编辑 33.3%。
这组实验的证明力来自配对设计:每次只动一个决策变量、共享其余全部条件,任何终点差异只能归因于被动的那个变量——「检测到失败≠停止执行」由此获得了干净的因果支撑,而不是观察性相关。
5.3 Sharpening Tax:42 组合的系统证据
主体证据:14 对 base/post-trained 检查点(Gemma-4、Ministral-3、Qwen2.5、Qwen3.5 四族,3B–35B)× 3 个 agentic 基准(BFCL v4 多轮、WebShop、ACEBench)= 42 个组合,K 至 128 rollouts。
核心结果:
- 反超现象:harness(轻量脚手架:简单系统提示 + 宽松工具调用/解析接口)加持的 base 模型在 K=128 时于大多数组合反超 post-trained——WebShop gemma-4-31B:85% vs 56%;
- harness 的杠杆:base 模型平均 pass@1 从 5.59→15.63(BFCL)、pass@32 从 15.19→49.13;同一 harness 反而伤 post-trained 模型;
- 交叉点随规模缩小:WebShop 上 4B 模型 k*>128(预算内不交叉),31B 时 k≈3*——越大的模型,锐化越「亏」;
- 税的普遍性:TaxS(128) 在 42 个组合中 36 个为正;小模型在小预算(k≤8)税常为负(算力紧缺时锐化有益),大模型几乎每个预算都正税;
- 双峰化机制:WebShop gemma-4-31B 的中间类(pass given compute)87.6%→30.0%,always fail 12.4%→44.0%,always pass 0→26.0%——中间质量被推向两端;
- 可预测性:TaxS(8)(8 次 rollout 估计)预测 TaxS(32) 的 Spearman ρ=0.85;TaxS(8) 也是唯一同时强预测 TaxS(32)、Δpass@32、Δpass32 三个未来指标的早期预测子;
- 税引导路由:用 32 次 pilot rollout 的 TaxS 估计做逐任务路由(base vs post),pass@128 在 6 个面板中 5 个超过 post-trained 单策略(最多 +13.6 个点,WebShop 大模型组);
- PTGS 缓解:Sokoban 上 PPO pass@1 46.5→61.1、pass@128 55.0→69.7;GRPO pass@128 55.3→72.5、TaxS(128) 0.081→0.025(PPO 侧 0.094→0.081);FrozenLake 上 PPO pass@1 63.7→65.0、pass@128 74.1→80.0(GRPO 67.3/81.2,TaxS 0.029→0.028)。训练动力学显示:固定温度 PPO 的熵单调塌缩,PTGS 的熵全程保持高位且反复回升——同等终精度下保住了完全不同的策略(更可探索、更少税)。对照实验证明优势不等于「全局调高温度」:全局 T=1.5 在 FrozenLake 上反而降低 pass@128。
这组实验的证明力在于三层递进:现象层(曲线交叉、反超)→ 机制层(双峰化 + 两个零点的数学结构)→ 干预层(PTGS 改变 rollout 分布从而同时改善 pass@1 与 pass@128)。单看任何一层都可以有替代解释(比如「harness 恰好适合 base」),三层合起来构成了难以用偶然性解释的证据链。
关于任务材料中提及的「HF up=63」:我们在论文正文与附录中均未检索到可直接核验的该数字(最接近的是附录 Table 6 中若干任务分类占比数值),基于精读的严谨性原则,本节不采用无法溯源的数字。
六、效果优势的根源解释:为什么是这三套设计起作用
6.1 根源机制与证据链
SAVER 为什么必须以 S×A 为单元?
- 因果链:既有综述按组件分类 → 同一影响跨载体时被切成「记忆投毒」「提示注入」「越权」等多个互不相干的标签 → 权限在哪一跳被改变这一关键问题被分类边界遮蔽 → S×A 锁定「载体×操作」组合后,「哪一跳改变了角色」成为可定位、可比较的对象(论文实验已支持:AuthMem-Bench 固定命题与下游任务、只变来源授权,证明 consolidation 可以保留内容却擦掉使用约束;When Context Gets Root 证明 harness 重建上下文可赋予内容更高的实际角色)。
- 推论:内容审查(查这条文本有没有毒)与模型侧层级合规(查模型有没有违反可见指令层级)都替代不了转移点的权限审查——SAVER 称之为「正确的內容可以携带不正当的权限」(Takeaway 5.1)。
Safety Must Survive 的干预为什么有效?
- 历史分数的失效机制:新依赖改变了「哪些动作被允许」的语义,但 archive 里的分数是旧契约下的认证——过期认证被当作现行资格。score refresh 有效是因为它把「重新考核」从「生成新代码」中拆出来:刷新后系统先选中 archive 里已有的正确修复,编辑器一行新代码都不用写(论文实验已支持:22/48 持续 → 0 unsafe/48)。
- keep 规则的失效机制:全部候选被拒时返回现任,意味着检测环节的产出(拒绝)没有传导到执行环节——评估与部署是两个决策,keep 把它们焊死了。fallback 有效是因为它承认「拒绝」的语义应该是「换人」而不是「裸奔」(已支持:0% vs 100%)。
- founder 编辑有效的机制:失败程序携带的不仅是 bug,还有「产生 bug 的编辑语境」——从失败版本出发的修复要同时对抗错误行为与错误惯性;从正确 founder 出发,编辑器只需要重新走一条更谨慎的优化路径(已支持:14 vs 1 个不安全端点)。需要标注的是,「founder 编辑为何优于继承编辑」的深层认知解释(编辑器注意力被失败代码锚定)属于阅读者推测,论文只建立了行为层面的配对差异。
- 43% 节省为何能保留:validation/rollback 控制的是「什么在跑」与「坏了换谁」,不限制「优化目标本身」——效率收益来自程序内容,安全性来自选择规则,两者本来就不在一个变量上(已支持:288 块配对,全对端点 + >43% 节省)。
Sharpening Tax 的指标为什么有判别力,PTGS 为什么有效?
- A(K) 的两个零点结构(p=0 与 p=1 处 a_K(p)=0)是判别力的根源:后训练改善 pass@1 必然把一部分任务推向 p=1(零贡献),问题是它同时把多少任务推向 p=0(也是零贡献)——税恰好把「收益」与「代价」放进同一个测度里对账(Theorem 2 已支持:塌缩比例 λ 直接按比例收税)。
- PTGS 的有效机制:固定温度下,难 prompt 的组几乎全失败(零学习信号),GRPO 拿不到非零组相对优势、PPO 无成功可强化——这些 prompt 被「静默淘汰」出学习过程;PTGS 加热难 prompt 抬升其成功概率至中间区(Theorem 3 的 J_n 在 p=1/2 处峰值),让它们重新持续供血(已支持:Figure 40 显示 PTGS 显著降低零成功组比例;附录 F.3 案例显示 PPO 丢失的任务约半数被 PTGS 找回)。
6.2 相关工作检索与对照(交叉验证)
以下交叉验证文献均出自三篇论文的引用网络且可核验:
| 研究(链接) | 相似尝试 | 相关结论 | 与本批论文的差异 | 对根源解释的影响 |
|---|---|---|---|---|
| Large Language Monkeys(arXiv:2407.21787) | repeated scaling 提升覆盖率 | 覆盖随 K 平滑增长 | 当作性能手段,非诊断工具 | 支持「base 的中间质量可被算力赎回」,补充 Tax 的前提 |
| The Invisible Leash(arXiv:2507.14843) | 分析 RLVR 能否超越初始分布 | RLVR 难以逃出基础分布 | 数学/代码域、理论视角 | 支持「锐化普遍存在」,补充 agentic 域外证据 |
| ProRL(Liu et al., NeurIPS 2025) | 长时 RL 训练 | 声称可扩展推理边界 | 训练时长变量 | 相反结论:说明税非不可逆,长时间训练或可缓解——Sharpening Tax 的作者也承认「更重的 RL 是否超越 elicitation 仍开放」 |
| Spurious Rewards(Shao et al., ICML 2026) | RLVR 训练信号分析 | 奖励可能是虚假的仍有效 | 训练数据视角 | 限定:锐化程度依赖数据/任务分布 |
| Sleeper Agents(arXiv:2401.05566) | 持久潜伏行为 | 检测/清除不改变潜伏行为的存在 | 模型参数域 | 支持 SAVER「Incomplete Rollback」与「缺触发器≠安全状态」 |
| AgentPoison(NeurIPS 2024)/ InjecAgent / GhostWriter | 记忆投毒/间接注入 | 触发式检索污染可影响后续规划 | 单点攻击 vs 转移链 | 支持 violation 计数中 97/77 高位的来源结构 |
| STOP / DGM / AlphaEvolve(arXiv:2506.13131) | RSI 能力系统 | archive 式代际保留是常见设计 | 能力视角 | 补充 Safety Must Survive 的现实相关性:archive+历史分数是主流 RSI 控制器的默认配置 |
| Alignment Tipping Process(arXiv:2510.04860) | 自进化把 Agent 推离轨道 | 自进化可致漂移 | 现象层 | 支持「改进可致安全漂移」,Safety Must Survive 给出漂移持续的选择机制 |
| HarnessSafe / SkillMisevo-Bench / EVOMAL(SAVER 引用) | 跨载体延迟风险/技能谱系追踪 | 连接式追踪可行 | 单载体或单链 | 支持 SAVER「纵向评测议程」不是空想——已有局部实现 |
| Your Agent May Misevolve(Shao et al., ICLR 2026) | 自进化涌现风险分类 | 风险谱系 | 分类学 | 补充 SAVER 与论文二之间的桥梁 |
6.3 综合判断与未决问题
多项研究共同支持的机制:①「检测≠停止≠修复」的三分在模型后门(Sleeper Agents)、记忆投毒(AgentPoison)、RSI(论文二)三个独立载体上都有证据;②端点指标的盲区(pass@1、攻击成功率、最终正确性各自掩盖的维度)被三篇论文从不同方向证实;③锐化的覆盖代价在数学/代码(Yue 等)与 agentic(论文三)域均有观察。
仍属推测或有限的机制:①founder 编辑优势的认知层解释(锚定效应)是行为差异的合理推测,论文未做机制实验;②PTGS 的优势在 2 个玩具环境(Sokoban/FrozenLake、7B 模型)验证,向大规模 agentic RL 的迁移未证;③SAVER 的「纵向评测合同」(种子→适应→触发→暴露→修复→续跑→复测 8 步循环)目前只有局部实现(HarnessSafe 覆盖 7 载体族但无修复后复测),整链无人跑通。
适用条件与失效条件:税在大模型 + 大预算下几乎必为正,但小模型 + 小预算下锐化有益(税为负)——结论不可无条件外推;Safety Must Survive 的结论假设「验证器在测试条件内正确」,若验证器本身可被博弈(reward hacking),selection/retention 规则的修复力会被上界封顶;SAVER 框架对「语义不可见性」(摘要/嵌入部分溶解谱系)自身承认边界——追踪记录不能恢复被抽象抹掉的 lineage。
七、必要知识反推与通用性灵感
7.1 必要知识反推:做出这三篇论文最少需要知道什么
领域知识层:
- 自进化 Agent 的完整构成(参数/记忆/工具技能/工作流四类可复用状态)与它们的更新机制——没有这个清单,SAVER 的 Substrate 分类无从谈起;
- RSI 系统的实际工程(OpenEvolve 控制器、DGM 的 archive 与 parent sampling、STOP 的递归结构)——论文二必须能把这些上游组件「原封不动」接入自己的评估器,才能证明失败持续是主流控制器的默认行为而非自己造的稻草人;
- 主流 RSI 控制器(DGM 等)确实用「历史分数 + archive」做选择——这是实验一外部效度的前提。
方法论知识层:
- 系统综述协议(venue band、查询族、滚雪球、饱和停止规则、证据分级)——683 篇语料的可重复性靠它;
- 配对实验设计/匹配比较(matched comparison)思想——固定一切、只动一个决策变量,是论文二全部因果结论的来源;
- pass@k 无偏估计、Beta-Binomial 后验、Thompson 采样、生存分析(A(K) 与等待时间模型的对应)——论文三的指标与采样器建立在经典统计之上;
- 形式化验证的最小功力(Theorem 2/3 的构造性证明)。
工程知识层:
- 四类授权任务的可执行实现 + 独立效果追踪器(安全评估不能依赖被评对象自述);
- 多模型 API 编排(5+ 编辑器 × 多任务族 × 多 seed 的配对运行);
- 128 rollouts × 42 组合的评测算力组织与 bootstrap 置信区间。
知识融合的关键节点:三篇论文各自的最大化学反都发生在「把 A 领域的标准工具搬到 B 领域并意识到搬运会改变问题」的瞬间——SAVER 把信息流控制/出处追踪(安全老概念)作用于自然语言状态(语义不可见性使老工具失效,由此得出新议程);论文二把软件工程的回归测试/蓝绿部署思想引入 RSI 代际管理(「部署验证」本质是蓝绿部署的安全版);论文三把生存分析的等待时间模型嫁接到 pass@K 曲线(让「曲线形状」第一次有了概率语义)。
7.2 通用性灵感
灵感一:属性存活审查——任何「继承/复用」系统都需要 per-hop 的权限重验。 核心思想:内容正确性与使用正当性是两个独立属性,每次载体/角色/范围变化都需要重验后者。论文证据:SAVER 的 97 例 Provenance Loss 与 77 例 Authority Escalation;AuthMem-Bench 中结构化权限标签把未授权动作率从 16.9% 降到 0.0%(授权任务成功率 39.7%→40.0% 几乎无损)。推广场景:数据库视图的列级权限沿 ETL 管道传递;企业知识库中「内部草稿」被摘要进「对外报告」时的密级随行;代码仓库 fork 后 LICENSE 义务在衍生文件中的存续;多 Agent 系统中消息跨信任域时的来源标签保留。
灵感二:检测、修复、停止是三个独立的 SLA——把「拒绝之后做什么」写进系统规约。 核心思想:任何验证失败后的默认行为(保留现状/回退/暂停)是一个必须显式设计、显式声明的决策,不是验证的自然结果。论文证据:keep 规则下 42 失败根 0% 恢复 vs fallback 100%;432 状态中部署验证 0 unsafe vs 历史分数 132 unsafe。推广场景:CI/CD 中「测试全红时上一版本继续服役还是停机」;金融风控中「新模型未通过审计时旧模型保运行」;自动驾驶中「感知模块失效时降级策略的显式声明」;内容审核中「审核员不在场时的默认动作」。
灵感三:曲线形状即诊断——不要只看端点,要看到达端点的路径。 核心思想:一维端点指标(pass@1、准确率、成功率)天然掩盖分布信息,而「端点—预算」曲线的形状(面积、交叉点、双峰度)能暴露机制。论文证据:pass@K 曲线交叉与 36/42 正税;A(K) 的两零点结构把收益与代价放进同一测度;TaxS(8) 以 ρ=0.85 预测 TaxS(32) 使诊断可廉价化。推广场景:A/B 测试中「留存—时间」曲线而非 D7 留存点;推荐系统的多样性—曝光量曲线;学生教育的「掌握—练习量」曲线(双峰化 = 两极分化预警);医疗剂量—响应曲线的形状分型。
灵感四:为每个单元维护难度后验,按后验分配探索/利用资源。 核心思想:全局统一的资源强度(温度、预算、难度)必然对某些单元过载、对另一些浪费;廉价的逐单元后验估计 + 温和的自适应就能两头兼得。论文证据:PTGS 在 PPO/GRPO 双算法双环境同时提升 pass@1 与 pass@128(GRPO pass@128 55.3→72.5),熵全程不塌缩。推广场景:教育分层教学(学情后验决定题目难度);AutoML 的逐 trial 资源分配(学习曲线外推 + Thompson 采样);测试用例优先级排序(按历史缺陷发现率的后验);游戏难度动态调节(DDA)。
灵感五:评估要「续跑」——修复声明必须在恢复适应之后复测。 核心思想:干预后的干净探针只证明「当下干净」,不证明「保持干净」;真正的恢复评估必须让系统继续进化一段再复测。论文证据:SAVER Takeaway 8.4 与 8 步生命周期评测合同(Seed→Adapt→Delay→Trigger→Expose→Repair→Probe→Continue);论文二的「safe throughout ≠ safety restored」(每个 Sonnet 分支最终正确,但中间存在不安全执行)。推广场景:软件热修复后的 72 小时观察期;戒断评估的随访设计;组织变革后的 3 个月再审计;模型回滚后的持续红队。
结语
三篇论文放在同一周读,会得到一个超越任何单篇的整体判断:自我改进系统的安全工程,正在从「把好入口」转向「管好持续」。SAVER 画出了「持续」的全部解剖结构(载体×操作×违反×暴露×响应),并指出最薄弱的两段(转移激活控制、恢复与抗辩);Safety Must Survive 用配对实验证明了最薄弱段之一(检测后保留/恢复)的失败机制与修复方案;Sharpening Tax 则从能力侧提醒:即便安全工程全部到位,「改进」本身还有一个不可忽略的对价——你锐化了行为的可靠性,就可能在削平解的覆盖。可靠性(reliability)与可达性(reach)应当一起生长——这是论文三的结语,也恰好可以作为三篇合读的注脚:自进化 Agent 的成熟,不在于它改进得多快,而在于改进之后,安全与潜能都还在。