第一篇:On the Effectiveness of Kernel-Level Evidence for Agent Security 精读

论文链接:arXiv:2609.28915 代码仓库:录用后发布(语料、featurizer、检测器权重、LLM-judge harness、LoRA adapter、逐折结果) 发表时间:2026年9月 机构:University of Georgia(第一作者)+ Amazon Web Services(其余四位作者)——企业+高校合作 领域标签:cs.CR(密码学与安全)、Agent 安全

一、论文背景

要理解这篇论文,先要理解当下 LLM Agent 的部署形态。现代 Agent(如 Claude Code、Codex CLI)被接入生产基础设施后,拥有相当于一个完整用户 shell 的权限:读文件、调 API、执行 shell 命令。它们的插件生态以 MCP(Model Context Protocol)为承载面——这是一个 JSON-RPC 协议,tools/list 端点返回可用工具清单(名称、描述、输入输出 JSON schema),tools/call 端点按名称调用工具。截至 2026 年中,MCP 已列出超过 20,000 个第三方服务器,来源涵盖 npm、PyPI 和 GitHub 可安装包。生产部署日益容器化(Docker MCP catalog、Kubernetes MCP 模式等)。

问题在于:现有的 Agent 安全防御几乎全部工作在应用遥测层——也就是工具清单、用户 prompt、模型消息这三样东西。比如提示注入防护(prompt-injection guard)、schema 校验器、能力代理(capability broker),它们观察的都是「应用层证据」。

但有些威胁会绕过应用边界。想象三个场景:

  1. 一个第三方 MCP 包在正常工作中悄悄读取 /credentials,写入隐藏的临时文件,再发送到攻击者控制的服务器——用户要的是合法工作,得到的也是合法工作,但凭证已经泄露;
  2. Agent 读到的一份「看起来无害」的文档里嵌入了 payload,指示它对某个合成命令执行 bash -c;
  3. 工具描述里夹带的指令,诱导 Agent 在下一轮走向更宽松的工作流。

这三个场景里,应用层防御要么「在该层看不到任何异常」,要么「拒绝了错误的行为子集」。检测这些攻击需要意图之下的证据(evidence below intent)。对一个运行时观察者而言,有两类候选证据可见:一是 Agent 工具进程在容器内的 syscall 追踪(内核证据),二是被服务的协议面(应用层证据,即 tools/list 加 Agent 转录)。

之前的工作几乎孤立地仪表化这两层:AgentSight(eBPF 边界追踪+LLM 分析器)、ActPlane(内核事件上的 OS 级信息流策略)、Agent-Sentry/AuthGraph/FlowGuard(应用侧溯源图)——它们都是执法或可观测性系统,没有一个发布过在多种攻击入口向量上配对采集的语料库,因此「内核视图对 agent 形态的攻击是否携带判别信号」「跨层拼接是否优于任一单层」这两个问题从未被系统测量过。这就是本文要填补的空白。

二、论文定位和关联工作

本文所处的研究方向可以按三条谱系组织:

谱系一:Agent 安全基准与攻击目录。AgentDojo、Agent Security Benchmark、RedCode、AgentHarm、ToolEmu、MCP Security Benchmark、MCPTox、Trail of Bits 的 MCP 审计等基准,按投递向量、攻击者-工具标签、注入任务、CWE 或内容危害类别等异构轴来编目攻击。本文的关键区别是:这些基准都不按「传感器可观察的执行机制」组织攻击,也不采集内核证据——而 ACE 的 12 机制分类法(如「静默日志外传」「检索引用注入」)正是以运行时传感器看到的 concrete 指纹为轴。

谱系二:宿主入侵检测(Host IDS)的系统调用分析。这是从 1996 年 Forrest 等人的经典工作延续下来的领域,用 syscall 序列做异常检测(Creech & Hu 2013、Grimmer 2019 等)。但这些工作面向服务器工作负载,不是交互式 Agent 工作负载。本文用 Falco 默认规则包作为这一路线的「现成代表」,发现其在 ACE 上近乎随机(0.565 ID / 0.572 OOD)——因为 Falco 规则为服务器工作负载校准,而 Claude CLI 基线本身就 spawn shell、读凭证形路径、写隐藏临时文件。

谱系三:Agent 可观测性与执法系统。AgentSight(eBPF+下游 LLM 分析器)、ActPlane(OS 级信息流策略)触及了内核证据,但都是执法/可观测系统,不发布配对语料。本文的定位是测量研究而非系统构建:它发布第一个配对语料库,并在统一基底上比较 4 个检测器家族。

维度之前的路线本论文的突破
证据层几乎只在应用遥测层配对采集内核+应用两层
攻击组织轴投递向量/CWE/内容危害传感器可观察的 12 执行机制
语料无配对会话语料库ACE:4047 会话×17 威胁模型
检测器比较单系统各自评估10 检测器×3 视图统一基准

定位结论:本文是「Agent 安全检测的测量基础工作」——它不提出新防御系统,而是建立共同基底,回答「内核证据值不值得作为检测输入」这个问题。

三、问题定义

论文面对的具体场景:一个事后审计者(post-hoc auditor)观察单个已完成的 Agent 会话,判断该会话是否恶意。这与生产 EDR(终端检测与响应)和审计流系统的部署形态一致。

论文的核心洞察是:同一攻击机制在不同证据层上的可见性是结构互补的。比如「凭证读取后写入日志 sink」这一攻击,在转录里从不出现(应用层不可见),但在 syscall 里是清晰的 openat(.ssh/id_rsa) → read → openat(log) → write 链条;反过来「检索引用注入」的全部效应都是文本面操纵,没有特征 syscall 足迹,只有应用层能看见。

抽象问题可以形式化为:给定会话 $s = (\tau_k, \tau_a)$,其中 $\tau_k$ 是内核 syscall 追踪、$\tau_a$ 是应用层证据,构造三种视图的特征向量 $\phi_A(s)$(29 维)、$\phi_K(s)$(57 维)、$\phi_C(s) = [\phi_A \| \phi_K]$(86 维拼接),学习视图条件检测器 $d_V: s \to [0,1]$ 输出恶意评分。核心问题是:$\phi_K$ 单独是否携带判别信号?$\phi_C$ 是否系统性地优于 $\phi_A$ 或 $\phi_K$?

这个抽象的精妙之处在于「配对」:只有在同一个会话上同步采集两层证据,才能在逐会话级别学习互补性、做配对统计比较——这正是此前语料缺失导致该问题无法被测量的原因。

四、问题解法

论文的解法是一条「采集 → 特征化 → 检测 → 评估」的端到端流水线。

4.1 配对采集(先解决归因)

类比:这就像给每个实验对象配一台专属行车记录仪——记录仪拍到的每一帧都必然属于这辆车。论文的归因设计是「一容器一 strace 一根进程」:每个会话跑在独立的 Docker 容器里,容器有自己的 PID namespace,strace 以 -f 附加到容器的根进程树,跟随 fork/clone/exec。两个内核性质保证归因:PID namespace 界定进程血缘(容器外进程不可能是被追踪根的后代);每个容器自己的 strace 写自己的日志文件(没有共享写入目标,跨会话事件无法交错)。经验验证:30 个并发会话、8,240 个记录事件中,0 个事件携带共跑会话的 payload 标签(会话级归因精度 100%)。

每个会话产出四件套:会话元数据、完整 Agent 转录、被服务的 tools/list 清单快照、带完整 argv 与路径字符串的 syscall 追踪(15 个 tracepoint,覆盖进程生命周期、文件 I/O、网络 I/O、传感器完整性,平均每会话约 3,500 个传感器事件)。

4.2 攻击机制分类法(按传感器可见性组织)

ACE 的 17 个威胁模型组织为 12 个攻击机制、7 个 OWASP 对齐的留出折(A–G)。关键设计:同一恶意机制(如「读 payload 后执行 bash -c」)可经多个投递向量到达(篡改 MCP、投毒文件、投毒 web 响应、用户 prompt、投毒记忆文件),而传感器看到的可观察签名是共享的。六大投递向量家族包括:篡改 MCP 服务器(31 个真实第三方服务器,每个承载手工撰写的源码级补丁)、文件间接注入、web 间接注入、用户直接恶意 prompt、记忆投毒(CLAUDE.md/MEMORY.md 新会话再注入)、检索/多步链。

4.3 特征化(重命名不变)

86 维特征只观察结构计数与基数(session 总量、逐 syscall 计数/对数计数/速率、syscall 配对比、IP/路径基数),不读取机制特定的哨兵字符串——因此 featurizer 是重命名不变的,攻击者改名字符串不会逃逸。57 维内核特征来自 $\tau_k$,29 维应用特征来自 $\tau_a$(prompt 结构、schema 结构、工具调用轨迹、结果新颖性)。LLM/SLM 评审器消费的是同一证据的有界结构化(JSON)文本渲染而非数值特征。

4.4 十检测器 × 双评估体制

四大家族:经典(AdaBoost、XGBoost)、深度表格(预训练表格基础模型 TabPFN、TabICL,推理时上下文学习,无梯度训练)、LLM 评审(Qwen3-235B/80B/32B 冻结,2×2 的 prompt 模板×示例数扫描)、LoRA 微调 SLM(Qwen2.5-3B/7B、Llama-3.1-8B,逐视图逐折训练 108 个 adapter)。外加 Falco 默认规则包作规则基线。

两种评估体制是理解结果的关键:**5 折分层(ID)**测量分布匹配时的上限;**7 折 OWASP 对齐(OOD 留族)**每折完全留出一个 OWASP 锚定的攻击家族——训练集与 LLM 示例中完全不含该家族,测量对未见攻击形态的泛化。后者才是部署相关的数字。

五、评估指标与实验证据

主指标是 AUROC(受试者工作特征曲线下面积,越高越好,0.5 为随机),在 1,000 次 patch 聚类 bootstrap 上报告均值±标准误。

5.1 主结果:内核证据独立可判别,拼接普遍更优

检测器App-View OODKernel-View OODCross-View OOD
XGBoost0.7030.7500.850(较最佳单视图 +10.1pp)
AdaBoost0.6890.7330.840(+10.7pp)
TabPFN0.6330.7770.874
Qwen3-80B (K=1)0.6720.7410.810
Llama-3.1-8B LoRA0.6880.922(全文最强 OOD)0.791
Falco 默认规则—0.572(近随机)—

三个层次的结论:

  1. Kernel-only 独立可判别:所有非线性检测器在纯内核视图上 OOD AUROC 远超随机——经典 0.733–0.750,LLM 评审 0.725–0.775,微调 SLM 全部 >0.88,最高 Llama-3.1-8B 达 0.922。
  2. Cross-View 普遍更优:ID 下 10/10 检测器 Cross 最高,OOD 下 7/10 最高。配对聚类 bootstrap 比较显示 Cross > App 对全部 10 个检测器显著(每个逐点 95% 区间下界都大于零)。
  3. 跨攻击家族泛化:7 折留族下四大家族全部用内核证据达到 OOD >0.80。

5.2 为什么拼接会赢:机制分解(互补性核心证据)

Table 2 按 12 机制分解(ID),标记某视图携带信号的标准是其 10 检测器平均 AUROC 超过 α=0.75:

机制AppKernelCross携带信号的视图
Silent exfil via logging0.5860.9760.970K, C
Audit-log poisoning0.6080.9320.954C, K
Retrieval reference injection0.9060.7030.927C, A
Preference manipulation0.6870.7010.834仅 C
(其余 8 个机制)………多为 C, K, A

互补性一目了然:App 层在 3 个机制上低于 α 而 Kernel 能解(最典型是 silent exfil via logging:凭证读取与写入日志 sink 从不出现在转录中,App 只有 0.586,而 Kernel 达全语料最强单元格 0.976);反过来 Kernel 在 retrieval reference injection 上失效(0.703,攻击的全部效应是文本面操纵、无特征 syscall 足迹)而 App 能解(0.906)。Preference manipulation 是唯一没有单层能解的机制(0.687/0.701),拼接不仅清了 α=0.75 还清了 0.80(0.834)。Cross-View 是唯一在全部 12 个机制上清 α 的视图,并在 11 个上取胜。

5.3 与现成基线的对比

  • vs Falco 默认规则:训练检测器在相同证据流上高 16–35 AUROC 点;Falco 原生阈值下 recall 1.0@FPR 1.0(完全无判别力)。
  • vs Cisco mcp-scanner(预部署清单扫描):XGBoost Cross 达 92.2% recall@3.8% FPR,扫描器仅 15.9% recall@16.3% FPR,且 XGBoost 捕获了扫描器 74.8–97.9% 的漏检。
  • vs 从零训练表格 DL(MLP/FT-Transformer,OOD Cross 仅 0.664/0.670):预训练表格基础模型高 +0.21。
  • vs 原始序列 DL(LSTM/BERT-MIL/SetTransformer 0.517–0.578):会话级聚合(BERT-on-summary 0.836)高 25–32 点——会话粒度的结构化摘要优于逐 syscall 序列建模。

5.4 跨运行时迁移(ACE-XA)

主语料全部用 Claude CLI(claude-haiku-4-5)。作者另建 592 会话的 ACE-XA 语料,换 Mistral Devstral 2 123B + 自研 Python ReAct scaffold,跨 5 个 OWASP 折。检测器只在 ACE 上训练/微调/prompt,在 ACE-XA 上评分:XGBoost Cross 0.842、Qwen3-80B K=1 Cross 0.998、Llama LoRA Kernel 0.849——三大家族跨 runtime 迁移成功。TabPFN 例外(0.662),permutation importance 把崩溃追溯到单一特征 path_n_total(/tmp 开头的不同路径计数):Claude CLI 每个会话都写缓存/IPC 文件到 /tmp,而新 scaffold 在内存中处理工具结果,57% 会话该特征为零——单特征依赖的脆弱性反面教材。

5.5 实验设计如何支撑主张

这套设计精妙在于三点:其一,配对采集让「同会话双视图」比较成为因果干净的控制实验——差异只能来自证据层而非攻击实例差异。其二,留族 OOD防止「背题」性质的高分(训练分布内 0.99 不代表部署能力)。其三,良性类的难度设计:良性会话与恶意会话在判别性内核特征上逐特征中位数匹配,分离只存在于 p90 以上尾部——这排除了「良性太简单」的解释。灵敏度分析显示正类定义变化(加入 latent/dormant 会话)时 AUROC 变化有界(ΔFLD−F 低至 −0.179)。

六、效果优势的根源解释

6.1 根源机制与证据链

对比对象:基线是应用层单视图检测与 Falco 默认规则。应用层为什么曾经有效?因为提示注入、工具描述投毒等攻击的效应大量出现在转录与清单里。Falco 为什么在服务器领域有效?因为服务器工作负载有稳定的行为轮廓,spawn shell、读 /etc/shadow 等动作天然异常。

baseline 的根本局限(机制层面):应用层的盲区不是「没做 X」而是结构性不可见——工具进程在应用边界之下执行的 syscall 从不进入转录。silent exfil via logging 的 0.586 不是模型弱,而是凭证读取与写入日志 sink 这两个动作在应用层证据里不存在(论文实验已支持)。Falco 的盲区则是分布错配:其规则为服务器校准,而 Agent 基线行为本身(合法 spawn shell、读凭证形路径、写隐藏临时文件)恰好落在 Falco 的「异常」定义里,导致 FPR 1.0(论文实验已支持:native 阈值 recall 1.0@FPR 1.0)。

本文方法的根本性改变:不是「多加了一层特征所以好」(表面解释),而是配对采集+特征级拼接改变了检测器可获得的信息结构——两层各自覆盖对方的结构性盲区,树模型/表格基础模型可以在同会话上学习两层的互补尾部信号。因果链:配对采集(同会话双视图可学习)→ 计数/基数特征重命名不变(攻击者改字符串不逃逸)→ 特征级拼接(12 机制中 11 个 Cross 取胜、全部 12 个 Cross 清 α)→ OOD 0.850–0.922(泛化到未见攻击家族)→ 跨 runtime 0.842–0.998(特征刻画的是机制而非特定 runtime 的表面行为)。

反事实推理:若去掉跨层拼接只看单层,silent exfil via logging 在 App 层只有 0.586(不可接受),retrieval reference injection 在 Kernel 层只有 0.703(低于阈值)——Cross 同时解两者(0.970/0.927),反证互补性设计的必要性。TabPFN 的跨 runtime 崩溃(0.662)反向验证:一旦某模型依赖单一 runtime 特异性特征(path_n_total),迁移即断——而多特征均衡利用的 XGBoost 迁移稳健(0.842)。

6.2 相关工作检索与对照

研究(可核验链接)相似尝试相关结论与本文的差异与适用边界对根源解释的影响
AgentSight(arXiv:2508.02736)eBPF 边界追踪 Agent,用二级 LLM 关联意图流与动作流同样认为单层不足,需跨层(intent↔action)因果关联是可观测性框架(检测 prompt 注入、资源浪费),非配对语料+检测器基准;用 eBPF 而非 strace,开销 <3%支持:跨层因果关系是检测 Agent 威胁的关键前提,与本文 Cross-View 优势互证
AScope(arXiv:2603.04469)应用层语义与内核审计事件关联,重建跨层语义流,supervisor LLM 识别违规恶意意图可能只在下游执行效应中可观察,输入 guardrail 捕捉不到同期工作,多智能体场景,报告 F1 85.3%(节点级);是检测系统而非测量研究支持:独立团队从不同方法出发得出「必须看内核层执行效应」的一致结论
Falco 横向移动评估(Radboud 学士论文,cs.ru.nl)在 Kubernetes 上模拟 Microsoft 威胁矩阵攻击,评估 Falco 检测Falco 对服务器/容器工作负载(横向移动)大部分技术可检测,但需白/黑名单权衡 FN/FP攻击对象是 K8s 基础设施而非 Agent;说明 Falco 失效是工作负载错配而非工具本身缺陷限定:证明 Falco 在其设计场景有效,支持本文「规则为服务器校准故在 Agent 上近随机」的归因
Mercari Falco 威胁矩阵评估(falco.org 博客)重建 K8s 威胁矩阵,新写 Falco 规则并理解规避默认规则有覆盖缺口,需持续威胁建模补规则工程实践视角;与本文「默认规则包不足以应对新工作负载」一致补充:Falco 近随机不是 Falco 引擎问题,是默认规则与 Agent 工作负载的错配——为 Agent 定制规则是开放方向

6.3 综合判断与未决问题

多研究共同支持的机制:(1)内核证据对 Agent 威胁独立可判别——本文 10 检测器×4 家族一致 + AgentSight/AScope 独立采用内核层观测;(2)跨层组合优于单层——本文配对统计 + AgentSight 的 intent-action 关联设计。

仍属推测的部分:特征级拼接是否是最优融合方式(未与注意力融合、多模态对齐等高级融合比较——论文只证明了「拼接已足够好」);LLM 评审 OOD 下三个小模型(Qwen3-32B、Qwen2.5-3B、Llama-3.1-8B)Kernel-View 反超 Cross 的原因尚在分析(附录 K.4)。

适用边界与失效条件:附录 B 列出六大限制——传感器对纯工具返回操纵、时序通道、空白隐写盲(无 syscall 足迹的攻击内核层也看不见);清单快照仅一次;会话级归因(非实时检测);sinkhole 网络形状人工化;复现成本 $1,464–$8,545;单 Agent 单会话设定。若攻击者能操纵 ptrace 干扰 strace 自身,归因前提被破坏(论文承认 sensor-integrity monitoring 是未来工作)。对「检索引用注入」类纯文本攻击,内核层依然无能为力——跨层是必要而非充分。

七、必要知识反推

假设一个没有相关知识的人要做这项工作,他最少需要掌握:

领域知识层:LLM Agent 的运行形态(MCP 协议的 tools/list 与 tools/call 端点、工具进程树、转录结构)——不理解就无法定义「应用层证据」;Linux syscall 体系与 strace/ptrace 机制——不理解就无法设计 15 tracepoint 的采集面与归因保证;OWASP LLM Top 10 与 Agentic AI 威胁分类——不理解就无法构建留族 OOD 的对齐折。Docker PID namespace 的进程血缘性质——这是 100% 归因的设计约束。

方法论知识层:AUROC 评估与 patch 聚类 bootstrap(同补丁会话相关,必须聚类重采样否则区间虚假收窄);ID/OOD 双体制设计思想(为什么留族泛化才是部署相关数字);表格基础模型(TabPFN/TabICL)的上下文学习范式与 LoRA 微调配方(r=64, α=128);重命名不变特征工程思想(计数/基数而非身份字符串)。

工程知识层:容器化并发采集流水线(多会话隔离并发);恶意补丁的安全围栏设计(合成凭证、TEST-NET 保留 IP、环回监听器、静态补丁校验器——保证语料发布不成为攻击工具包);LLM 评审 harness 的有界摘要渲染(R1 渲染优于逐字渲染的消融结论)。

知识融合的关键节点:最关键的化学反应在「归因即设计约束」——把 IDS 领域的 syscall 分析传统与容器化部署形态结合,意识到 PID namespace+单 strace 能让归因成为内核性质的推论而非工程努力。第二个节点是「攻击机制分类法」——跳出安全基准按投递向量编目的惯例,改按传感器可观察签名组织,这直接决定了 12 机制分解能揭示互补性。第三个节点是 Falco 的选择——把宿主 IDS 的现成代表作为基线,让「为服务器校准的规则在 Agent 上失效」这一分布错配论点变得可测量。

八、论文中可以提取的通用性灵感

灵感一:证据层的结构性互补需要配对测量(信号利用类)

  • 核心思想:判断「新增信息源有没有用」的唯一可靠方法是在同一实例上配对采集、配对比较,而非各自为政地评估。
  • 论文证据:silent exfil via logging App 0.586 vs Kernel 0.976,retrieval reference injection 反转(App 0.906 vs Kernel 0.703)——只有同会话配对才能看到这种方向相反的互补。
  • 推广场景:① 软件测试中静态分析 vs 动态执行告警的价值评估;② 医疗诊断中影像 vs 化验指标的配对判别研究;③ 风控中设备指纹 vs 行为序列的互补性测量;④ LLM 评估中不同 judge 视图(代码/输出/轨迹)的配对一致性分析。

灵感二:按观察者视角组织分类法(问题定义类)

  • 核心思想:为检测/监控任务建分类法时,按「传感器实际看到什么」组织而非按「攻击者如何到达」组织——同一机制经多条投递路径共享同一可观察签名。
  • 论文证据:12 机制分类法让每机制可以定位「判别证据在哪层」,直接产出 Cross-View 设计依据。
  • 推广场景:① SRE 领域按遥测信号(日志/指标/追踪)组织故障模式目录;② 反欺诈按数据留痕组织手法分类;③ 内容审核按平台可观测特征组织违规类型学。

灵感三:身份特征 vs 结构特征——重命名不变性作为对抗鲁棒性设计(机制类)

  • 核心意图:特征只读结构与计数、不读身份字符串,则字符串级的混淆/重命名攻击自动失效。
  • 论文证据:86 维特征全部为计数/基数/比率,featurizer 显式重命名不变。
  • 推广场景:① 恶意软件检测避免依赖可换的 IOC 字符串;② prompt 注入防御避免依赖可绕过的关键词黑名单;③ 数据库审计用访问模式而非具体值建模。

灵感四:现成基线的失效往往源于分布错配而非能力缺陷(根源解释类)

  • 核心思想:把某领域 SOTA 工具迁移到新工作负载时,先问「它的假设在新分布下还成立吗」——Falco 的失败是规则校准错配,不是规则引擎不行。
  • 论文证据:Falco 在 K8s 横向移动场景有效(外部交叉验证),在 Agent 上近随机——同一引擎、不同工作负载、相反结论。
  • 推广场景:① 组织转型中沿用旧 KPI 衡量新业务;② 把 OCR 模型直接用于手写公式;③ 把代码评审 lint 规则用于生成式 AI 产出的代码。

第二篇:Scope Before You Persist: Preventing Cross-Family Interference in Agent Memory 精读

论文链接:arXiv:2609.29144 代码仓库:补充材料含生成器与评估器代码、密封 manifest、prompt、seed、端点路由、预算账本(随论文分发) 发表时间:2026年9月 机构:六位独立研究者(标注 Independent)+ Northwestern University + Pinterest, Inc.——独立研究者+高校+企业三方独立混合团队 领域标签:cs.AI、LLM Agent 自我改进/持续学习

一、论文背景

先从「冻结模型的自我改进」说起。LLM Agent 有两条改进自身的路线:一是改权重(训练),二是不改权重、改 Agent 程序本身——prompt、技能文本、外部 scaffold。后者近年涌现出一批「自指系统」:Gödel Agent 让任务 Agent 自我引用地改自己,Darwin Gödel Machine 维护一个自我编辑编码 Agent 的开放式档案。这类系统常被称为「自我改进」,因为某个被选出的后代优于其祖先。

但持久部署(persistent deployment)带来一个互补的新机会与新的失败模式:把局部反馈转化为一条持续改进的活序列,让它在反复出现的任务家族间保持有用。这里有个类比:一个技工在 A 类任务上学到一条经验,把这条经验写进自己的「通用工作手册」,然后所有任务都按这本手册执行——问题是,对 A 有效的规则可能对 B、C、D 有害。这在持续学习文献里对应经典的「灾难性遗忘/干扰」问题,只不过现在发生在自然语言技能记忆而非权重空间。

已有研究提示风险:内在自我修正可能不可靠(Huang et al. 2024),actor-judge 循环可能共享捷径(Pan et al. 2024),初始增益可能不迁移或不复现(Wang et al. 2026)。本文要问的是一个此前未被隔离研究的设计变量:当一个技能更新通过了验证(认证),它应该被部署到哪里?

论文的核心论点可以用一句话概括:认证范围 = 部署范围(certification scope = deployment scope)。持久记忆需要两个决策:更新是否被证据支持(认证)、以及证据授权它在哪里使用(检索范围)。两者必须匹配——在一个任务家族内收集的证据可能正当化第一个决策,却不正当化全局部署。

二、论文定位和关联工作

谱系一:自我修正与自生成学习。Self-Refine、Reflexion 等推理时 refinement 与言语记忆(不改权重)改善输出;STaR 等自训练(改权重)。两者都依赖生成与选择之间的质量不对称。当选择器无根据或可被利用时,迭代改进会饱和、回归甚至崩溃(Huang et al. 2024;Herel & Mikolov 2024 的 collapse of self-trained models)。本文的区别:专注持久 prompt 级状态,由程序执行提供不对称性(而非 LLM 自评)。

谱系二:持久 Agent 变化。自动化 Agent 系统设计(ADAS)、Gödel Agent(自指)、Darwin Gödel Machine(开放式档案)、Metaskill-Evolve(双时间尺度技能进化)、Mendel Gödel Machine(比较谱系)。这些工作确立了冻结基础模型可以改进外部 scaffold。关键区别:它们报告档案最优成员,本文研究部署谱系——即完整部署序列的表现,而非挑最好的存档点。最接近的持续评估工作(Wang et al. 2026a)报告只有回归感知优化器能在第二阶段迁移改进;本文则隔离出一个互补的设计问题——局部认证与全局记忆之间的范围错配。

谱系三:评估者误差依赖。Self-rewarding、meta-rewarding 让 actor 与 judge 共同进化,Red Queen Gödel Machine 使评估者协同进化显式化;Memory Reward Inflation 论证纠正性证据必须既追踪真相又有足够独立的误差。本文将这一思想在部署层面操作化:确定性程序执行与蜕变关系(metamorphic relations)补充 actor 可见的测试,密封执行把「同探针认证误差」与「前瞻跨家族干扰」分离。

谱系四:代码评估。EvalPlus 证明稀疏基础测试高估生成代码正确性;BigCodeBench 拓宽指令与库使用。本文的 PROCSTREAM-RSI 流供给生成实例与留出案例,同时保持任务语义熟悉且固定。

维度之前的路线本论文的突破
评估对象档案最优成员(archive-best)完整部署谱系(mean trajectory utility)
关注失败认证不准(假接受)认证范围与部署范围错配
解决方向更强验证器/更保守的门固定门、只改检索范围
核心发现—门足够保守仍出问题:范围不匹配才是根源

定位结论:本文不是「又一个更好的验证门」论文,而是首次隔离并证明「检索范围匹配」是与「提案质量」「门准确性」正交的第三根支柱。

三、问题定义

具体场景:冻结 actor $\pi_\theta$ + 持久自然语言技能 $K_t$(固定 360 字符)。每轮:actor 解 discovery 任务,冻结 editor 基于程序与可见失败提议 $K'_t$,门 $G_t$ 在配对探针任务上评估两者,$K_{t+1} = K'_t$(若接受)或 $K_t$(否则)。无权重训练。

核心洞察:把「自我改进」抽象为一个两决策问题——认证决策(更新是否被证据支持)与部署决策(证据授权它在哪使用)——此前的研究把两者混为一谈(通过认证=全局部署)。

类比:这就像药品审批。「认证」是临床试验证明了疗效,「部署范围」是适应症范围——只在某类患者身上做试验的药,不能自动获批用于所有患者。药物错配适应症的伤害不是「药不好」,而是「范围错了」。

形式化:家族范围检索 $K_t(f)$:来自家族 $f$ 的任务收到 $K_t^{(f)}$(有接受槽则该家族技能,否则初始 $K_0$)。活动策略恒为 360 字符——检索只改变供给哪个策略,不改变 prompt 预算。

命题 1(门漂移)把这个结构理论化:期望部署变化为正当当且仅当 $\pi\alpha G > (1-\pi)\beta L$($\pi$ 为提案有益概率、$G$ 为平均增益、$\beta$ 为假接受率、$L$ 为平均损失)。对条件独立证据通道的 AND 门,假接受率为 $\prod_j \beta_j$;但若各通道错误完全相关,加通道无用——边际验证准确度不够,附加证据的错误才重要。更关键的是:命题只覆盖门证据中已表示的结果,它无法保护一个未范围化的全局编辑免受「尚未出现的任务家族」的相互作用——round 0 时没有任何历史家族可查。

这个抽象的精妙之处:它把「最新-only 部署为何有害」「保守门为何仍出问题」「范围化为何有效」统一在一个框架内——前两者是 $\beta L$ 项与覆盖缺口,后者直接消除了覆盖缺口。

四、问题解法

4.1 ORC 门(Orthogonal Regression Control,正交回归控制门)

类比:ORC 像药品的多通道三期试验——每条通道独立考察一个侧面,全部通过才能上市。

每任务三个在线通道:4 个公开示例(pub)、4 个私有精确输出测试(priv,不在 actor/editor prompt 中)、≥6 个无答案蜕变检查(meta)。对任务 $i$ 与通道 $c$,计算候选减现任的通过率差 $d_{i,c}$。探针实例按当前家族+每个历史家族分组;对每个组/通道对计算确定性单侧 95% 配对 bootstrap 下界 $L_{g,c}$(n≤50,000 时精确枚举,否则 2,000 次种子抽样)。

接受条件($\delta_{new}=0$,$\delta_{reg}=0.02$)是合取:$L_{current,pub} \geq -\delta_{reg}$、$L_{current,priv} > \delta_{new}$、$L_{current,meta} \geq -\delta_{reg}$、所有历史组所有通道 $\geq -\delta_{reg}$,且无私有/蜕变不安全程序。合取的意义:防止单通道增益平均掉另一通道的回归。

关键泄漏边界:discovery 代码/可见错误/公开案例被摘要给 editor;探针任务 actor 可见但从不摘要给 editor;私有测试与蜕变结果只供在线门;checkpoint 分数记录在决策后但从不进入提议或接受 prompt;密封隐藏案例只由无模型审计者加载——这套边界把「认证误差」与「前瞻干扰」干净分离。

4.2 Scoped 检索干预(固定输出干预)

这是全文最精巧的设计:只改检索范围,其他一切固定。在 8 主流的 round-0 比较中,Global-ORC 与 Scoped-ORC 使用相同的 discovery 输出、候选、探针证据、接受决策——只有部署范围不同。这隔离了「跨家族暴露」机制本身,而非更强的 editor 或验证器。

4.3 PROCSTREAM-RSI v3.1 基准

12 轮代码修复流,9 个契约家族(boundary/rotation/ordering/normalization/nested/missing/prefix/chunk/tie-breaking),日程为 boundary, rotation, ordering, normalization, boundary, rotation, nested, missing, prefix, chunk, tie-breaking, ordering——重复使保持(retention)可观察。每家族一个种子派生的不透明协议 token;每轮 4 个 discovery + 4 个 probe 任务;固定银行每家族 1 个 checkpoint + 2 个 final 任务,共 123 任务/流。discovery 公开示例区分家族特定修复规则,而 probe/checkpoint/final 公开示例中性(给的 bug 程序已通过它们);私有、蜕变、隐藏案例行使该规则。oracle 语义与家族顺序在所有流中固定,seed 只变 token/名字/程序变体/案例。

关键度量选择:报告完整部署谱系——mean trajectory utility(MTU = $\frac{1}{T+1}\sum_t U_t$)、BWT(backward transfer,负值表示学新伤旧)、worst-family retention、final-bank 分数——而非 archive-best。

4.4 七种配对方法

Static(从不更新)/ Frozen-compute(与 ORC 同 editor/replay/门/评估调用但从不部署——控制「额外计算」效应)/ Latest-only(部署每个非空良构提案)/ Self-judge(actor 自估正确率取高者)/ Replay(当前公开均值增益+历史公开均值不回归即接受)/ ORC(完整通道门)/ Batch-ORC(editor 见累积 discovery 但只许最终提案一次部署)。外加 Scoped-ORC 检索干预。模型:Qwen3-Coder-Next(Parasail BF16 端点,temperature 0,actor 700 tokens、editor 500 tokens,全程冻结)。

五、评估指标与实验证据

5.1 主干预(8 主流):同提案同决策,只改检索范围

部署方式Mean traj.Final checkpoint接受数有害数
Static0.7750.77500
Global-ORC0.7130.70786
Scoped retrieval0.8160.81980

同样 8 个接受的更新,全局部署使 6 个有害;范围化后 0 个有害。配对优势:Scoped−Global = +0.103 [0.052, 0.151](sign-flip p=0.03125),Scoped−Static = +0.041 [0.022, 0.056](p=0.03125)。范围化检索平均阻止了 0.112 的 round-0 干扰。

5.2 七方法基线比较(8 主流):门本身不解释 Scoped 增益

方法MTUBWT接受有害
Static0.775000
Frozen-compute(~5× 成本)0.775000
Latest-only0.703−0.25312.06.25
Self-judge0.736−0.1403.381.75
Replay0.707−0.2407.883.88
ORC0.71301.00.75
Batch-ORC0.775000

三个关键读数:其一,每个全局更新方法都低于 Static——接受规则波及门证据之外的家族。其二,ORC 的 BWT=0 是「机械零」(只 round-0 接受、之后全拒),但其 6/8 接受降低下一隐藏 checkpoint——门足够保守(无回归)却仍然有害,证明问题不在门准不准而在范围。其三,配对对比 ORC−Replay +0.006(Holm p=1.0)、ORC−Latest-only +0.010(p=1.0)——门质量差异不显著,Scoped 增益不能由更好的门解释。

5.3 家族级机制证据

接受的 boundary 规则使 boundary 家族隐藏效用 +0.398,同时 missing −0.461、rotation −0.234、tie-breaking −0.148、chunk −0.117。定性谱系(附录 D)显示实例:seed 101 以「count values where low <= x <= high」收尾——这条规则在其 discovery 证据上合理、通过同家族密封门探针,但作为全局持久状态部署后固定 checkpoint 下降。这是「局部有效压缩被全局部署」的具体形态。

5.4 27 流全长度随机序扩展(主结果)

27 个种子(每个可能的首家族恰好 3 个),Global- 与 Scoped-ORC 在流内配对:

指标Global-ORCScoped-ORC
轨迹效用0.7850.848(+0.063 [0.037, 0.094],sign-flip p<10⁻⁴,Holm p<10⁻⁴)
终点 checkpoint0.7890.900
接受更新总数1263
≥2 次接受的流2/2719/27
有害/接受6/120/63

路由鲁棒性:学习路由器(字符 3–5gram 多项式朴素贝叶斯,仅用公开 discovery/probe prompt 训练,leave-one-seed-out)对留出 checkpoint prompts 243/243=100% 准确,与 oracle 路由重合于 0.848;fallback-on-miss 曲线刻画路由错误增加时的退化。

5.5 平衡随机进入复制与选择诊断

18 流复制(每个首家族×2):主效应 +0.041 [−0.004, 0.107](p=0.1875),final-bank +0.031 [0.001, 0.070];非当前家族变化 Global −0.047 vs Scoped 0.000——按构造共享当前家族增益,范围化把非当前家族变化压为恒零,直接隔离跨家族暴露。

选择诊断(479 个流内提案-轮比较):public 通道 AUROC 仅 0.752(209 个非安全比较中 197 个有害——公开通道的「增益」信号几乎与有害共线);private/metamorphic 通道把 AUROC 提到 0.998(误差相关仅 φ=0.164)。但即便如此:8 个 ORC 接受全部局部安全,只有 2 个改进下一全局 checkpoint——局部 PPV 1.00 → 全局 0.25。这是「更强验证器路线」不能解决本问题的直接量化证据。

转移诊断:GPT-OSS-120B 终点技能 hidden 通过率 Scoped 0.960 vs Static 0.941(+0.020 [0.004, 0.035],跨 actor 迁移有效);HumanEval+(32 题固定样本)Global-ORC 0.895 vs Static 0.914(全局技能对分布外代码有轻微伤害,范围化则不会外溢)。

5.6 实验设计如何支撑主张

设计有三处关键:其一,固定输出干预(同提案、同决策、同分数,只改检索)把「范围」从提案质量/门准确性/预算中因果分离。其二,随机化进入(27 流覆盖每个首家族)排除「首家族选择偏差」的解释。其三,七方法配对显示门质量变异(Latest-only 到 ORC)不改变「全局部署低于 Static」的模式,而单独改变检索范围就翻转结论——范围匹配是被隔离的那个因果变量。

六、效果优势的根源解释

6.1 根源机制与证据链

对比对象:Global-ORC(及一切全局部署方法)。它为什么曾经看似合理?因为「单一紧凑技能」是技能记忆系统的默认形态(如 360 字符全局 policy),且 ORC 门已含历史家族回归约束,看似安全。

根本局限(机制层面):不是「门不够准」(ORC 的 BWT=0、8/8 局部安全、局部 PPV 1.00 已经很准),而是证据覆盖的结构性缺口:命题 1 只能覆盖门证据中已表示的家族,round 0 时无历史家族可查——第一条被接受的 boundary 规则在门看来完美无缺,却对 8 个未见家族行使了未经验证的效力。全局单一 360 字符技能还带来挤占机制:局部有效的 boundary 规则推给所有家族,压缩了其他家族的有效约定(missing −0.461 等家族级数据支持)。此外还有「冻结效应」:全局 ORC 的首个有害接受之后,门(看到回归)拒绝后续所有提案——大多数流在首次接受后停止变化,反而 Scoped 允许 19/27 流多次接受(论文实验已支持:2/27 vs 19/27)。

本文方法的根本性改变:范围化不是「更强的验证」(表面解释),而是把部署的效力边界对齐到证据的授权边界——非当前家族变化恒为 0(按构造),门不再被自己的首个全局有害接受冻结,跨家族干扰的通道被物理切断。因果链:认证范围=部署范围 → 未见家族不再暴露于未经验证的规则(0/63 vs 6/12 有害)→ 门不再冻结 → 持续多次接受(19/27 流 ≥2 次)→ 轨迹效用 +0.063、终点 0.900。

反事实推理:若去掉范围化但保持 ORC 门不变——正是 Global-ORC 条件,0.713(低于 Static 0.775);若去掉门但保持范围化(Latest-only 家族版),按命题 1 的 $\pi\alpha G > (1-\pi)\beta L$ 条件,假接受将直接进入对应家族槽。两个组件各自必要。与「更强验证器」路线的机制区分在此最清楚:把 8/8 局部安全提升到 10/10 局部安全,仍解决不了「局部安全 ≠ 全局安全」的覆盖缺口——除非验证器能覆盖所有未来家族,而这在开放世界不可行。

6.2 相关工作检索与对照

研究(可核验链接)相似尝试相关结论与本文的差异与适用边界对根源解释的影响
Useful Memories Become Faulty When Continuously Updated by LLMs(arXiv:2605.12978)ARC-AGI Stream 等环境考察 LLM 持续整合记忆的失效整合记忆效用先升后降、可跌破无记忆基线;过度泛化的条目干扰邻近任务;episodic-only 控制反而竞争力强失效归因于整合步(分组错误、抽象剥离适用条件、窄流过拟合);非家族范围干预研究强支持:其「overgeneralized entries interfere with neighboring tasks」与本文跨家族干扰同构——不同环境独立得出「局部经验全局化有害」结论
Controlled Memory Interference in Continual LLM Agents(arXiv:2608.07622)受控诊断框架研究记忆在关系(强化/修订/干扰/投毒)下的演化关系特定干扰显著抑制更新可塑性且几乎无稳定性增益;投毒对更新权威线索比新近度更敏感通用长时记忆(偏好/事实)而非代码契约技能;诊断+数据生成而非部署谱系评估支持+补充:确认「干扰是结构性现象而非规模问题」,与本文「范围不匹配而非门不准」互补——一个从记忆关系、一个从部署范围切入
From Untrusted Input to Trusted Memory(MPBench,arXiv:2606.04329)系统研究 LLM Agent 记忆投毒:4 写入通道、9 结构漏洞、6 类攻击更激进写/检索记忆的 Agent 更可利用;现有 prompt 注入防御不覆盖记忆投毒攻击者视角(恶意写入)vs 本文的善意更新错误部署;安全 vs 持续学习视角补充:两者共同说明「持久记忆的写入与生效范围」是独立于内容正确性的治理维度——恶意与善意更新都需范围控制

6.3 综合判断与未决问题

多研究共同支持的机制:局部经验全局化部署引起跨任务干扰——本文家族级数据(boundary +0.398 / missing −0.461)+ arXiv:2605.12978 的 overgeneralization 干扰 + CMI 的关系特定干扰抑制,三者在不同环境一致。

仍属推测的部分:范围化在开放世界任务流上的表现——本文的家族路由器在模板化基准上 100% 准确(分布内诊断),错槽路由(把 A 家族任务路由到 B 家族技能槽)未测;家族自动发现(任务到来时如何知道属于哪个家族)在真实场景比字符 n-gram 复杂得多,作者列为未来工作。

适用边界与失效条件:单冻结模型(Qwen3-Coder-Next);9 个代码契约家族;模板化基准(oracle 语义固定);360 字符技能这个特定紧凑度(更长技能可能表现不同);「compounding 的累积一次性对照」未做。当家族间真正共享底层约定时(范围化会牺牲可迁移的有益规则),全局部署可能反而占优——本文的契约家族被设计为约定互斥,这是对范围化最有利的设定。若认证探针能覆盖部署分布的代表性样本(封闭世界),「更强验证器」路线仍可行——两路线在开放/封闭世界各有适用域。

七、必要知识反推

领域知识层:LLM Agent 的 prompt 级自我改进生态(Reflexion/Self-Refine 到 Gödel Agent/Darwin Gödel Machine 的谱系)——不理解就无法定位「档案最优 vs 部署谱系」的方法论差异;持续学习经典概念(BWT、可塑性-稳定性权衡、灾难性遗忘)——这些是评估指标的理论来源;代码生成的测试评估实践(精确输出测试、蜕变测试、EvalPlus 式的稀疏测试陷阱)——不理解就无法设计三通道证据。

方法论知识层:配对实验设计与固定输出干预——只改一个变量、其他全部冻结,这是把「范围」从混杂因素中分离的唯一途径;单侧 bootstrap 下界与合取决策规则(为何合取防止单通道增益平均掉另一通道回归);sign-flip 配对检验与 Holm 校正;命题 1 式的简单概率模型(παG > (1−π)βL)——用最小形式化捕捉关键定性结构(错误相关性 vs 独立性);密封评估与泄漏边界设计(editor 见什么、门见什么、审计者见什么的角色矩阵)。

工程知识层:冻结端点的确定性推理配置(temperature 0、固定 seed、字符级 padding 使 prompt 预算与策略长度无关);事务性预算账本(SQLite BEGIN IMMEDIATE、模糊超时的保守计费、无部分结果进入分析);种子驱动的程序化基准生成(oracle 语义固定、token/name/变体随机化)。

知识融合的关键节点:第一个节点是「两决策解耦」——把「自我改进」这个混沌概念拆成认证与部署两个正交决策,问题立刻从「如何更准地验证」转变为「验证授权了什么范围」。第二个节点是命题 1 与实验的对接——命题的覆盖缺口(round-0 无历史家族)精确预言了 ORC 门 8/8 局部安全却 6/8 全局有害的实验事实,形式化与经验在此咬合。第三个节点是固定输出干预的设计——意识到同一批接受决策可以在两种检索范围下「重放」,比较因此因果纯净。第四个节点是评估哲学的转变——从 archive-best 到部署谱系,这决定了「有害接受」这类在存档制下不可见的失败模式浮出水面。

八、论文中可以提取的通用性灵感

灵感一:认证范围 = 部署范围(机制类,本文最普适的原理)

  • 核心思想:任何「通过验证即生效」的系统中,验证证据的覆盖范围必须匹配生效范围——证据授权什么,就只能部署到什么范围。
  • 论文证据:同 8 个接受更新,全局部署 6 个有害、范围化 0 个有害;0.713 vs 0.816。
  • 推广场景:① 药品审批的适应症范围管理(试验人群≠全体患者);② 金融风控模型的适用客群限定(训练分布外的客群禁用);③ 特性开关/灰度发布(验证环境≠生产全量);④ 法规合规的区域性认证(GDPR 合规不等于全球合规);⑤ LLM 工具调用的权限作用域(验证过的操作只在其上下文内放行)。

灵感二:更强的验证器不能替代范围控制(问题定义类)

  • 核心思想:当验证证据结构性无法覆盖部署分布的全部(尤其未见部分)时,提升验证器精度是死路——必须缩小部署范围到证据覆盖范围。
  • 论文证据:ORC 门局部 PPV 1.00 → 全局 0.25;479 比较中 private/meta 通道 AUROC 0.998 仍无法阻止 6/8 接受降低全局 checkpoint。
  • 推广场景:① 自动驾驶的 ODD(运行设计域)划定;② 软件测试覆盖不足时限制功能发布面;③ AI 医疗诊断的适应症审批;④ 供应链安全中「审计过什么就信任什么」的传递边界。

灵感三:多通道证据的价值在于错误的独立性(信号利用类)

  • 核心思想:附加验证通道只有在其错误与现有通道不相关时才降低假接受率——边际准确度提升可能是幻觉。
  • 论文证据:命题 1:条件独立时 AND 门假接受率为 Πβⱼ,完全相关时加通道无用;实验中 public 通道 0.752 与 private/meta 0.998 误差相关仅 φ=0.164,合取才有效。
  • 推广场景:① 多签名审批机制的设计(签名人独立判断才有意义);② 集成学习的多样性要求;③ 红队+自动化测试的互补部署;④ 学术同行评审的多审稿人独立性。

灵感四:评估完整部署谱系而非最优存档(评估方法论类)

  • 核心思想:报告「系统演进过程中真实经过的每一步」的平均表现,而不是「事后挑出的最好一步」——前者才是用户实际体验的。
  • 论文证据:Archive-best 会掩盖 Global-ORC 的有害接受;mean trajectory utility + BWT + worst-family retention 才暴露 0.713 < 0.775 的倒挂。
  • 推广场景:① 在线学习系统的全周期 A/B 而非离线最优 checkpoint;② 训练过程的轨迹可视化与早停判断;③ 产品迭代的全版本留存分析;④ 自动优化系统(NAS/超参搜索)的搜索过程成本核算。

灵感五:持久状态是安全与学习双重治理对象(跨域迁移类)

  • 核心思想:能跨时间影响行为的持久状态(记忆、技能、配置)需要独立的「写入治理+生效范围治理」,其风险独立于内容正确性。
  • 论文证据:善意但范围错误的更新造成 0.112 的 round-0 干扰;外部交叉验证(MPBench、CMI)显示恶意写入与善意错配是同一治理平面的两类威胁。
  • 推广场景:① Agent 记忆系统的写入权限与作用域设计;② 数据库迁移的生效范围控制;③ 组织知识库的「局部经验」标记与误用防范;④ 微服务配置漂移的作用域隔离。

两篇论文放在一起看,恰好构成 Agent 基础设施的一体两面:第一篇向下钻到内核层,证明检测需要跨层证据互补;第二篇向内收紧记忆的作用域,证明学习需要认证与部署范围匹配。共同的方法论底色是「配对测量隔离单一变量」——一个是同会话双证据视图的配对,一个是同提案同决策双检索范围的配对。对 Agent 系统构建者的启示:无论是观测管道还是记忆管道,「证据/授权的作用范围」都是一等设计变量。