一、论文背景

**仓库级编码对 agent 意味着什么?**在真实仓库里改代码,agent 必须同时保持测试、导入、配置、迁移规则的一致——而这些事实散落在数千个文件与漫长的项目历史中,agent 的上下文窗口却是有界的。这像极了操作系统的问题:进程不能把全部数据装进内存,须依赖工作集调度。论文直接借用了 Denning 1968 年工作集虚拟内存的思想——但立即指出仓库事实与内存页的本质区别:事实没有地址、没有失效位——一段散文式的迁移规则和一份过时的实现可能编码了同一事实的不同版本,没有任何机制告诉 agent 哪个是现行的。

为什么相关性研究不够?已有工作建立了仓库级评测(SWE-bench)、工具使用回路、结构感知检索,并观察到"成功的 agent 编辑前会收集上下文"。但这些全是相关性证据——无法回答因果问题:哪些事实必须在写入时可得?近期上下文与参数记忆能否互相替代?

二、论文定位和关联工作

研究谱系代表工作核心思想与本文的关键区别
仓库级评测SWE-bench 系端到端修复率度量只测结果,不测信息通道贡献
上下文收集Mehtiyev & Assunção 等成功agent编辑前读文件的观察相关性;本文因果操纵
结构感知检索Ouyang 等用仓库结构引导检索检索启发式;本文测其因果前提
长上下文研究上下文工程系更长上下文/压缩/记忆本文给出"上下文何时有用"的机制条件

定位结论:本文是首个对编码 agent 两个信息通道(近期上下文/参数记忆)做受控因果操纵的工作,问题比方法新——它回答的是机制问题而非提出系统。

三、问题定义

具体场景:agent 在仓库中执行编辑任务(API 迁移、配置更新),每次编辑依赖若干"必需事实"(迁移规则、新 API 签名、兼容性约束)。

核心洞察:把任务建模为耦合事实图的重建——节点是事实,边是"同一次编辑须同时用到"的耦合关系。agent 的两个信息通道:近期上下文(工作集内)与参数记忆(预训练知识)。一致性负债 = 两通道都不覆盖的必需事实集。

形式化:对编辑 e,必需事实集 F(e);上下文覆盖 C(e) ⊆ F(e)、记忆覆盖 M(e) ⊆ F(e);coherence debt(e) = F(e) \ (C(e) ∪ M(e))。求:操纵 C 与 M 的供给/扣押,度量任务完成率与债务的关系。

抽象的精妙之处:从虚拟内存借形(有界容量+工作集),但修正其神(无地址、无失效位)——这解释了为什么"更多上下文"不能照搬"更多内存"的收益逻辑:多出来的上下文若不含与当前编辑耦合的事实,只是噪声。

四、问题解法

实验设计(因果操纵四件套):

  1. 虚构 API 迁移闭卷:四个虚构 API 迁移任务(各 12 项机械可查要求),agent 只见任务描述、无工作区无工具——两通道皆空的下限测量。
  2. 前置加载对照:完全相同的任务,但把精确规则与源文件前置入提示——只有上下文通道供给的差异。
  3. 真实 Pydantic 迁移 + 全重命名孪生:真实迁移(记忆可帮)与其每个 API 名重命名的孪生版本(记忆失效,只留结构)——分离参数记忆贡献。
  4. 工具使用轨迹测量:真实工具运行中,测量"编辑某文件前刚读过其哪些依赖";再用合成任务(事实由作者自造,故完全已知)验证。

对象:7 个模型 × 5 种 harness——结论跨模型与跨 harness 检验。

五、评估指标与实验证据

五大结论(论文从证据中提取):

  1. 双通道皆空 → 无一模型完成:闭卷虚构 API 上全部模型失败——能力下限被钉死在信息可得性上,而非推理力。
  2. 事实前置 → 任务可解:同样的任务、同样的模型与工具面,仅前置规则与源文件即完成——瓶颈确认在事实供给。
  3. 上下文亚可替代性:更多上下文只在包含与当前编辑耦合的事实时提升表现——相关但不耦合的上下文不帮忙。
  4. 分解的条件性:分解(把任务拆小)只在分区让"互相一致的事实"同处一分区时有效——按错误边界分解会制造新负债。
  5. 工具轨迹验证:成功编辑前,agent 确实刚读过该文件的依赖(工作集行为在真实工具运行中复现)。

实验设计为何有证明力:供应/扣押操纵是标准的因果推断设计(类似删除实验);全重命名孪生控制了任务结构、只破坏记忆——记忆贡献的净效应;合成任务的事实完全已知——覆盖度量无误差。

六、效果优势的根源解释

(本文不主张方法优于 baseline,而主张机制发现的解释力。)

为何"更多上下文"常失效:上下文的收益条件是"包含与当前编辑耦合的事实"——不满足时,上下文增长只带来稀释与噪声(与 StateM 的"控制信号稀释"互证)。

为何参数记忆不可靠:记忆中的 API 知识是训练分布的快照——版本漂移后与仓库现状不符;全重命名孪生证明记忆失效时任务仍可解(靠上下文),但成本结构改变。

“一致性负债"概念的机制价值:把"agent 改坏了"归因到"哪个事实在写入时刻不可得”——为上下文工程(检索什么、何时检索、缓存什么)提供了第一性的目标函数:最小化写入时刻的负债,而非最大化上下文总量。

七、必要知识反推

领域知识层:操作系统工作集与虚拟内存理论——概念借用的源头及其失效条件(无地址/失效位)的识别;软件工程的迁移任务语义(API 演化、兼容性约束)——任务设计的基础。

方法论知识层:因果推断的操纵设计(供应/扣押/孪生控制);受控实验的任务构造法(虚构 API 防记忆污染、全重命名孪生分离通道);跨模型跨 harness 的结论稳健性检验。

工程知识层:多 harness 的统一轨迹采集;工具调用的依赖分析(编辑前读过哪些文件);合成任务的机械可查要求设计。

知识融合的关键节点:“仓库事实 = 无地址内存页"的类比修正——把 60 年前的工作集理论迁移到 agent 上下文工程,同时精确指出类比的破裂点。这要求对两边的深刻理解:不懂虚拟内存就借不到形,不懂仓库语义就发现不了破裂。

八、论文中可以提取的通用性灵感

1. 概念迁移要修形式也要修神。工作集的形(有界容量)可借,神(地址寻址+失效位)不可借。推广场景:把生物进化论迁移到算法设计时的适应度地形修正;把经济学供需迁移到注意力市场时的稀缺性重定义。

2. 债务框架:把"将来会出错"量化为"当下缺什么”。一致性负债聚焦写入时刻的缺失。推广场景:技术债的利息模型(此刻缺测试→将来付维护成本);组织知识管理的"关键岗位知识覆盖度";教育的先修知识诊断。

3. 相关性证据升级为因果证据的路径:操纵+孪生。供应/扣押与全重命名孪生。推广场景:A/B 测试的配对设计;医学的安慰剂对照与同卵双生子研究;经济学的自然实验利用。

4. 多不一定好:资源的价值取决于与需求的耦合。上下文只在含耦合事实时有用。推广场景:信息过载时代的信噪比管理;团队沟通的"按需同步";缓存系统的局部性原理。

5. 分解的正确边界由一致性而非规模决定。分解只在让互相一致的事实同分区时有效。推广场景:微服务拆分的一致性边界;项目管理的任务依赖聚类;联邦学习的客户端分组。