CAMG × Comet-9B:文件即记忆与程序状态推理的 Agent 训练新范式 精读
本篇精读两篇 2026 年 9 月的代码 Agent 训练论文:京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外(surprisal 6.371 vs 0.252 nats/token),转而用纯任务奖励让 shell 文件操作自发生长为记忆,4B 模型追平 35B;UCSB 与微软合作的 Comet-9B 不直接训练写补丁,而是训练「程序状态推理」(bug 何时触发、错误如何传播),反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论:不直接优化目标行为,而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开,并用外部文献交叉验证两大机制。