论文链接:Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents (arXiv:2609.27334) 发表时间:2026年9月 机构:Salesforce AI Research 领域标签:cs.AI / Agent Memory / LLM Agents
一、论文背景
LLM 智能体(Agent)正在从「一问一答」走向「长生命周期任务流」:客服智能体连续处理成千上万个工单, embodied 智能体在同一个家庭环境里接连完成数百个家务任务。每个任务都从零开始,等于白白扔掉了智能体最宝贵的资产——自己的过往经验。智能体记忆(Agentic Memory) 研究的就是如何把过去轨迹中的信息持久化下来,供未来任务复用。
过去三年的主流做法可以概括为一句话:任务做完立刻「写总结」。这个范式由几个经典工作奠基:Reflexion 在任务失败后生成语言反思存入记忆(arXiv:2303.11366);Voyager 把成功行为固化为可执行代码技能存入技能库(arXiv:2305.16291);AWM 从轨迹中归纳可复用工作流(arXiv:2409.07429);ReasoningBank 从成功与失败经验中蒸馏可迁移推理策略(arXiv:2509.25140)。这些方法的共同结构是:写时蒸馏成固定制品(反思/洞见/工作流/技能/策略),读时按相似度检索并塞进上下文。
这个「写时塑形」范式有两个与生俱来的代价:
- 信息丢失过早且不可逆。蒸馏发生在任务刚结束的时刻,此时系统还不知道未来查询是什么。一旦细节被丢弃,后面依赖这些细节的任务就永远无法找回。就像刚下飞机就要求你把这次旅行总结成一句话——如果半年后朋友问的不是「好玩吗」而是「那家餐厅叫什么」,你就答不上来了。
- 单一制品要服务所有可能的查询。同一条轨迹往往包含多堂「课」:一次家庭交互既可能教给后续任务一个状态转移模式(如何加热/冷却物体),也可能教给另一个任务一个物体摆放策略。写时蒸馏被迫在不知道谁来检索的情况下,提前押注一种「讲法」。
还有一个被掩盖的问题:写时 curator 很难学。一个存储决策的价值,可能要到很多个任务之后、某个相关查询到来时才显现——这是一个长时程信用分配问题。SkillOS 这类用 RL 训练写时 curator 的工作,不得不人为把相关任务分组来制造学习信号。
本文的核心追问是:记忆到底应该在生命周期的哪个时点被塑形? 答案是:推迟到读时(just in time),等当前任务已知了再蒸馏。
二、论文定位和关联工作
论文把智能体记忆 landscape 划成四个谱系,JITMEM 站在第四个谱系的最前沿。
谱系一:启发式写时记忆。写时由 prompted LLM 蒸馏、读时相似度检索。Reflexion(反思)、ExpeL(洞见)、Voyager(技能代码)、AWM(工作流)、MemP(多粒度记忆项)、Generative Agents(记忆流+周期摘要)、A-MEM(自组织链接笔记)、ReasoningBank(成败两方蒸馏推理策略)皆属此类。共同点:curation 在写时触发,制品与查询无关。
谱系二:学习式写时记忆。直接训练记忆写入门策略:Memory-R1、Agentic Memory(渐进 GRPO 课程)、Memento(案例选择策略)、MemRefine(离线压缩合并)。最近的 SkillOS(arXiv:2605.06614)用 GRPO 训练技能 curator,是本文最强基线,但因奖励延迟到达而必须依赖任务分组。
谱系三:会话内工作记忆。Sculptor、ContextCurator、MemSearcher 等用 RL 管理单任务执行内的上下文窗口。它们优化的是会话内上下文,JITMEM 优化的是跨任务的持久情景记忆,层次不同。
谱系四:读时上下文处理。Synapse 检索完整轨迹做示范但不蒸馏也不以任务为条件;SkillTTA 测试时合成任务条件技能,但来源是预建静态池;MemHarness(arXiv:2607.28272,与本文同期)同样主张读时,但它用单一策略同时负责改编经验和执行任务,curator 与 executor 纠缠在一个模型里,导致训练出的策略无法跨执行器迁移;JITMEM 把 curator 与 executor 解耦(executor 全程冻结),一个 curator 可服务多个 executor,并运行在持续增长的流式记忆库上。
| 维度 | 启发式写时 (ReasoningBank) | 学习式写时 (SkillOS) | 读时纠缠 | JITMEM |
|---|---|---|---|---|
| 塑形时机 | 写时 | 写时 | 读时 | 读时 |
| curator 可训练 | 否(prompt) | 是(需任务分组) | 是 | 是(原生奖励即可) |
| payload 任务自适应 | 否 | 否 | 是 | 是 |
| 跨执行器迁移 | — | — | 否(策略绑定单模型) | 是(executor 冻结) |
| 存储损耗 | 有(蒸馏) | 有(蒸馏) | — | 无(原始轨迹) |
定位结论:JITMEM 是首个「读时塑形 + RL 训练 curator + 解耦执行器 + 持久流式记忆库」四合一的框架,其真正的论点是:写时 vs 读时这个时机选择,比 curator 用不用 RL、用什么模型,是更一阶的变量。
三、问题定义
论文从「未来效用」视角把记忆问题抽象到极致:记忆只有在改善未来任务表现时才有价值。由此引出最本质的形式化:
- 给定:任务流 $\{x_1, x_2, \ldots, x_T\}$ 逐个到达;每个任务 $x_t$ 产生轨迹 $\xi_t$ 与成功奖励 $r_t \in [0,1]$。
- 求:一个塑形策略(何时、如何从原始轨迹提取/压缩信息),最大化 $\mathbb{E}[\sum_t r_t]$。
- 约束:塑形发生的时刻,决定了此刻掌握的信息量——写时不知道 $x_{t+1}, \ldots, x_T$,读时知道当前 $x_t$。
这个抽象的精妙之处在于把「记忆设计」重新表述为「信息压缩决策的时机选择」问题。写时塑形等价于在需求未知时做有损压缩,其信息损失不可逆且必须对所有查询统一;读时塑形把压缩决策推迟到需求已知,同一条原始轨迹可以按需产出不同的视图。这与认知科学中「情景记忆是重构性而非回放性」的观点(Schacter & Addis, 2007)同构:人脑存储的是原始情景,回忆是按当前目标重构的过程。
同时它揭示了一个学习论上的结构差异:写时 curator 的动作(存储决策)与奖励(未来某任务受益)之间隔着任意长的任务序列,是天然的延迟奖励问题;读时 curator 的动作(产出 payload)与奖励(当前任务得分)之间零步延迟,信用分配塌缩为单步。
四、问题解法
JITMEM 由四个组件构成:记忆库 $M$、检索器 $R$、curator $\pi_\phi$、冻结执行器 $\pi_L$。只有 curator 可训练。每个任务走四步流水线:
- 检索:$\hat{\xi}_t = R(x_t, M)$。BM25 只对任务描述做 top-k 检索(主结果 k=3),与轨迹长度解耦、保持轻量。检索器不训练,训练测试同配置。
- 蒸馏:$p_t = \pi_\phi(x_t, \hat{\xi}_t)$。curator 读「当前任务描述 + k 条原始轨迹」,合成一份紧凑的自然语言 payload——标识最相关经验、提炼对类似任务有效的策略、给出针对当前任务的具体指导。因为输入含 $x_t$,同一条轨迹对不同任务产出不同 payload,这就是任务自适应属性。类比:写时方法像提前印好的通用说明书,JITMEM 像一位看着你的订单现场定制简报的参谋。
- 执行:$(\xi_t, r_t) = \pi_L(x_t, p_t)$。payload 前置注入执行器 prompt,执行器只消费紧凑 payload 而不直接啃原始轨迹。
- 更新:$M_{t+1} = \text{UPDATE}(M_t, \xi_t, r_t)$。payload 用后即焚,不落库;只有执行产出的轨迹 $\xi_t$ 经质量门控后入库。
三个关键设计各有一层反直觉:
记忆库只存原始轨迹,零蒸馏。每条记录是任务描述 + 完整观测-动作交错序列,不摘要、不反思、不抽象。这看似浪费,实则保留了对不同任务产出不同视图的可能性。
质量门控用 executor-as-judge。部署时没有真值标签,就用执行器模型自判任务是否成功,只让成功轨迹入库(保持检索样本为正例)。消融显示这比「全存+标注成败标签」干净 1.5–3.4 个点——即便 curator 看得到失败标注,也压不住失败轨迹引入的噪声。
curator 训练用 GRPO、奖励是基准原生指标。每个训练任务采一组 G=8 个候选 payload,冻结执行器逐个尝试,返回原生得分(ALFWorld/τ² 是二元成功,WebShop 是连续分数),组内 advantage $A_i = r_i - \text{mean}_j r_j$(省略 std 归一化),更新 curator,无价值网络。curator 用 Qwen3-8B(关思考模式)初始化,仅训练 100 步(lr 1e-6、batch 32)。核心性质:$r_t$ 是 $p_t$ 的直接函数,无任何中间步骤,信用分配零延迟——因此不需要 SkillOS 那样的任务分组脚手架和内容质量辅助奖励。训练库在训练期间固定(用真值标签筛成功轨迹,保证奖励反映 payload 质量而非库的随机涨落)。
写时 vs 读时两种范式的全景对照:
| 环节 | 写时范式 (SkillOS/ReasoningBank) | 读时范式 (JITMEM) |
|---|---|---|
| 写时做什么 | 蒸馏成固定制品 | 原样存轨迹(零损耗) |
| 写时信息损失 | 有、不可逆 | 无 |
| 读时做什么 | 相似度检索制品、原样注入 | 检索轨迹 + curator 联合任务蒸馏 |
| payload 与任务的关系 | 查询无关、一份制品服务所有查询 | 任务自适应、同轨迹多视图 |
| curator 训练信号 | 延迟(未来查询时才回赏) | 即时(当前任务原生得分) |
| 训练所需脚手架 | 任务分组 + 内容质量奖励 | 仅任务奖励 |
| 额外开销 | 写时一次蒸馏调用 | 每任务读时一次 curator 调用 |
五、评估指标与实验证据
指标体系:主指标为成功率 SR(三个基准通用的基准原生评估,衡量「记忆是否转化为任务完成」);辅指标为 WebShop 连续分数、token 数与执行步数(衡量效率)、执行器迁移差值(衡量学到的策略通用性);消融指标验证任务条件化、质量门控、原始轨迹保留、检索经验依赖四个设计的独立贡献。
基准选择:ALFWorld(文本具身家务,140 测试任务)、WebShop(网购,500 实例)、τ²-bench(航空/零售/电信多轮工具对话)。三者覆盖「程序性知识密集→事实检索密集」的谱带,能有效区分记忆方法优劣。评估用批式流式协议(批内共享库状态,批后更新库),报 3–4 次随机任务排序的均值±标准差。基线复现做到保守:所有 no-memory 复现值不高于 SkillOS 报告值。
主实验(Qwen3-8B curator + RL 训练,最强基线为 SkillOS):
| 基准(执行器) | 最强写时基线 | JITMEM | 提升 |
|---|---|---|---|
| ALFWorld SR (Qwen3-8B) | 61.2 (SkillOS) | 77.4 | +16.2 |
| WebShop SR (Qwen3-8B) | 16.5 (SkillOS) | 32.8 | +16.3(Score 61.1 vs 40.6,+20.5) |
| τ²-bench Micro SR (GPT-5.4) | 71.7 (ReasoningBank-GPT) | 75.6 (JITMEM-gpt) | +3.9(Telecom 域 +11.0) |
| ALFWorld SR (Gemini-2.5-Pro) | 80.2 (SkillOS) | 86.2 | +6.0 |
| WebShop SR (Gemini-2.5-Pro) | 41.3 (SkillOS) | 50.5 | +9.2 |
τ²-bench 上 Airline/Retail 域各记忆法均未超过 no-memory 的方差范围,唯 Telecom(多步策略验证最复杂)大幅受益——读时蒸馏的价值集中在需要合成程序性指导的任务,而非简单事实检索任务,这是论文自己给出的适用边界证据。
两个「不训练也赢」的对照(隔离塑形时机与 curator 能力):同用 Gemini-2.5-Pro 做 curator 和执行器,未训练 JITMEM-gemini 在 WebShop 上 SR 61.0 vs SkillOS-gemini 41.0(+20.0);同用 Qwen3-8B,JITMEM-base 60.5 vs ReasoningBank 55.7、SkillOS-base 53.1。甚至弱 curator 能赢强 curator:GPT-5.4 执行器上,用 Qwen3-8B curator 的 JITMEM-base(79.3)超过用 GPT-5.4 curator 的 ReasoningBank(77.9)和 SkillOS-gpt(70.0)。这证明增益来自「读时任务自适应」这个结构,而非 curator 模型强度。
效率(ALFWorld,GPT-5.4 执行器):JITMEM 每任务输入 9.8K token、11.6 步;ReasoningBank 19.7K/16.2 步、SkillOS-base 22.4K/16.9 步。相对写时方法输入 token 省 50.3–56.3%,步数省 28.4–31.4%——payload 信息密度高,执行器少走弯路。
迁移:curator 只用 Qwen3-8B 执行器训练,直接换到 GPT-5.4 执行器达 86.7,距用 GPT-5.4 直训的 88.1 仅 1.4 点。curator 学到的是通用蒸馏策略而非特定执行器的口味。
消融(反事实验证):
| 消融项 | 效果 |
|---|---|
| 去任务条件化(RL 后) | ALFWorld -11.4、WebShop -10.4,且比未训练时差距拉大 → RL 特异性地学会利用任务信号 |
| 改为写时蒸馏存储 | WebShop -6.8~-8.2、ALFWorld -1.7~-2.9 → 写时丢的信息读时找不回 |
| 去质量门控(全存+标注) | -1.5~-3.4 → 失败轨迹的噪声压不住 |
| 空检索集(RL 训练后) | ALFWorld -14.8、WebShop -15.2,跌到未训练水平以下 → RL 学的是「蒸馏检索经验」,不是背题 |
稳健性:k=3 与 k=5 差异在标准差内;测试库热启动(预填 100 条训练轨迹)收益可忽略(≤1.3);分阶段刷新训练库最多 +2.8 但训练成本增加。训练本身在单一任务奖励下全程稳定,无需辅助奖励、分组或回报整形。
六、效果优势的根源解释
6.1 根源机制与证据链
对比对象为何曾经有效:写时蒸馏范式成功的原因是真实的——原始轨迹太长、直接塞上下文成本高且噪声大,蒸馏确实提炼出了可复用的程序性知识(AWM、ReasoningBank 的提升都证明了蒸馏本身有价值)。
根本局限:写时范式的瓶颈不在「蒸馏质量」而在「蒸馏时机」。它把一个「条件生成问题」(给定下游任务,生成最有用的压缩)强行当成了「无条件生成问题」(不知道下游任务,生成对所有任务的平均最优压缩)。信息论上,查询无关压缩必然保留的是跨查询平均意义上重要的内容,而任何特定查询最需要的信息都可能恰是被丢弃的部分。这是结构性上限,换更强的蒸馏模型推不破。
本文的根本性改变:JITMEM 不是「更好的蒸馏器」,而是改变了问题的条件结构——把生成条件从空集 $\varnothing$ 变成 $\{x_t\}$。
因果链(标注:〔实验支持〕/〔推测〕):
- 写时零蒸馏 → 原始轨迹信息无损入库 〔实验支持:改写时蒸馏消融 WebShop -6.8~-8.2〕
- curator 输入含当前任务 + 完整原始轨迹 → payload 可按任务提取恰好需要的视图 〔实验支持:图 3 同一轨迹对「热土豆进冰箱」产出状态转移策略、对「报纸放沙发」产出摆放策略;去任务条件化消融 RL 后 -11.4〕
- payload 紧凑且高密度 → 执行器输入 token 减半、步数减少约三成 〔实验支持:表 4,与 Decocted Experience「上下文信息密度高→完成任务更高效」的发现一致〕
- payload 在产出任务上立即消费 → 奖励零步延迟 → GRPO 用原生任务奖励即可稳定训练,无需分组脚手架 〔实验支持:训练曲线全程稳定;与 SkillOS 消融中「分组是主要贡献项」形成对照〕
- executor 冻结 → curator 学到的是执行器无关的蒸馏策略 → 跨执行器迁移 gap 仅 1.4 〔实验支持:表 3;〔推测〕这同时暗示 payload 质量的评价标准在不同执行器间是收敛的〕
- 〔推测〕RL 的增益主要来自「学会更好蒸馏检索经验」而非参数知识注入——空检索消融跌回未训练水平强支持这一点,但「RL 还学到多少通用的简报写作风格」未被完全分离。
6.2 相关工作检索与对照
| 研究(可核验链接) | 相似尝试 | 相关结论 | 与本文的差异与适用边界 | 对根源解释的影响 |
|---|---|---|---|---|
| ReasoningBank, ICLR 2026(Google,本文最强启发式基线) | 写时从成败经验蒸馏推理策略,读时余弦检索 | 发现存原始轨迹不如存蒸馏策略 | 其结论在「写时蒸馏+原样使用」框架内成立;JITMEM 表明把同一蒸馏动作推迟到读时、保留 raw,效果更好 | 限定+支持:蒸馏有价值,但蒸馏时机是更一阶的变量——两工作合并读出完整因果 |
| MemGPT(UC Berkeley) | OS 虚拟内存式分层记忆,LLM 按需分页检索 | 「按需检索优于预先压缩」的页面调度思想 | 管理会话上下文而非跨任务经验库,无训练 | 支持:不同场景独立得出「延迟到需求已知再做信息取舍」的一致结论 |
| Mem0, ECAI 2025 | 生产级记忆,增量提取+更新(写时范式) | 相对全上下文省 90%+ token,p95 延迟降 91% | 对话记忆场景,无 RL 训练 curator | 补充:写时增量提取在「事实型记忆」场景有效,佐证 JITMEM 在事实检索域(Airline/Retail)收益小——时机选择的收益取决于记忆的「多视图潜力」 |
| AWM(CMU) | 写时归纳可复用工作流注入记忆 | WebArena 相对提升 51.1%,跨任务泛化好 | 工作流固定于归纳时刻 | 支持:验证「经验提炼可复用知识」方向成立,其上限同样受查询无关性约束 |
| Reflexion, NeurIPS 2023 | 语言反思存 episodic buffer | 明确提出生成反思文本存在信用分配难题 | 单任务重试场景 | 支持:从另一路径指出写时反思的学习困难,与本文「写时 curator 难训练」判断一致 |
| Voyager | 技能库写时固化为可执行代码 | 技能可组合、可跨世界迁移 | 技能代码的表达力强于文本制品,但仍是查询无关单视图 | 限定:制品表达力越强(可执行代码 vs 短文本),写时损失可部分缓解,但不消失 |
检索说明:以上链接均可在 arXiv 核验;本次检索未发现直接以「curation 时机」为自变量做系统对比的其他工作(除并发工作 MemHarness 主张读时但策略纠缠),这本身印证了本文问题的原创性。
6.3 综合判断与未决问题
多研究共同支持的机制:(a) 延迟信息取舍到需求已知——MemGPT(会话内)、JITMEM(跨任务)独立一致;(b) 经验蒸馏可复用知识有真实价值——AWM/ReasoningBank/Voyager;(c) 高信息密度上下文提升执行效率——Decocted Experience 与本文 token/步数数据。
仍属推测的部分:RL 训练 curator 学到的策略空间到底有多大(100 步 GRPO 就够,可能说明任务分布相对简单);payload 格式是手工设计的,最优格式未知。
适用条件:收益最大的是程序性知识密集、多步策略验证的任务(Telecom +11.0);事实检索型任务收益趋零。可能失效条件:记忆库极大且多样时 BM25 成为瓶颈;任务间几乎无重叠(检索集常年稀疏)时退化为普通 agent;payload 一次性生成无法应对超长任务中途新观察(论文自己指出的 step-level 扩展方向)。
七、必要知识反推
假设一个零知识的人要完成这项工作,最少需要掌握什么?
领域知识层:LLM 智能体的 ReAct 式轨迹结构(观测-动作交错)——不理解它就无法定义「原始轨迹」这个存储单元;智能体记忆领域 2023–2026 的写时范式全景——不知道写时范式的两个结构性代价,就提不出「时机」这个问题;认知科学中情景记忆的重构性理论(Schacter & Addis)——它为读时塑形提供了类比正当性。
方法论知识层:GRPO 的组内相对优势估计原理——这是把「单任务原生得分」变成可回传训练信号的工具;延迟奖励/信用分配理论——识别出写时 curator 的长时程信用分配缺陷,才能论证读时的零步延迟优势;RAG 与 BM25 检索——检索器的角色定位(轻量、可插拔、非贡献主体)需要懂检索体系才能划清。
工程知识层:三个基准的评估协议与流式评测协议设计(批内共享库状态)——保证对比公平、结论不受任务排序噪声污染;基线复现校准方法论——把 no-memory 基线压到不高于已报告值以保守计量增益,这是实验可信度的隐形支柱;vLLM 服务化与多卡训练的工程落地(8×H200,21–27 小时/基准)。
知识融合的关键节点:最大的化学反应点在于把「JIT 制造」(lean production 中的准时制)思想、「重构性记忆」认知理论和「GRPO 即时奖励」三者焊接在一起——准时制提供了问题重构的直觉(库存=原始轨迹,装配=读时蒸馏),认知理论提供了合法性,而零步延迟的奖励结构让训练方案几乎是「自动掉出来」的:一旦决定在读时塑形, curator 训练就直接可用任务奖励,无需任何脚手架。第二个融合点是「质量门控 + 原始存储」这对看似矛盾的组合:不蒸馏却要过滤,说明「存什么粒度」和「存哪些」是两个独立决策维度。
八、论文中可以提取的通用性灵感
灵感一:压缩决策应在需求已知后做出(延迟塑形) 核心思想:任何「为未知未来做准备」的有损压缩,都劣于「等需求出现再压缩」。 论文证据:同 curator 同执行器下,读时 vs 写时在 WebShop 上 61.0 vs 41.0;写时蒸馏消融再跌 6.8–8.2。 推广场景:RAG 文档摘要(查询感知摘要 vs 离线通用摘要);数据库物化视图(按查询负载惰性物化);缓存系统(存原始响应 vs 存预判格式的视图);个人知识管理(存原文+按项目生成笔记,而非只存一份笔记)。
灵感二:奖励的动作-回报间隔决定训练难度,结构设计可以把长时程信用分配塌缩为零步 核心思想:与其发明更好的信用分配算法,不如重构问题让动作和奖励在时间上相邻。 论文证据:JITMEM 用单一原生任务奖励 + 100 步 GRPO 即稳定收敛;SkillOS 需任务分组+内容质量奖励制造信号。 推广场景:推荐系统(把「存什么」改奖为「本次推荐准不准」);课程设计(让学生立刻用所学,而非期末考);软件工程(重构决策的价值延迟到下一次变更才显现,故应鼓励「为当下任务重构」)。
灵感三:模块冻结是可迁移性的来源 核心思想:想让学到的能力跨底层引擎迁移,就把学习隔离开在冻结引擎之外的模块里。 论文证据:Qwen3-8B 训练的 curator 换 GPT-5.4 执行器仅差 1.4;反例是 MemHarness 纠缠单策略无法迁移。 推广场景:编译器优化(目标无关的中间表示);Prompt 工程与微调的分层(改 prompt 不动权重,故跨模型可复用经验);数据库查询优化器(学习型优化器与存储引擎解耦)。
灵感四:保留原始数据 + 按需生成视图,优于预生成固定视图 核心思想:存储成本下降的时代,「零损耗存原始 + 视图即时合成」在很多场景系统性优于「存精致制品」。 论文证据:原始轨迹保留是最大单项消融之一(WebShop -8.2);payload 用后即焚避免制品污染库。 推广场景:数据湖(bronze 层保真 + 按需转换)vs 预聚合集市;日志系统(全量埋点 + 查询时聚合);多模态资产管理(母版 + 派生格式即时生成)。
灵感五:用生成质量的外部信号门控入库,而非全收后靠下游过滤 核心思想:脏数据入库的噪声,无法靠下游标注完全中和,入口过滤更干净。 论文证据:executor-as-judge 过滤 vs 全存+标注的消融差 1.5–3.4,即便 curator 看得到成败标注。 推广场景:训练数据治理(来源过滤优于事后清洗标注);RAG 语料库准入;Wiki/知识图谱编辑门槛设计。
附录:一图读懂 JITMEM 推理流水线
任务 x_t ──► BM25 检索 top-k 原始轨迹 ──► curator 联合 (x_t, 轨迹) 蒸馏
│
▼
任务自适应 payload(用后即焚)
│
▼
冻结执行器 π_L 执行 ──► 成功轨迹经 judge 门控入库
│
▼
训练时:GRPO 用当前任务原生得分更新 curator(零步延迟)
注:主实验数据与消融数据均来自论文原文 Tables 1–9 及 Figures 2–6,已逐项核对;τ²-bench 仅评估 training-free 变体(该基准无标准训练集),故其 +3.9 对比的是 prompted curator 之间的差距。