一、题目
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
(测试时的 AI4AI:通过脚手架实现强到弱的能力迁移)
- 作者:Cheng Qian、Wenting Zhao、Liangwei Yang、Heng Wang、Jielin Qiu、Heng Ji、Silvio Savarese、Huan Wang、Shelby Heinecke
- 机构:Salesforce AI Research、UIUC
- arXiv:2608.12307
题目中的 “AI4AI” 读作 “AI for AI”——即用 AI(构建者模型)来为另一个 AI(目标模型)服务,而 “Test-Time” 强调这一切发生在推理阶段而非训练阶段。“Strong-to-Weak” 点明了能力迁移方向:从强模型流向弱模型,但与经典的知识蒸馏不同,弱模型权重保持冻结,强模型的角色不是"老师"而是"建筑师",它为弱模型建造一个推理时的"脚手架(harness)"。理解这个题目的关键,是理解本文重新定义了"让弱模型变强"这件事的路径——不是让模型本身变得更有能力,而是让任务变得更易解决。
二、背景
2.1 能力迁移的两条路径
让弱模型在困难任务上表现得更好,长期以来被等同于"改变弱模型本身"。知识蒸馏的经典路径——无论是数据蒸馏、逐步蒸馏还是基于在线策略的强化学习蒸馏——核心动作都是在弱模型上施加某种形式的训练。这条路径已经被证明有效,但它有一个不可回避的代价:训练。训练意味着梯度更新、意味着数据准备、意味着计算开销,还意味着弱模型被"绑定"到特定的能力上而失去其他通用性。
本文的研究出发点是一个被长期忽视的互补假设:当一个小模型在任务上失败时,失败不仅反映它的内在能力不足,还反映了任务呈现方式施加给它的过度认知负荷。一个心智理论(Theory of Mind, ToM)问题可能需要模型同时处理递归信念嵌套、多房间物体追踪、欺骗逻辑和答案格式约束,任何一环出错都会导致最终答案错误。但这些环节中,许多其实是可被外部代码或结构化规则处理的——如果把"解析问题结构"“追踪信念状态"“强制答案格式"这些工作从模型身上卸载到一个外部脚手架上,模型只需要完成它真正擅长的那一小段推理。
2.2 推理时脚手架的现实形态
推理时脚手架(inference-time harness)并不是一个新概念。在实际部署中,围绕一个大语言模型构建的外部结构早已无处不在:任务路由决定一个请求该走哪条流水线,提示模板把用户输入改写成模型最易消化的形式,验证检查过滤掉不符合约束的输出,记忆模块提供跨轮上下文,工具使用让模型调用计算器或数据库。这些组件拼装起来,就是广义的"harness”。
但过去这些 harness 几乎完全由人类工程师手工搭建,而且是为"被服务的模型"量身定制的。本文的核心问题是:如果让一个强模型自动地为弱模型构建 harness,会发生什么? 这个问题之所以现在才被严肃提出,是因为两个条件才同时成熟:第一,最强的一批模型(GPT-5.5、Claude Opus-4.7 等)已经具备在编码平台上(Cursor、Claude Code、GPT Codex)自主编写、测试、迭代复杂程序的能力;第二,业界出现了大量小而快的模型(GPT-5.4-mini、Gemini-3.5-flash),它们推理成本低但有明显的能力短板,是理想的"被服务对象”。
2.3 心智理论作为试金石
作者选择心智理论(Theory of Mind)任务作为试金石,是一个深思熟虑的决定。ToM 任务要求模型推断其他智能体的信念、目标和意图,涉及递归推理(“A 认为 B 认为 C 知道……"),是小模型尤其困难的领域。更重要的是,ToM 任务既有结构化规律可循(信念状态的更新是确定性的),又有真正需要语义推理的环节(欺骗推断、多代理社会目标),这种"混合难度"使其成为验证"认知负荷卸载"假说的理想场景——如果一个脚手架能在这里大幅提升弱模型,它就在最难的问题上证明了机制的有效性。
本文使用的四个基准覆盖了 ToM 的主要子领域:BigToM(1200 项二元信念/目标/动作问题)、Hi-ToM(1200 项嵌套信念问题,递归阶数 0–4)、MMToM-QA(600 项贝叶斯目标/信念推断)、MuMA-ToM(900 项多代理信念/社会目标问题),合计 3900 个隐藏测试项目。
三、定位
3.1 与知识蒸馏的根本区别
本文的定位需要从与经典能力迁移的对比中才能看清楚。知识蒸馏的"强到弱"是强模型产生信号(软标签、合成数据、偏好对),弱模型通过训练吸收这些信号,能力被"写入"权重。结果是弱模型获得了能力,但也付出了训练成本,并且这种迁移是一次性的——换一个任务就要重新训练。
本文的"强到弱脚手架"完全不同:强模型(构建者)不产生任何供弱模型学习的信号,而是产生一个推理时程序——一个包含路由逻辑、提示模板、确定性代码、验证规则的软件工件。弱模型(目标)的权重完全不被动,它在推理时"进入"这个程序,程序为它准备好条件,它完成自己擅长的那部分,程序再负责收尾。这种迁移的好处显而易见:无需训练、可即席部署、一个 harness 可以服务无数次调用,而且更换任务只需更换 harness 而不需重训模型。
3.2 与人类工程化脚手架的区别
这听起来很像人类工程师日常做的事——为某个模型写一套 prompt 模板和后处理脚本。但本文有两个关键不同:第一,harness 由强模型自主构建,而不是人类手工编写,这使得 harness 的构建成本接近零边际;第二,构建者从未观察到完整测试集,它只能接触到 5% 的验证集(每个基准 195 项),这种"看不见测试集"的约束保证了 harness 的提升来自可泛化的任务结构理解,而非对特定测试题目的过拟合。
3.3 本文的独特范式:跨模型脚手架构建设
作者在相关工作部分把自己和五类既有工作做了区分:经典蒸馏、提示分解方法(CoT、Self-Consistency、Tree-of-Thoughts)、工具增强推理(ReAct、PAL)、harness 工程框架(DSPy、SWE-agent)、心智理论评估工作。本文的独特之处在于它研究的是跨模型脚手架构建设定——强构建者为一个独立的、固定权重的弱目标构建一个持久的推理时程序,构建者在测试时不再参与。这是既有任何工作都没有完整研究过的设定。
四、问题定义
4.1 形式化
设:
- $M_{\text{tar}}$:目标模型(权重固定,不训练)
- $M_{\text{build}}$:构建者模型
- $\mathcal{D}^{(j)}$:第 $j$ 个基准测试(共四个 ToM 基准)
- $\mathcal{V}^{(j)} \subset \mathcal{D}^{(j)}$:验证集,从每个基准随机抽取 5% 样本(共 195 项),使用固定随机种子
- $\mathcal{T}^{(j)}$:隐藏测试集(剩余 95%,共 3705 项),构建者不可见
一个脚手架 $S$ 是从某个搜索空间 $\mathcal{S}$ 中选出的推理时程序。理论上,我们希望找到最优脚手架:
$$S^{\star} = \arg\max_{S \in \mathcal{S}} \text{Acc}(S, M_{\text{tar}}; \mathcal{T})$$但构建者无法看到 $\mathcal{T}$,因此实际优化目标是在验证集上代理:
$$\hat{S} = \arg\max_{S \in \mathcal{S}_{\text{build}}} \text{Acc}(S, M_{\text{tar}}; \mathcal{V})$$主指标是四个基准全集准确率的未加权宏平均。
4.2 构建者的初始工作空间
构建者启动时拿到的工作空间是:
$$\mathcal{W}_0 = \{\mathcal{R}, \mathcal{C}_{\text{demo}}, \mathcal{V}\}$$其中:
- $\mathcal{R}$ 是规则文件(task spec),告诉构建者任务约束、输入输出格式、禁止行为
- $\mathcal{C}_{\text{demo}}$ 是目标模型调用演示文件,示范如何用代码调用 $M_{\text{tar}}$
- $\mathcal{V}$ 是标注验证集,构建者可以用它自测
构建者看不到测试集 $\mathcal{T}$,也看不到测试时具体输入。它必须基于对任务结构的理解,设计一个可泛化的推理时程序。
4.3 问题的本质
这个设定最值得注意的一点是:构建者被允许实现任何推理时过程,不限于固定架构。它可以写提示模板、做基准路由、做确定性前/后处理、强制答案格式、做验证传递、检索少样本示例,甚至直接写符号求解器把整个问题用代码解掉。唯一约束是:最终输出必须通过调用 $M_{\text{tar}}$(可以在任何配置下,包括不同的解码参数),且构建者在测试时不能介入。
这种自由度把问题从"找更好的 prompt"提升到了"编写一个推理时软件系统”,其难度和潜力都远超传统 prompt engineering。
五、解法
5.1 Harness 构建算法
完整流程见 Algorithm 1,核心是一个迭代式的"提出-评估-诊断"循环:
输入: 构建者模型 M_build, 目标模型 M_tar
构建者侧 harness H_build(编码平台的 agent loop)
规则文件 R, 目标演示 C_demo, 验证集 V
隐藏完整测试集 T(构建者不可见)
1. W_0 ← {R, C_demo, V} // 初始化工作空间
2. S_0 ← ∅, k ← 0 // 初始化脚手架
3. while 构建者未提交 do
4. 读取 R, C_demo, V // 理解任务与约束
5. S_k ← M_build(W_k) // 提出或修订脚手架
6. Ŷ_k^V ← S_k(M_tar, V) // 在验证集上运行目标模型
7. a_k ← Acc(Ŷ_k^V, Y^V)
8. E_k ← {错误样本} // 诊断
9. W_{k+1} ← W_k ∪ {S_k, a_k, E_k}
10. k ← k + 1
11. end while
12. Ŝ ← S_k // 导出测试入口点 f_Ŝ(x; M_tar)
13. Ŷ^T ← f_Ŝ(T; M_tar) // 人类评估者运行隐藏测试
14. return Acc(Ŷ^T, Y^T)
这里有四个关键设计:
第一,迭代式诊断驱动改进。 每一轮构建者不仅拿到验证准确率,还拿到完整的错误样本列表 $E_k$(哪些题目错了、正确答案是什么),这使它能针对性地修订脚手架。这种"看到错误-改进脚手架-再验证"的循环,是构建者能把验证集榨干的核心机制。
第二,验证集极其有限。 每个基准只有 195 项验证集,构建者平均调用验证 4.9 次(中位数 5,范围 2–15),这是一种极度节俭的迭代。作者强调,这远少于一般 hyperparameter tuning 的规模,构建者必须靠"理解任务结构"而非"暴力搜索"来改进。
第三,验证-全集乐观差距很小。 尽管构建者在验证集上选脚手架,验证准确率与全集准确率的平均差距只有 0.021,相关性达到 Pearson r=0.96——这意味着过拟合几乎不是问题,验证集上的提升能干净地迁移到测试集。
第四,构建者侧自己也用了一个 harness。 构建者运行在某个编码平台(Cursor、Claude Code 或 GPT Codex)上,平台的 agent loop(读文件、改代码、跑测试)本身就是构建者的"harness"。所以整个系统是一个双层 harness 嵌套:编码平台的 harness 服务于构建者,构建者产出目标模型的 harness。
5.2 四个 ToM 基准
本文选用四个心智理论基准,合计 3900 个隐藏测试项目:
| 基准 | 数据量 | 描述 | 典型难点 |
|---|---|---|---|
| BigToM | 1200 | 二元信念/目标/动作问题,判断代理是否观察到世界变化 | 状态变化追踪 |
| Hi-ToM | 1200 | 嵌套信念问题,递归阶数 0–4,含欺骗和多房间物体追踪 | 递归深度、欺骗逻辑 |
| MMToM-QA | 600 | 二元贝叶斯目标/信念推断,来自行动轨迹 | 反事实推断 |
| MuMA-ToM | 900 | 3 选 1 多代理信念/社会目标/目标信念问题 | 多代理协调 |
这四个基准各自的可确定性卸载程度差异巨大,是后续解释为什么不同基准增益不同的关键:
| 基准 | 平均确定性比例 | 可编译程度 |
|---|---|---|
| BigToM | ≈ 0.94 | 几乎完全可卸载 |
| Hi-ToM | ≈ 0.51 | 部分可卸载(通过符号信念追踪) |
| MMToM-QA | ≈ 0.44 | 略低于 Hi-ToM |
| MuMA-ToM | ≈ 0.36 | 最难编译为代码 |
这种差异直接决定了脚手架在不同基准上的"上限":BigToM 几乎可以被完全编译成代码,模型几乎不需要参与;而 MuMA-ToM 仍需要模型自身完成大量语义推理,脚手架能做的有限。
5.3 核心结果:0.49 → 0.91
主结果(Table 1)惊人地干净:
| 指标 | 值 |
|---|---|
| GPT-5.4-mini vanilla 基线 | 0.488 |
| GPT-5.4 vanilla 基线 | 0.619 |
| GPT-5.4-mini human-inspired harness | 0.939 |
| 所有脚手架运行的平均 | 0.763(+0.275) |
| 最佳运行(GPT-5.5, GPT Codex) | 0.912 |
| 相对基线提升 | +0.423(86.7%) |
| 超过 vanilla 基线的构建者比例 | 100% |
注意几个细节:
- 每一个构建者、每一次运行都超过了 vanilla 基线,没有一例倒退。这种"100% 正向"的稳健性在 LLM 研究中是罕见的。
- 最佳脚手架(0.912)已经接近人类工程师精心设计的 human-inspired harness(0.939),差距只有 0.027。
- 即使是最弱的构建者 Grok-0.1,也把宏平均从 0.488 提升到了 0.563(+0.075),证明这个范式对构建者的能力下限很宽容。
5.4 完整构建者 × 目标模型结果表
下面是 GPT-5.4-mini 作为目标模型(基线 0.488)时,所有构建者的完整逐基准结果(Figure 3a):
| 构建者 | 运行数 | BigToM | Hi-ToM | MMToM | MuMA | 宏平均(±sd) | Δ |
|---|---|---|---|---|---|---|---|
| GPT-5.5 | 6 | 1.000 | 0.803 | 0.842 | 0.857 | 0.875±0.036 | +0.387 |
| Opus-4.7 (x-high) | 6 | 0.970 | 0.791 | 0.788 | 0.876 | 0.856±0.022 | +0.368 |
| Gemini-3.5-flash | 3 | 0.986 | 0.712 | 0.778 | 0.777 | 0.813±0.047 | +0.325 |
| Sonnet-4.6 | 6 | 0.977 | 0.712 | 0.742 | 0.810 | 0.810±0.069 | +0.322 |
| Opus-4.7 (high) | 6 | 0.922 | 0.739 | 0.777 | 0.791 | 0.807±0.033 | +0.319 |
| Opus-4.7 (med) | 6 | 0.944 | 0.699 | 0.751 | 0.778 | 0.793±0.065 | +0.305 |
| Gemini-3.1-Pro | 3 | 0.910 | 0.732 | 0.618 | 0.593 | 0.713±0.027 | +0.225 |
| Opus-4.7 (low) | 6 | 0.887 | 0.688 | 0.609 | 0.659 | 0.711±0.031 | +0.222 |
| GPT-5.4-mini | 6 | 0.981 | 0.649 | 0.619 | 0.474 | 0.681±0.062 | +0.193 |
| Codex-5.3 | 6 | 0.983 | 0.625 | 0.563 | 0.528 | 0.675±0.043 | +0.187 |
| Grok-0.1 | 3 | 0.613 | 0.592 | 0.537 | 0.511 | 0.563±0.036 | +0.075 |
这张表揭示了几个值得深究的模式:
- BigToM 几乎被所有构建者解到饱和:GPT-5.5、Gemini-3.5-flash、Sonnet-4.6、GPT-5.4-mini、Codex-5.3 都达到了 0.97 以上,GPT-5.5 甚至 1.000。这与 BigToM 0.94 的可确定性比例相吻合——这个基准的大部分工作能被代码吃掉。
- MuMA-ToM 是真正的天花板:GPT-5.4-mini 在自己作为构建者时只有 0.474,Grok-0.1 只有 0.511。这与 MuMA 0.36 的低确定性比例一致——脚手架帮不上太多忙,最终还是要看模型自己的语义推理能力。
- 构建者能力与脚手架质量明显正相关:从 GPT-5.5 的 0.875 到 Grok-0.1 的 0.563,跨度 0.312,说明构建者的能力是脚手架质量的主导因素。
5.5 确定性分数 r=0.72
如果说本文有一个最重要的实证发现,那就是确定性分数(determinism score)与脚手架质量的强相关性。
定义:确定性分数 = 由确定性代码或结构化规则完全回答的 3900 个评估项目的比例。每次运行被标记为预测来源(“deterministic”、“model_prompt”、“rule”、“llm”),确定性分数是"deterministic"+“rule"所占的份额。
关键发现:确定性卸载程度与最终准确率的 Pearson 相关系数达到 r = 0.72。
这个数字的含义非常深刻:构建者把越多工作转化为可执行结构,弱目标模型剩余的推理负担就越少,最终准确率就越高。 一句话概括本文的机制——脚手架本质上是"任务能力编译器”,它把模糊的自然语言任务编译成清晰的代码可执行子任务,把模型从"什么都得自己想"解放到"只做自己真正擅长的那一小段"。
但要注意:代码规模本身与准确率只有弱相关(r ≈ 0.22)。重要的不是写更多代码,而是写出能移除正确认知负荷的代码。Opus-4.7 在 extra-high 努力下写了 1052 行代码、确定性比例 1.00、准确率 0.879;而 Opus-4.7 在 medium 努力下写了 1553 行代码、确定性比例仅 0.10、准确率只有 0.664。代码量更多反而准确率更低——因为那些代码没有击中任务的关键结构。
逐基准看,确定性卸载的难度差异解释了不同基准的增益差异(见 5.2 节表格)。BigToM 平均 0.94 可卸载,所以所有构建者都能把它解到 0.97+;MuMA-ToM 只有 0.36 可卸载,所以即使是最好的构建者也只能把它解到 0.876。
5.6 三大增益机制
论文中实际描述的增益来源可以归纳为三个互补的机制层次:
机制一:可靠性基座(Reliability Foundation)。
这是最基础也是几乎每个脚手架都具备的层次。它处理的是"无意义的错误"——答案算对了但格式错了、输出了多余的前缀、采样温度导致的方差、解析失败的崩溃。格式强制(57/57 运行使用,100%)、贪心解码(56/57,98%)、基准路由(54/57,95%)几乎覆盖所有运行。这些技术本身不增加模型的"能力",只是消除噪声,但它们的价值在于把模型的潜力释放出来。一个能想对答案但经常答错格式的模型,在加了格式强制后,准确率会自动跳升。
机制二:任务结构利用(Task-Structure Exploitation)。
这是更高阶也更有价值的层次。构建者识别任务的内在规律,把它们编码成推理时机制:
- 极性/否定逻辑(45/57,79%,平均 Δ +0.090):处理"X 相信 Y 知道吗"类问题中的否定嵌套。
- 结构化信念状态提取(29/57,51%,平均 Δ +0.055):把自然语言场景转成结构化的信念状态表,让模型查询而不是推理。
- 确定性求解器(31/57,54%,平均 Δ +0.026):对某些子类型(如 BigToM 的观察/未观察区分),直接用代码判定答案。
- 强制 CoT(45/57,79%):约束模型按特定步骤推理。
- 混合回退(34/57,60%):先尝试确定性求解,失败再回退到模型推理。
值得注意的是平均 Δ 最高的是"极性/否定逻辑"(+0.090)和"结构化提取"(+0.055)——这两个技术直接攻击了 ToM 任务的核心难点,所以收益最大。相反,“贪心温度控制"的平均 Δ 是负的(-0.110),但这主要是因为弱运行更倾向于使用它,存在选择偏差。
机制三:确定性卸载(Deterministic Offloading)。
这是前两个机制的累积效果。当可靠性基座和任务结构利用结合得足够好,相当大比例的测试项目可以被代码完全解答,模型根本不需要参与。这就是 5.5 节描述的"确定性分数”。在 BigToM 上,这个比例达到 0.94,意味着 94% 的题目是代码算出来的;在 MuMA-ToM 上只有 0.36,意味着大部分题目仍需模型推理。
三个机制是嵌套的:可靠性基座让模型不再输给噪声;任务结构利用让模型只做它擅长的;确定性卸载让模型在某些题目上完全退场。脚手架质量的差别,本质上就是这三个层次叠加深度的差别。
5.7 修复破坏比 16:1
平均提升数字虽然震撼,但可能掩盖内部动态——也许脚手架只是把一些原本对的题搞错了,又把一些原本错的题搞对了,看起来平均值提升了?作者用逐项统计(Table 10a)回答了这个质疑:
| 目标模型 | 最佳构建者/平台 | 基线 | 脚手架 | 修复 | 破坏 | χ² | p 值 |
|---|---|---|---|---|---|---|---|
| GPT-5.4-mini | GPT-5.5/GPT Codex | 0.488 | 0.912 | 1717 | 105 | 1424.4 | <10⁻⁴ |
| Gemini-3.5-flash | Gemini-3.5-flash/Cursor | 0.761 | 0.939 | 772 | 63 | 600.3 | <10⁻⁴ |
计算修复-破坏比:
- GPT-5.4-mini: 1717 / 105 ≈ 16.4 : 1
- Gemini-3.5-flash: 772 / 63 ≈ 12.3 : 1
含义清晰:脚手架修复了 1717 个基线错误,只破坏了 105 个原本正确的项目。这不是错误重新分配,而是从错误到正确的广泛转变。
聚合统计更直观:最强的脚手架平均修复了 83% 的基线错误,仅破坏了 7% 的基线正确项目。换句话说,如果你在基线上答错了一道题,脚手架有 83% 的概率把它救回来;如果你在基线上答对了一道题,脚手架只有 7% 的概率把它弄错。这种"高修复、低破坏"的特性是脚手架可以安全部署的关键。
5.8 余量定律 r=0.75
不同的目标模型从脚手架中获益的程度差异巨大,这个差异背后有一个简洁的规律——余量定律(Slack Law)。
定义:余量(slack)= 1 - baseline 准确率,即目标模型在该基准上"还能提升的空间"。
关键发现:脚手架实现增益与目标模型的可用余量强相关,Pearson r = 0.75。
跨目标模型比较最能说明问题:
| 构建者 | 目标模型 | 基线 | 脚手架后 | Δ |
|---|---|---|---|---|
| Gemini-3.5-flash | GPT-5.4-mini | 0.488 | 0.813 | +0.325 |
| Gemini-3.5-flash | Gemini-3.5-flash | 0.761 | 0.872 | +0.111 |
| GPT-5.5 | GPT-5.4-mini | 0.488 | 0.855 | +0.367 |
| GPT-5.5 | Gemini-3.5-flash | 0.761 | 0.901 | +0.140 |
| Opus-4.7 (x-high) | GPT-5.4-mini | 0.488 | 0.840 | +0.352 |
| Opus-4.7 (x-high) | Gemini-3.5-flash | 0.761 | 0.923 | +0.162 |
模式极其清晰:
- 弱目标(GPT-5.4-mini,基线 0.488,余量 0.512):平均提升 +0.262
- 强目标(Gemini-3.5-flash,基线 0.761,余量 0.239):平均提升 +0.110
余量越大,增益越大。这暗示了一个深刻的事实:脚手架不是"赋予"目标模型新能力,而是"恢复"目标模型已拥有但未可靠部署的潜在能力。一个模型理论上能做对某道题(在更好的提示下能做对),但默认情况下经常做错——这种"潜在可达但实际未达"的题就是脚手架的主战场。当基线已经很高,大部分题都是"真不会"而不是"没发挥好",脚手架能做的就有限了。
过度脚手架的风险也来自这个定律。对 GPT-5.4-mini,所有构建者在所有基准上都没有退化(0/20 案例),因为余量大、救回空间大;但对 Gemini-3.5-flash,每个构建者至少在一个基准上退化(9/20 案例),尤其 Hi-ToM(-0.04)和 MuMA-ToM(-0.02)——这两个基准本身余量小,强目标接近能力上限,脚手架的额外约束反而可能误导。
5.9 构建者推理努力 ρ=0.77
最后一个关键变量是构建者自己的推理努力。作者固定构建者为 Opus-4.7、目标为 GPT-5.4-mini,变化四个努力层级(low/medium/high/extra-high),完整结果(Table 3):
| 平台 | 努力层级 | 运行数 | 宏平均(±sd) | Python LOC |
|---|---|---|---|---|
| Cursor | low | 3 | 0.728±0.036 | 653 |
| Cursor | medium | 3 | 0.770±0.078 | 1037 |
| Cursor | high | 3 | 0.788±0.034 | 972 |
| Cursor | extra-high | 3 | 0.840±0.020 | 1274 |
| Claude Code | low | 3 | 0.694±0.004 | 510 |
| Claude Code | medium | 3 | 0.816±0.038 | 685 |
| Claude Code | high | 3 | 0.826±0.017 | 870 |
| Claude Code | extra-high | 3 | 0.872±0.005 | 987 |
关键统计:
- Spearman ρ = 0.77:努力层级与每次运行准确率的强单调关系。
- 汇总跨平台:low (0.711) → medium (0.793) → high (0.807) → extra-high (0.856)。
- extra-high 显著优于 high(p=0.013)和 low(p=0.002)。
- 最大增益出现在 low → medium 的跳跃。
代码规模也随努力增长:low ~510–650 LOC,extra-high ~1000–1300 LOC。但要注意 5.5 节的告诫——代码量本身与准确率只有 r≈0.22 的弱相关。这里代码量增长是努力增长的伴随现象,真正的因变量是"对任务结构的理解深度"。
核心洞察:构建者推理是一个真正的单调杠杆。更多推理 = 更强的脚手架,即使到 extra-high 也没有过度工程化的证据。有用的计算不是更多的探测尝试,而是关于任务结构的更深层假设形成。这一点把构建者推理与一般的"test-time compute"区分开来——它不是在用算力换答案,而是在用算力换理解。
5.10 其他重要实证发现
平台效应(Aspect 4):原生平台的增益小且不一致,平均原生优势仅 +0.013,原生平台获胜比例 5/8 个单元,配对置换检验 p=0.484(不显著)。Claude Code 平均 0.799 > GPT Codex 0.754 ≈ Cursor 0.750。结论:平台是二阶因素,构建者能力和推理努力才是一阶因素。
验证集精炼动态(Aspect 2):平均验证评估次数 4.9 次(中位数 5,范围 2–15),首次迭代到最佳迭代的验证准确率提升 +0.216,验证准确率与全集准确率相关性 r=0.96,验证-全集乐观差距仅 0.021。验证迭代次数与最终性能相关性 r=0.17(基本不相关)——重要的不是迭代多少次,而是每次迭代的质量。
残余错误分析(Aspect 9):Hi-ToM 随递归深度明显衰减——order 0 (0.999) → order 1 (0.814) → order 2 (0.736) → order 3 (0.754) → order 4 (0.700);欺骗降低准确率(deception=False 0.829 vs deception=True 0.772)。MuMA 各标签:belief (0.985) > belief_of_goal (0.880) > social_goal (0.872)。这些残余错误是脚手架无法触及的"真能力上限"。
脚手架技术流行率(Figure 6a):12 种主要技术中,格式强制(100%)、贪心控制(98%)、基准路由(95%)几乎覆盖所有运行;极性逻辑(79%,平均 Δ +0.090)、强制 CoT(79%)、token 预算调节(75%)是中频技术;确定性求解器(54%)、结构化提取(51%)、混合回退(60%)虽不普及但价值高;少样本示例(21%)、验证仲裁(12%)、自一致性投票(5%)较少使用。
六、知识反推
本节尝试从这篇论文的发现反推它背后的"知识论"——作者是如何理解 LLM 的能力本质、又是如何理解"提升能力"这件事的。
6.1 能力的"呈现依赖性"
本文最根本的反常规假设是:模型在某个任务上的表现,不能等同于模型在这个任务上的能力。表现 = 能力 × 呈现方式。改变呈现方式(通过 harness),同一个模型的表现可以跨越巨大区间——GPT-5.4-mini 在 ToM 上从 0.49 到 0.91,能力本身没有变化,变化的只是它被"安排"去解决任务的方式。
这暗示了一个关于 LLM 能力的深层观点:LLM 的能力不是单一的、上下文无关的标量,而是高度依赖于"任务被如何呈现给它"的函数。一个模型可能"有能力"做对某道题(在某种精心设计的提示下能做对),但在默认呈现下做不对——这种"潜在能力"是脚手架可以榨取的。反之,如果一个模型在任何合理的呈现下都做不对,那它就是"真不会",脚手架也无能为力。
余量定律(r=0.75)正是这个观点的定量表达:基线越低(呈现越差),余量越大,脚手架能恢复的潜在能力越多;基线越高(呈现已经很好),余量越小,脚手架能做的越少,因为剩下的错误是"真不会"而不是"没发挥好"。
6.2 任务的结构-语义二分
确定性分数 r=0.72 揭示了作者对任务的另一种隐含分类:任何复杂任务都可以被分解为"结构性子任务"和"语义性子任务"。
结构性子任务是可以被代码或规则完全处理的环节:解析输入格式、追踪状态变化、更新信念状态表、强制答案格式、做极性逻辑。这些环节一旦被识别,就可以被确定性代码吃掉,模型完全不需要参与。
语义性子任务是真正需要模型理解与推理的环节:判断欺骗意图、推断多代理的社会目标、理解自然语言场景中的隐含信息。这些环节代码处理不了,必须由模型完成,脚手架能做的只是为模型准备好尽可能清晰的输入。
脚手架的本质,就是把任务从"全是语义"压扁成"大部分结构 + 少量语义"。BigToM 被压扁到 0.94 是结构,所以几乎全解;MuMA 只能压扁到 0.36,所以模型仍需承担大部分语义工作。一个基准的"可压扁性",决定了脚手架在这个基准上的上限。
6.3 “理解"与"部署"的分离
构建者推理努力 ρ=0.77 这个发现,背后是一个关于"理解"的深刻观点:构建者的工作不是"做更多尝试”,而是"形成更深的任务结构假设"。
从 low 到 extra-high,代码量增加了一倍,但更重要的是构建者对任务的理解加深了——它识别出更多的结构性子任务,把它们编码成代码,把语义性子任务为模型准备好更清晰的输入。这种"理解"是一次性的、可复用的——构建者花一次预算理解任务,产出的 harness 可以服务无数次的弱模型推理。
这暗示了一种新的"知识形态":任务结构知识。它不同于模型权重中的"参数化知识"(学到的世界知识),也不同于上下文中的"检索知识"(从外部拿到的信息),而是"任务可以被如何分解、哪些环节可以被确定性化"的知识。这种知识一旦被某个强模型获得,就可以被编码成 harness,被无数弱模型复用。本文的范式本质上是任务结构知识的工业化生产。
6.4 强弱的辩证
本文标题是"强到弱",但仔细看数据会发现一个微妙的事实:“强"和"弱"是相对的、领域相关的、可互补的。
GPT-5.4-mini 作为构建者时(自己给自己当构建者),把宏平均从 0.488 提升到了 0.681——一个相对"弱"的模型也能为"弱"模型(其实是它自己)构建有用的脚手架。Grok-0.1 这个相对最弱的构建者也实现了 +0.075 的提升。强弱不是二元标签,而是"在某个任务上、某个角色下、某个时间点"的能力排序。
更微妙的是,构建者和目标的能力是互补的:构建者擅长"一次性深度理解任务结构”,目标擅长"高频低成本完成局部语义推理"。一个理想的部署可能是:用最强的模型一次性理解任务、产出 harness,然后用最便宜的模型无数次执行这个 harness。本文的范式暗示,未来的 AI 系统可能不再是"一个大模型做所有事",而是"强模型设计结构 + 弱模型填充执行"的分层协作。
七、通用灵感
本节尝试从这篇论文中提炼对更广泛领域有价值的启发,超越 ToM 和 LLM 的具体语境。
7.1 “改变任务"和"改变主体"是两条独立的能力提升路径
本文最大的范式贡献是严肃地分离了两条提升任何智能系统表现的路径:
- 改变主体:让模型/系统本身变得更有能力(训练、微调、换更强的模型)。
- 改变任务:让任务变得更容易被现有模型/系统解决(重构输入、卸载子任务、提供脚手架)。
传统研究过度聚焦于第一条路径,把"提升表现"等同于"提升主体能力”。本文证明了第二条路径同样强大——在 ToM 任务上,改变任务的 ROI 甚至可能高于改变主体(把 GPT-5.4-mini 提到接近 GPT-5.4 的水平,而无需任何训练)。
这个分离在更广泛的领域都成立。一个常见的错误是把"系统表现不好"等同于"系统不行",于是去升级系统。但实际上,许多表现问题是"任务呈现"造成的——数据格式不对、输入约束不清晰、错误处理缺失。重构任务结构,往往比升级系统更便宜、更可控、更可解释。当你看到一个智能系统(人或 AI)在某件事上失败时,先问"任务的哪一部分是结构性的、可以被外部化的",再问"主体能力够不够"。
7.2 “可确定性化的份额"是任务难度的本质指标
确定性分数 r=0.72 这个发现提供了一个关于"任务难度"的全新视角:任务的真正难度,不在于它有多复杂,而在于它有多大比例可以被确定性化。
BigToM 有 1200 题、Hi-ToM 也有 1200 题,复杂度相当,但 BigToM 的 94% 可以被代码解,Hi-ToM 只有 51%——所以 Hi-ToM 更难,不是因为题量更大或嵌套更深,而是因为它的更大部分需要语义推理。MuMA 只有 900 题却最难,因为只有 36% 可确定性化。
这个观察在更广泛领域有强解释力。一个看似复杂的流程审批任务,如果 90% 的步骤是规则明确的(金额阈值、审批层级、文档完整性),它就是"简单"的,可以自动化;一个看似简单的创意写作任务,如果 100% 都需要语义判断,它就是"困难"的,难以自动化。评估任何任务的难度,应该先问"它能被多大程度地确定性化”,而不是"它看起来多复杂"。
7.3 “理解-执行"分离是规模化部署的关键
本文的"构建者一次性理解 + 目标无数次执行"的架构,是一种在工程领域已被广泛验证的模式的 AI 版本:
- 编译器:人类写一次高级代码(理解),编译器无数次执行机器码(执行)。
- 数据库优化器:查询优化器一次性生成执行计划(理解),存储引擎无数次执行(执行)。
- 工厂工艺设计:工程师一次性设计工艺流程(理解),产线工人无数次执行(执行)。
这种分离的核心价值是把昂贵的"理解"成本分摊到无数次的"执行"上。在 AI 领域,这意味着用最强模型的一次性深度推理,来补贴无数次的弱模型快速推理——总体成本可能远低于"用强模型做所有推理"或"用弱模型直接做所有推理”。
当你面对一个"高频低成本"的部署需求时,问自己:这个任务的"理解"和"执行"可以分离吗?如果可以,花一次性预算去理解任务、产出可执行的程序,再用便宜的执行者去跑这个程序。
7.4 “余量"作为改进潜力的诊断指标
余量定律 r=0.75 提供了一个诊断"改进潜力"的实用工具:一个系统在某项能力上的改进潜力,大致正比于它当前表现与上限之间的余量。
如果一个模型在某任务上准确率 0.49(余量 0.51),脚手架能提升约 +0.3;如果准确率 0.76(余量 0.24),只能提升约 +0.1。这意味着:
- 余量大时,优先做"任务重构”,因为潜在收益大。
- 余量小时,任务重构收益有限,需要考虑"改变主体"(换更强模型)或重新定义任务。
这个规律在个人成长、团队管理、产品迭代中都成立。一个新人表现差,可能是"没发挥好"(余量大),给点脚手架(流程、模板、checklist)就能大幅提升;一个老手表现差,更可能是"真遇到能力上限"(余量小),再多的脚手架也无济于事,需要的是学习新技能或换人。诊断"余量大小",比盲目"加帮助"更重要。
7.5 “修复-破坏比"作为干预安全性的度量
修复-破坏比 16:1 是一个可以推广的干预评估指标。任何对系统的干预(加脚手架、改流程、换工具)都会同时修复一些原有问题和破坏一些原本正常的工作。只看净收益是不够的,要看修复/破坏比。
一个 +0.1 的净提升,如果来自"修复 100 项、破坏 90 项”,是一个危险的干预——它实际上几乎在重新洗牌,未来很可能不稳定;如果来自"修复 100 项、破坏 10 项",是一个稳健的干预——它在保留原有优点的同时弥补缺陷。
这个思维在代码重构、组织调整、产品改版中都极其重要。好的干预是高修复低破坏,坏的干预是高低都高。评估任何干预时,除了看净值,一定要看修复/破坏比。
7.6 “推理努力"的回报是非线性但单调的
ρ=0.77 的强单调关系有一个重要的实践含义:在关键决策上多想想,几乎总是值得的。
从 low 到 extra-high,构建者的准确率从 0.711 提到 0.856,跨度 0.145。这种回报没有饱和的迹象——即使到 extra-high,也没有过度工程化的证据。这与日常经验中"想多了反而想复杂"的直觉相反。
但要注意一个关键细节:最大增益出现在 low → medium 的跳跃。这意味着从"几乎不思考"到"基本思考"的回报最大,从"基本思考"到"深度思考"的回报递减但仍然为正。实践建议是:永远不要在重要决策上"几乎不思考”;至于要不要从"基本思考"升级到"深度思考",看任务的重要性。
更重要的一点:这里的"推理"不是"更多次尝试",而是"更深的结构假设形成"。构建者不是在同一层反复试探,而是在每一层都问"任务的真实结构是不是这样"。这种"用算力换理解"的模式,比"用算力换答案"有价值得多。
7.7 范式命名的启发:AI4AI
最后说一个看似修辞实则深刻的点:题目中的 “AI4AI”(AI for AI)。这个命名暗示了一种新的 AI 角色分工:AI 不只是为人服务,也开始为其他 AI 服务。
强模型为弱模型构建 harness,本质上是 AI 在"设计其他 AI 的工作环境"。这和人类为 AI 设计 prompt、设计 workflow 在抽象层面是同一件事——都是"为某个智能体准备它执行任务的条件"。区别只在于,AI4AI 把这件事自动化了,并且让"设计者"和"执行者"可以是不同的模型。
这预示了未来 AI 系统的一个可能形态:层级化的 AI 协作。最强的模型负责理解任务、设计结构;中等模型负责把结构实现成具体的程序;最弱的模型负责高频执行。每一层都做自己最擅长的事,总体效率远高于"一个模型做所有事"。这种分层可能是 AI 真正走向工业化的标志——正如人类工业革命的本质不是"一个人做所有事变快了",而是"分工让每个环节都专业化了"。
总结:这篇论文用极其干净的实证(100% 运行正向、r=0.72 和 r=0.75 等强相关、16:1 的修复破坏比)证明了一个被长期低估的范式——通过让强模型为弱模型构建推理时脚手架,可以在不训练弱模型的前提下,把弱模型的表现提升到接近强模型的水平。这个范式的核心机制是"认知负荷卸载",关键变量是"任务的可确定性化份额"和"目标模型的余量",而它的实践配方简洁得令人意外:用最强构建者、分配高推理努力、优先卸载可证明子任务、适度验证、多脚手架择优集成。在 LLM 能力越来越强、部署成本越来越重要的未来,这种"强模型设计结构、弱模型填充执行"的分层协作,很可能是 AI 工程化的主流形态之一。