论文链接:The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts 代码仓库:Sachin-Wani/reasoning_tax(数据、代码与图表) 发表时间:2026年8月 机构:Lenovo Infrastructure Solutions Group(美国北卡罗来纳州 Morrisville)——纯企业研究,无高校合作 领域标签:LLM 推理经济学 / 评测方法学 / AI Infra
一、论文背景
推理模型:会打草稿的大模型
要理解这篇论文,先要理解当前大模型推理(inference)市场的分化。今天的 LLM 分成两大阵营:
- 指令遵循模型(instruction-following model):拿到问题直接作答,像考试时提笔就写的学霸;
- 推理模型(reasoning model / thinking mode):在给出最终答案前先生成一大段"思考链"(chain-of-thought),像考场上先打草稿、验算、自我检查再落笔的考生。
打草稿的能力不是 prompt 技巧合,而是训练出来的。2022 年链式思维提示(Chain-of-Thought prompting)发现让模型显式输出中间步骤能显著提升多步推理表现;2024 年 OpenAI o1 用强化学习专门训练"扩展思考",在数学和编程基准上大幅刷新纪录;2025 年 DeepSeek-R1 把这种能力带到开源权重模型;Qwen3 则在同一个模型里内置了思考开关(thinking toggle)——同一套权重可以开或关思考模式,这为"控制变量"式对比提供了理想条件。
token 经济学:草稿不是免费的
问题在于:草稿不是免费的。思考 token 与普通输出 token 一样按量计费,推理模型在同一个基准上生成的 token 数可能是指令模型的几个数量级倍。云 API 按输入/输出 token 定价,输出 token(含思考 token)通常远贵于输入 token;于是部署者面对一个真实却无法回答的决策——开思考模式多花的那份钱,买回来的准确率到底值不值?
传统基准评测只报告准确率排行榜,完全回避这个问题。而评测本身也在通胀:已有媒体报道,完整评测一个推理模型的成本超过 2700 美元。更微妙的是,同一个模型跑在云 API 和自建 GPU 集群上,成本结构完全不同——云端按 token 付费,自建按硬件摊销,推理开销在两种语境下换算成完全不同的账单。
现有效率指标答不了部署问题
已有一些 token 效率指标,例如 OckBench 的 Per-Token Intelligence(准确率除以解码 token 数,并识别出小模型为补偿能力不足而过度生成思考链的"Overthinking Tax")。但它们衡量的是单模型绝对效率:一个模型每 token 换来多少准确率。而部署者的问题是一个边际问题:在同一个任务上,从"不开思考"切换到"开思考",多出的 token 换来了多少增量准确率?绝对效率高不等于这次切换划算。这就是本文要填补的空白。
二、论文定位和关联工作
本文属于"LLM 推理经济学 / 效率评测"这一新兴方向,可以按三条谱系梳理它的学术血统。
谱系一:推理模型与链式思维
CoT prompting 奠定"中间步骤提升推理"的基础认知;o1 用 RL 训练扩展思考将其产品化;DeepSeek-R1 使开源模型具备竞争力;Qwen3 的思考开关提供了同架构配对对比的实验条件(本文 TES-Δ 直接依赖);Claude 扩展思考与 Gemini 3 系列代表当前专有模型前沿。本文站在这些模型成果之上,但研究视角反转:不是"如何让推理更强",而是"推理的回报如何度量"。
谱系二:token 效率基准
| 前序工作 | 核心思想 | 与本文的关键区别 |
|---|---|---|
| OckBench(Per-Token Intelligence) | 绝对效率 = 准确率 / 解码 token 数;发现 Overthinking Tax | 绝对而非边际;受输入 token 干扰 |
| LLMThinkBench | 基础数学上准确率-效率权衡 | 任务范围限于基础数学 |
| ReEfBench | 逻辑深度框架下的推理效率 | 无部署成本维度 |
TES 与它们的两点本质差异:边际性(相对非推理基线的增益,而非绝对准确率)和只用生成 token(排除评测 harness 配置差异带来的输入 token 波动)。此外本文补充了第三个维度——部署感知(DCM)。
谱系三:推理成本与部署经济学
Artificial Analysis 持续追踪各模型准确率、token 数与 API 价格(本文云端数据来源);作者团队此前在联想发布过生成式 AI 云 vs 自建的总拥有成本(TCO)方法论(本文 B300 系统成本模型直接沿用);作者前作研究了资源受限环境下蒸馏模型的效率基准,本文是把那套"效率透镜"推广到推理模型。
定位结论:本文是首个把"边际 token 效率—任务类型分层—部署成本换算"三者联合起来的系统性实证研究。它不提出新模型也不训练任何东西,而是为社区提供一个决策导向的度量框架与 151 组实测证据。
三、问题定义
从具体场景到抽象问题
具体场景:一个工程师部署 LLM 应用,模型家族提供"思考模式开关"或多个推理努力档位(medium/high/xhigh/max),云 API 与自建集群两种部署方式。他要决定:开不开思考、开多高、跑在哪里?
深层结构:这个决策本质上是经济学中的边际分析问题——和多花 100 万营销费能多赚多少营收、多上一条产线能多产多少货是同构的。关键的抽象洞察是:推理模式的价值不能脱离参照系(非推理基线)与计价单位(生成 token 倍数)单独讨论。
| 边际分析概念 | 本文对应 |
|---|---|
| 投入增量 | 生成 token 倍数(分母) |
| 产出增量 | 准确率增益百分点(分子) |
| 投入回报率 | TES |
| 边际报酬递减 | 努力档位升高 → 边际 TES 递减 |
| 沉没/替代方案成本 | 非推理基线的 token 成本 |
形式化定义:设推理模型 $M_r$、非推理基线 $M_b$、基准 $T$:
$$TES(M_r, M_b, T) = \frac{Acc(M_r, T) - Acc(M_b, T)}{GenTok(M_r, T) / GenTok(M_b, T)}$$其中 $GenTok = 思考token + 输出token$(排除输入 token,因为输入由基准与 harness 决定而非模型行为)。约定:每 1 个百分点的准确率增益对冲 1 倍的 token 乘数,即 TES = 1 为盈亏平衡(+5pp 增益 ÷ 5× token 乘数 = 1);应用可按自身对准确率的估值调整阈值。判读:TES > 1 高效;0 < TES ≤ 1 边际;TES ≤ 0 有害(推理模型花更多 token 却不比基线强)。
精妙之处:一是分母用倍数而非绝对 token 数,使不同基准、不同 harness 下的结果可比;二是 TES ≤ 0 被明确定义为正常实证结果而非退化情形——这为"overthinking 有害"留出了度量空间;三是论文明示 TES 需与基线准确率、绝对准确率联合解读(接近天花板的基线压缩分子,接近地板的基线会让微小增益显得高效),这种克制避免了指标被滥用。
四、问题解法
论文的"方法"是一套三层指标体系 + 一套实测协议,层层递进地回答"推理值不值"。
4.1 核心指标:TES 及其两个变体
类比:TES-Δ 像"同卵双胞胎对照实验",TES-A 像"新药 vs 现有最佳标准治疗"。
- TES-Δ(配对差分):基线 $M_b$ 取同族模型的非推理版本。同一套权重带思考开关(如 Qwen 系列)时是严格的架构受控对比;闭源家族(如 GPT 的不同努力档)则是"厂商配对",解释时需注意推理未必是唯一变量。
- TES-A(近似基线):对没有非推理版本的家族(本文中是 Gemini),基线取当时该基准上表现最强的非推理模型,其准确率与 token 数都取自这个最强指令模型——分母代表"现实可用的最佳替代方案的真实成本"。这是刻意的设计:部署者本来就买不到"关闭推理的前沿模型",相关反事实就是最佳指令替代品。代价是混入了家族间通用能力差异,论文在局限中明示。
4.2 描述性指标:RCS 与 DCM
- RCS(Reasoning Cost Share,推理成本占比):$RCS = Cost_{Reasoning} / Cost_{Total}$,其中思考 token 成本 = (思考token数/10⁶) × 输出 token 单价,总成本含输入+思考+输出,按公开 API 价计算。它不进入 TES 公式,纯粹刻画"思考链吃掉了多少推理账单"——接近 1.0 意味着几乎全部开销花在内部思考而非最终答案上。
- DCM(Deployment Cost Multiplier,部署成本乘数):$DCM = Cost_{cloud} / Cost_{on\text{-}prem}$,同一工作负载在云 API 与自建系统上的总成本之比。TES 是 token 比值与价格无关;DCM 则把 token 效率换算成美元语境——TES 决定"推理是否 token 高效",DCM 决定"达到该 TES 要花多少钱",两者正交。
4.3 实测协议:151 组数据从哪来
- 基准:7 个,覆盖 4 类任务结构与全谱难度——IFBench(指令遵循,58 题)、MMLU-Pro(知识回忆,12000 题)、GPQA Diamond(知识回忆,198 题)、AIME 2025(序列推理,30 题)、LiveCodeBench(序列推理/代码)、HLE(前沿推理,2500 题)、CritPt(前沿物理,71 题)。选择标准:有配对模型、未完全饱和、领域多样。
- 模型:27 种配置、8 个家族(GPT / Claude / DeepSeek / Qwen / Gemini / Grok / GLM / Gemma),兼顾配对覆盖、努力档位多样与规模多样(大 MoE 与小 dense 模型都含)。
- 云端数据:取自 Artificial Analysis(分模型分基准报告平均输入/思考/输出 token 数),价格截至 2026 年 5 月底。
- 自建实测:8×NVIDIA B300 系统、FP16 精度跑开源模型,用于自建成本测量并交叉验证 Artificial Analysis 数字(一致性在预期方差内);AIME 上 Claude 的补充准确率取自 MathArena。
- B300 自建成本模型(TCO):五年期总成本(摊销资本支出 + 电费/散热/运维运营支出)共 101.3 万美元,折合 0.00633 美元/秒;每 token 成本 = 每秒成本 ÷ 实测吞吐(token/秒,含 prefill 与 decode 全程)。
- 数据清洗:Grok 4.20 的一个 IFBench 配对中,非推理版本生成 87 万输出 token(推理版仅 4.8 万),疑似停止 token 失效或无限循环,保留在仓库但从聚合统计中剔除。
每条评测记录含模型身份、基准、推理标志、准确率、token 分量、价格假设、总成本与来源,全部公开在 GitHub 仓库。
五、评估指标与实验证据
本文是度量/实证型论文,“指标体系"本身就是贡献(详见第三、四部分),本节聚焦实验证据如何支撑其三个核心主张(对应 RQ1 任务结构 / RQ2 努力递减 / RQ3 部署语境)。
证据一:任务结构 > 名义难度(RQ1)
7 个基准 × 151 组配对的核心发现:
| 任务结构 | 代表基准 | TES 表现 | 机制 |
|---|---|---|---|
| 序列推理链 | AIME 2025、LiveCodeBench | 最高,均值超 TES>1 | 中间步骤约束后续步骤 |
| 指令遵循 | IFBench | 高(多约束满足是链式过程) | 同上 |
| 知识回忆 | MMLU-Pro、GPQA Diamond | 低 | 额外思考找不回缺失事实;基线饱和压缩分子 |
| 前沿难度 | HLE、CritPt | 弱正 / 需配绝对准确率 | 近地板基线使 TES 解读受限 |
关键对照:MMLU-Pro 和 GPQA 按学术标准比 AIME 更"难”(对人类而言),但推理收益反而低——难度不预测推理效率,任务结构才预测。这直接支撑操作规则:按任务结构而非难度决定是否开推理。
证据二:努力档位的边际递减(RQ2)
Table 2 的努力档位迁移数据(边际 TES = 迁移到更高档位的增量效率):
| 模型 | 基准 | 迁移 | 准确率变化 | 低档 TES | 高档 TES | 边际 TES |
|---|---|---|---|---|---|---|
| GPT-5.5 | GPQA | High→Xhigh | +0.3pp | 1.147 | 0.683 | 0.175 |
| GPT-5.5 | HLE | High→Xhigh | +1.3pp | 1.067 | 0.669 | 0.781 |
| GPT-5.2 | MMLU-Pro | Medium→Xhigh | +1.5pp | 1.333 | 0.303 | 0.256 |
| GPT-5.2 | AIME 2025 | Medium→Xhigh | +2.3pp | 8.049 | 3.758 | 1.022 |
| GPT-5.2 | LiveCodeBench | Medium→Xhigh | −0.5pp ↓ | 3.274 | 0.980 | −0.153 |
| DeepSeek V4 Pro | GPQA | High→Max | −1.7pp ↓ | 0.677 | 0.225 | −0.621 |
| DeepSeek V4 Pro | HLE | High→Max | +2.4pp | 1.242 | 0.865 | 1.530 |
三个模式:(1) 即使准确率仍在涨,token 增长快于增益,TES 一律下降;(2) 链式任务更能容忍高努力(AIME 到 xhigh 仍强正,MMLU-Pro 崩向边际);(3) 最高档可能降准确率——GPT-5.2 在 LiveCodeBench 掉 0.5pp、DeepSeek V4 Pro 在 GPQA 掉 1.7pp,与 overthinking 失败模式一致:越过任务特有的推理饱和点后,多余 token 引入虚假备选、指令漂移或验证噪声。实践启示是"测试再扩展"工作流:从 medium/high 起步,在验证集上实测边际 TES,有证据才升档;max 档是任务与模型特定的设置而非难题默认。
证据三:RCS——思考链吃掉了账单
全部推理条目的 RCS 中位数 94.7%,多个前沿模型超过 99%——几乎全部生成开销花在内部思考而非最终答案。RCS 随努力档位升高:GPT-5.5 在 GPQA 上从 high 的 76.7% 升至 xhigh 的 85.5%。与证据二合并解读:更高努力把更多 token 预算重新分配给思考,却只换来微小准确率增益。
证据四:DCM——部署语境改写经济性(RQ3)
8×B300 自建系统实测(五年 $1.013M,$0.00633/秒):
| 模型 | 架构 | 云端 $/M token | 自建 $/M token | 吞吐 tok/s | DCM |
|---|---|---|---|---|---|
| Qwen3.5-397B-A17B | MoE | $3.60 | $0.142 | 44400 | 25.6× |
| Qwen3.6-27B | Dense | $3.60 | $0.181 | 35000 | 20.0× |
| Qwen3-235B-A22B | MoE | $2.15 | $0.162 | 39000 | 13.6× |
| Qwen3-32B | Dense | $0.52 | $0.196 | 32300 | 2.8× |
| Gemma 4 26B-A4B | MoE | $0.30 | $0.067 | 94000 | 4.5× |
| Gemma 4 31B | Dense | $0.37 | $0.192 | 33000 | 2.0× |
DCM 范围 2.0×–25.6×,且在同一模型不同基准间基本稳定——它是模型架构+硬件+定价的属性而非基准属性。MoE 因稀疏激活吞吐高,自建每 token 成本极低(Qwen3.5-397B 达 44400 tok/s);dense 模型的 DCM 更多由云端定价决定,可能随 API 降价收缩。具体算例:Qwen3.5-397B 跑 GPQA 云端 $4.889 vs 自建 $0.192;Qwen3-235B 跑 MMLU-Pro(TES 仅 0.340,token 层面边际)云端 $92.07 vs 自建 $6.85——DCM 不改变 token 效率,但能把"云端不划算的循环负载"变成"自建可承受"。
综合 TES × 成本的 77 组配对四象限模型选择框架(成本阈值 = 数据集中位数 $19.69/run):Q1 高 TES 低成本(AIME 等)默认开推理;Q2 高 TES 高成本(HLE、前沿 LiveCodeBench)循环负载优先自建;Q3 低 TES 低成本按应用需求定;Q4 低 TES 高成本(MMLU-Pro、max 档 HLE)直接关推理或降档。
这些证据为何足以支撑主张
三组实验设计与论点严格对齐:RQ1 靠 7 基准跨任务结构 × 多家族配对的横截面差异(若推理收益由难度驱动,MMLU-Pro 应高于 AIME,实际相反);RQ2 靠同族内档位迁移的纵向对比(排除模型能力差异,纯看努力边际);RQ3 靠同一工作负载双部署实测(成本差异只来自部署语境)。自建数字与 Artificial Analysis 交叉验证、异常数据透明剔除,进一步压低了"指标好看但没证明主张"的风险。
六、效果优势的根源解释
本文的"效果"是度量洞察力而非模型分数:为什么边际度量能揭示绝对指标看不到的规律?
对比对象及其曾经的有效性
绝对效率指标(准确率/token)在单模型选型场景有效——比较两个模型谁更省,它够用。OckBench 的 Overthinking Tax 发现也依赖它。
根本局限
绝对指标的分子分母都锚定单一模型:它无法表达"参照系切换"的决策结构。部署者的选项不是"模型 A vs 模型 B"而是"开思考 vs 不开思考"、“high vs medium”——这是增量对增量的问题。绝对指标把增量信息在除法中约掉了:一个绝对效率 0.5 的推理模型,其思考模式可能 +30pp 也可能 +0.3pp,绝对值无法区分。更糟的是它常把输入 token 计入分母,而输入 token 由 harness 决定,引入与模型行为无关的噪声。
TES 的结构性改变与因果链
因果链一(为何能回答部署决策):把度量对象从"单点性能"改为"增量比值"→ 输出直接是决策量(开/不开、升/不升档的性价比)→ 151 组配对里 TES≤0 的实证存在(DeepSeek V4 Pro GPQA −0.621)成为可观测、可量化的"关推理"信号,而非排行榜上的模糊直觉。
因果链二(为何能揭示任务结构规律):边际化之后,分子(准确率增益)的来源被任务结构决定——
- 知识回忆型任务:答案取决于参数中是否存有该事实,思考链无法"回忆起"不存在的事实 → 增益天然小 → 分子小 → 低 TES。这不是模型不行,是信息不存在,多想无益;
- 序列推理任务:中间步骤的输出约束后续步骤(证明构造、程序合成、调试、多约束满足)→ 前置思考 genuinely 缩小后续搜索空间 → 增益大 → 高 TES。
绝对指标看不出这个分层,因为序列任务的思考 token 与回忆任务的思考 token 在它眼里同样"贵";只有把 token 放进分母、增益放进分子,两种任务的结构差异才在比值上分化。
因果链三(为何能定位 overthinking):同族档位迁移的边际 TES 把"token 增速 vs 准确率增速"的赛跑显式化。越过推理饱和点后 token 指数增长而准确率停滞甚至回落(引入虚假备选/指令漂移/验证噪声)→ 边际 TES 由正转负。若只看绝对准确率,GPT-5.2 在 LiveCodeBench 降 0.5pp 近乎噪声;看边际 TES −0.153 与 DeepSeek 的 −0.621,“最高档有害"才成为系统性结论。
因果链四(DCM 为何改变结论而非测量):MoE 稀疏激活 → 每加速器小时吞吐高 → 自建每 token 摊销成本极低 → 同一 TES 值的美元成本被部署语境缩放(最高 25.6×)。于是"云端边际不划算”(Qwen3-235B MMLU-Pro TES 0.340)与"自建批量可承受"($92.07→$6.85)同时成立——token 效率与经济可行性被解耦成两个正交维度,各自可独立优化。
反事实检验:若去掉"只用生成 token"的设计、把输入 token 计入分母,不同 harness 的 prompt 长度差异会污染倍数,跨基准可比性崩塌;若去掉 TES-A 变体,Gemini 等无配对家族将完全无法分析;若不做自建实测只引用云端价格,DCM 只能是理论推算而非有吞吐验证的实测——三个设计任缺其一,对应结论链都会断裂。
七、必要知识反推
假设一个零背景的人要复现这项工作,他最少必须掌握什么?
领域知识层
- 推理模型的运作机制:知道 thinking mode 是"先生成思考链再给答案"、思考 token 也按输出价计费——否则根本意识不到存在"推理税"问题;
- 主流基准的任务结构与难度谱系:能区分 MMLU-Pro(知识回忆)与 AIME(序列推理)测的是不同能力,否则无法提出"任务结构 vs 难度"的对照假设;
- 模型家族生态:哪些家族有思考开关(Qwen)、哪些只有档位(GPT/DeepSeek)、哪些无配对基线(Gemini)——这直接决定 TES-Δ 与 TES-A 的适用边界。
方法论知识层
- 边际分析:来自经济学的增量收益/增量成本框架,是 TES 公式的直接原型;不理解它就会退回绝对效率指标;
- 受控对比与混淆变量:同权重开关配对为何优于跨家族对比、TES-A 混入了什么(家族能力差异)、为何要明示为局限——实验方法学素养决定指标可信度;
- 已有效率指标的缺陷谱系:知道 Per-Token Intelligence 受输入 token 干扰、非边际,才能针对性地设计"只计生成 token + 基线比值"。
工程知识层
- LLM 推理服务与 token 计量:输入/思考/输出 token 分别从哪读出、prefill 与 decode 阶段的吞吐如何测——否则 GenTok 与自建成本都无从谈起;
- 数据中心 TCO 建模:资本支出摊销 + 电费/散热/运维的五年期成本折算成 $/秒,再除以实测吞吐得 $/M token——这套会计方法是把"token 行为"翻译成"美元决策"的桥梁;
- 第三方数据交叉验证:自建实测与 Artificial Analysis 对齐、MathArena 补充、异常点(Grok 87 万 token)识别与剔除——数据治理能力。
知识融合的关键节点
- 经济学 × 机器评测:把边际分析的除法结构套在"准确率增益 / token 倍数"上,诞生 TES——这是全文最核心的化学反应;
- 实验方法学 × 产品生态:用"配对/近似"两种基线策略覆盖全部 8 个家族,让指标在闭源前沿模型上仍然可用;
- 硬件会计 × 云定价:把 B300 系统的秒级摊销成本与 API 每 M token 价格放进同一个分式,得到 DCM——完成从 token 效率到部署决策的最后一公里;
- 实证观察 × 系统设计:RCS 94.7% 的观察进一步外推到 agent 系统"上下文窗口即推理预算"的运维准则。
八、论文中可以提取的通用性灵感
灵感一:度量增量而非度量绝对
核心思想:当选型问题是"是否切换模式/档位/配置"时,有用指标必须是相对于替代方案的边际比值,而非单点绝对值。 论文证据:绝对效率(准确率/token)无法区分 +30pp 与 +0.3pp 的思考增益;TES 边际化后,DeepSeek V4 Pro 升 Max 档的 −1.7pp、GPT-5.5 GPQA 边际 TES 0.175 等递减信号才可观测。 推广场景:数据库索引选择(查询延迟增益 vs 存储倍数)、CDN 分层缓存(命中率增益 vs 回源成本倍数)、编译器优化pass开关(性能增益 vs 编译时间倍数)、广告投放加预算的边际 ROI、特征工程中"加这个特征的增益/复杂度倍数"。
灵感二:分母归一化让异构对象可比
核心思想:跨场景比较时,把成本表达为"相对基线的倍数"可剥离场景固有的规模差异。 论文证据:GenTok 用倍数而非绝对 token 数,7 个基准(58 题到 12000 题)的结果才可放进同一张图;输入 token 被排除因为它由 harness 而非模型决定。 推广场景:跨团队工程效率(缺陷率相对各自历史基线的倍数)、医疗疗效(相对标准治疗的风险比)、A/B 测试跨市场比较(相对各市场基线的提升比)、能耗评估(相对上一代产品的每算力功耗倍数)。
灵感三:回报的结构来自问题的结构,而非难度
核心思想:额外投入(算力/时间/流程)的回报由任务的内在信息结构决定——增量投入只能放大已存在的结构优势,不能无中生有。 论文证据:序列推理任务(中间步骤约束后续)高 TES,知识回忆任务(缺失事实无法靠思考找回)低 TES,难度与 TES 不相关。 推广场景:教师人力投入(启发式学科 vs 死记硬背学科)、代码评审深度(架构级联改动 vs 孤立小改)、搜索预算分配(多跳研究问题 vs 单点查询)、缓存策略(时间局部性强的负载 vs 随机访问)。
灵感四:最高档位不是难题的默认答案
核心思想:可调"努力/精度"的系统中,最大档常越过饱和点引入噪声(虚假备选、指令漂移),边际收益递减甚至为负。 论文证据:所有家族努力档位升高边际 TES 一律下降;两家族最高档实测降准确率;作者建议 max 仅用于终局决策与高风险验证。 推广场景:求解器精度档位(过约束求解引入数值噪声)、动画渲染采样数(过采样时间成本线性涨)、法律/医疗复核轮数(过度复核引入自我怀疑偏移)、搜索 beam width(过宽引入干扰候选)、机器学习特征选择的前k个模型集成。
灵感五:把隐性开销显式化为占比指标
核心思想:当一个组件吃掉 95% 的账单却只产出"看不见的中间品"时,需要专门的占比指标让浪费可见。 论文证据:RCS 中位 94.7%、多个前沿模型 >99%——绝大多数推理开销花在思考链而非答案;RCS 升高与准确率停滞同时发生即是浪费信号。 推广场景:构建系统(编译时间占比 vs 真正链接时间)、微服务(序列化/网络开销占比 vs 业务计算)、会议(同步沟通时间占比 vs 深度工作时间)、数据管线(清洗时间占比 vs 建模时间)、编译型语言开发循环(增量编译占比 vs 运行调试)。
灵感六:token 效率与部署语境解耦,正交维度分别优化
核心思想:把"资源效率"(与价格无关的比值)与"经济可行性"(部署语境的乘数)拆成正交指标,避免一个数字承载两个概念。 论文证据:TES 与 DCM 分开报告:Qwen3-235B 在 MMLU-Pro 上 TES 仅 0.340(token 层面边际),但 DCM 13.6× 使自建成本从 $92.07 降到 $6.85(经济层面可承受);MoE 架构优势(吞吐高)被 DCM 量化为部署决策依据。 推广场景:能耗效率与电价语境解耦(服务器选型)、单位性能与供应链周期解耦(硬件采购)、算法收敛率与分布式部署开销解耦(训练框架选型)、燃油效率与油价/里程语境解耦(车队管理)。
附录:面向 agent 系统的延伸讨论(论文第七部分)
论文还将 TES 外推到多轮 agent 场景,指出单轮 TES 的假设(一次输入、一次输出)在 agent 中失效:早期步骤的输出会变成后续步骤的输入,思考成本从"每次调用"复合为"管线级"——若保留中间推理痕迹,输入上下文近似按 $I_k = I_0 + \sum_{j=1}^{k-1} G_j$ 增长,高 RCS 模型留下的"推理残渣"挤占后续规划的状态预算。作者给出三条运维准则:按步骤类型而非管线类型分配推理(检索/路由/格式化不需要思考,规划/计算/代码/验证才需要);把上下文窗口当推理预算管理(推理步数 × 每步 token 数超预算就降档或摘要中间输出);逐步骤控制努力档位(中间步骤 medium/high,max 只留给终局决策)。真正的 agent 版 TES 需要区分"推进任务状态的 token"与"只增加上下文压力的 token",这是作者留给社区的下一步。