The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts 精读
推理模型在回答前会生成大量思考 token,但这些思考是否值得其成本?联想基础设施方案集团的这篇论文提出边际效率指标 Token Economy Score(TES),用准确率增益除以生成 token 倍数来度量推理模式的性价比,并在 151 个模型-基准组合上给出三个部署结论:任务结构比名义难度更能预测推理收益,序列推理任务(数学竞赛、代码)高 TES 而知识回忆型任务(MMLU-Pro、GPQA)低 TES;提高推理努力档位呈尖锐边际递减甚至负增益;思考链占总推理成本中位数高达 94.7%,而自建 MoE 集群可把云端成本再降 2.0 至 25.6 倍。本精读覆盖指标设计、实验证据、因果解释与可迁移的通用灵感。