Thought-Level Beam Search for Reasoning 精读
测试时算力扩展是大推理模型性能的主引擎,但并行采样极度浪费、减法剪枝又让GPU挨饿,核心问题已从“花多少算力”变成“把算力花在哪”。本文提出思维级束搜索 Gambit:用轻量评分器探测步骤边界隐状态,周期性剪除劣迹并立即从高分前缀分支,以零和交换维持固定容量活跃池,同时保持硬件满载。在 5 个基准 × 3 个模型上严格支配 SC、Slim-SC、DeepConf、STEP 四大基线:HMMT-24 最高 +6.7%,token 消耗较并行采样最高降 68.5%,吞吐超 2 倍,管理开销仅 0.97%。本精读覆盖其问题形式化、方法细节、实验证据与因果链根源分析。