论文链接:State of Thought Enables Endogenous Reasoning 发表时间:2026年9月 机构:Nanyang Technological University(新加坡)+ KTH Royal Institute of Technology(瑞典) 领域标签:cs.CL / Test-time Reasoning
一、论文背景
测试时计算(test-time compute)是什么:不改模型权重,靠推理阶段多花算力换更好输出——o1/R1 类推理模型的核心思路。现有范式分两族:外部推理程序(CoT 的 step-by-step、Plan-and-Solve 的先计划后执行、Cosential/Bullet 思维链模板)给模型强加固定的推理脚手架;约束空间扩展(Self-Consistency 采样多数投票、MCTS 树搜索、GRPO-SP 类策略搜索)靠多轨迹覆盖换正确率。
两族共同的盲点:控制信号都是外生的——推理程序由人预先写定(不管模型此刻卡在哪),搜索扩展不管当前状态只管多铺路。泛化与效率因此受限:固定程序对新任务未必适配,暴力搜索的 token 成本线性甚至指数增长。
内生信号的可行性线索:模型内部表征已被发现携带丰富的推理状态信息——注意力流(information flow)能定位关键证据、潜在表征预测输出质量。“推理的下一步该干什么"是否也写在模型内部状态里?
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 外部推理程序 | CoT、Plan-and-Solve、模板化提示 | 固定脚手架 | 控制外生、任务不自适应 |
| 搜索扩展 | Self-Consistency、MCTS、beam 类 | 多轨迹换覆盖 | 代价高、不看状态 |
| 记忆导向 | H2O/SNAP(KV 驱逐)、STREAM | 压上下文保 token | 启发式保留,非状态条件化 |
| 潜在推理 | COCO(潜伏思维链) | 潜空间推进推理 | 无显式历史激活 |
| 表征分析 | attention flow/信息流研究 | 内部信号可解释 | 诊断用途,未做控制 |
| RL 测试时策略 | GRPO-SP 等 | 训练测试时策略 | 需要训练、策略空间受限 |
定位结论:SoT 开出”内生状态驱动推理“范式——用一个极小的控制器读模型内部状态来决定推理如何展开,与外生程序(固定)和搜索扩展(暴力)形成三分法;且免训练/低训练两档设定验证了信号的因果性。
三、问题定义
具体场景:模型做一道多步推理题,何时该回看哪些历史步骤、何时该展开新分支——这个调度决策通常由人写模板或靠采样撞。
抽象问题:推理过程的控制权能否从外部(程序/搜索)移交回模型的内部状态——即用模型自身的信息传递动力学作为推理调度的反馈信号。
形式化:从 backbone 的内部信息传递提取状态 s_t(动力学-几何紧凑表征);控制器 π_φ(s_t)(|φ|=582 参数)在冻结 backbone 上输出对历史推理支持(retrieved evidence/历史步骤)的选择性激活 a_t;推理轨迹 τ=(x,a_0,o_1,…) 由状态-条件化策略 μ(a|h_t) 生成——历史不再是全部保留也不是全部丢弃,而是按当前状态"取用”。
精妙之处:把推理重定义为"状态条件化的证据组织过程“而非"token 链的顺序生成”——历史步骤的价值不由位置(新/旧)或相似度决定,由"当前推理状态需要什么"决定。
四、问题解法
状态提取
从模型各层注意力/信息传递模式提取紧凑的动力学-几何特征(刻画"推理现在进行到什么相位、缺什么"),降维成低维状态向量——作者强调这是几何量(轨迹形状/相变点)而非简单标量。
582 参数控制器
极小的策略头读 s_t,输出离散控制动作:激活哪些历史支持(检索证据、先前推导)、以何种粒度注入上下文。控制器可在三种模式下工作:(1) 完整模式(读内部状态);(2) training-free 模式(不训练控制器,用状态统计量直接驱动);(3) embedding-only 模式(只允许用嵌入层可得的信号——模拟 API 黑盒模型仅能获取的内部信息)。
与基线的可比性
同预算对比:CoT/PS(单轨迹程序)、SR/SC/CB/MCTS(采样/搜索扩展)、H2O/SNAP/STREAM(记忆压缩)、COCO(潜伏推理)、GRPO-SP(RL 测试时策略)——效率维度统一报生成 token 与端到端延迟。
五、评估指标与实验证据
| 维度 | 关键数字 | 证明什么 |
|---|---|---|
| 四域平均提升(Llama-3.1-8B,vs 最强基线) | 量化 +10.3 / 通用 +6.8 / 符号代码 +15.9 / 长上下文 +10.1 点(相对 18.6%/10.7%/37.4%/46.3%) | 内生控制在全域有效 |
| 相对 mean-baseline 提升 | 量化 1.34× / 通用 1.62× / 符号代码 1.76× / 长上下文 2.51× | 越依赖历史组织的任务收益越大 |
| 效率 | 生成 token −62.6%、端到端延迟 −44.6%(vs 全体基线均值) | 不是拿钱换分 |
| 效率极端值 | GU 域 74.9 tok/1.8s vs CoT 212.9 tok/12.8s;vs 搜索类 token −74.9%/延迟 −73.5%(VLM) | 状态调度远便宜于暴力扩展 |
| 免训练信号 | training-free 保留 38.2%、embedding-only 36.5% 增益 | 内生信号真实且部分免费可得 |
| API 黑盒可用性 | 轨迹-only 裁判与内部状态判读 84.1% 一致(3 个 API 模型) | 无内部访问也能近似状态信号 |
| 跨模型 | 3 LLM + 2 VLM 规模一致收益 | 非单模型怪癖 |
| 数据集 | 13/16 最佳或并列最佳 | 稳定性 |
证明力分析:免训练与 embedding-only 两档是因果链的关键一环——如果增益纯粹来自"控制器学到了什么",免训练档应归零;保留近四成说明模型内部状态本身携带可用的推理调度信号(存在性证明),训练再把利用率翻倍(充分性证明)。84.1% 的轨迹裁判一致性则面向实用:闭源 API 模型拿不到内部状态,但仅凭轨迹也能以高一致性复现状态判断——这把 SoT 从"必须开源模型"扩展到"任何模型"。长上下文 2.51× 的最大收益符合机制预期:长上下文任务的历史组织问题最严重,状态条件化的边际价值最高。
六、效果优势的根源解释
根源机制与证据链
- 外生程序的根本局限是"程序不知道模型此刻的状态"(论文机制论证+对比实验支持):固定模板对任何题目施加同一脚手架——简单题被拖沓(多余步骤)、难题被欠支持(该回看时不回看)。SoT 的控制器读状态后按需分配——GU 域 74.9 token vs CoT 212.9 的 2.8× 节省正是"简单题不啰嗦"的直接体现。
- 搜索扩展的根本局限是"覆盖换正确率的边际成本陡增"(论文对比实验支持):SC/MCTS 不看状态地铺开轨迹,token 线性/指数增长;状态调度把"该探索的分支"集中火力——74.9% token 节省即两者信息效率之差。
- 历史组织的状态条件化在长上下文收益最大(论文实验已支持):长上下文推理的瓶颈是"历史证据的取用"而非"生成能力"——2.51× 增益远超其他域,与"控制器本质是历史取用调度器"的定位一致。
- 内部状态的推理信息早已存在,缺的是控制接口(论文免训练档支持):38.2% 免训练增益说明信号免费可得——此前范式不是信号不存在,而是没人把读出器接到控制回路里。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| Chain-of-Thought(2201.11903) | 外部推理程序 | 分步提示提升推理 | 程序固定外生 | 对照:SoT 的程序自适应 |
| Self-Consistency(2203.11171) | 采样多数投票 | 多轨迹换正确率 | 不看状态、成本高 | 对照:状态调度省 74.9% token |
| CoT outperforming RL(GEPA 线) | 提示进化 vs RL | 上下文适应潜力 | 优化提示非状态控制 | 补充:上下文侧仍有未开发维度 |
| Attention flow / 信息流可解释性 | 内部信号诊断 | 信息流定位推理关键 | 只解释不控制 | 支持:内部信号携带推理信息的先证 |
| COCO 潜伏思维链 | 潜空间推理 | 潜变量推进 | 无显式历史激活与状态读出 | 相邻:都主张"内部",机制不同 |
| STREAM/H2O 记忆压缩 | 上下文压缩 | KV 驱土保 token | 新旧/打分启发,非状态条件 | 对照:保留策略的信息源不同 |
相反结论检索:未发现主张"内部状态信号不可用于推理调度"的研究;最接近的张力是 COCO 线的"潜伏推理更优"——但 COCO 不做历史激活,与 SoT 的证据组织目标正交,不构成反例。另一潜在张力来自"推理程序在特定域更稳"的普遍观察——本文数据承认 SoT 在个别数据集并列而非全胜,与该张力一致。
综合判断与未决问题
多研究共同支持:模型内部表征携带推理相关信息(可解释性文献+本文免训练档);暴力搜索 token 成本高(SC/MCTS 共识)。仍属推测:状态提取的具体几何构造的必要性(vs 简单池化统计)——论文未做状态表征消融;582 参数控制器的容量上限。适用边界:16 个标准推理数据集与 3 个 LLM;超长推理(数千步 agentic 任务)下状态漂移问题未测。失效条件:模型内部表征的推理信息随规模/后训练变化(RLVR 后的模型状态空间可能不同构)时,控制器需重校准。
七、必要知识反推
领域知识层:Transformer 内部机制(注意力/信息流如何编码推理进度)——状态提取的特征工程全赖于此;测试时推理范式谱系(程序/搜索/记忆/潜伏各自的机制与代价结构)——否则无法定位"内生控制"这个空位。
方法论知识层:控制论思想(状态反馈 vs 开环程序)——SoT 名字里的 State 即反馈控制;低维流形/动力学系统分析(从高维表征提取几何特征);免训练/受限访问的消融设计(证明信号存在性独立于学习器)。
工程知识层:冻结 backbone 上的轻量控制器训练(582 参数的过拟合防治);跨 16 数据集×3 模型的统一评测管线;延迟/token 的公平计量(含缓存语义的明示)。
知识融合关键节点:核心融合是"把控制系统论的状态反馈搬进 LLM 推理调度"——需要同时懂 (a) 模型内部什么信号可读(可解释性),(b) 控制论里状态反馈为什么优于开环(理论),(c) 测试时计算的工程预算现实(效率)。三者交集处才有"582 参数控制器"这种反直觉的极简设计——它之所以敢这么小,是因为状态信号本身信息密度高,控制器只需做"读出-选择"。
八、通用性灵感
- 控制信号优先于控制力度:外生程序与暴力搜索都在"怎么使劲"上加码,SoT 证明换对信号源(内生状态)后 582 参数就够——信号质量 » 控制器规模(论文证据:小控制器+全域增益)。推广:管理(好指标胜过强干预)、医疗(精准监测优于盲目加大剂量)、自动驾驶(感知准确比控制激进重要)。
- 免费信号的存在性证明优先于利用率优化:training-free 档保留 38.2% 先证明"信号在那",再谈训练放大——分离存在性与充分性两个问题(论文证据:三档模式设计)。推广:任何"要不要上 ML"的决策——先用统计基线证明信号可分,再上模型。
- 黑盒可用性决定技术的生态位:84.1% 轨迹裁判一致性让 SoT 逃出"仅开源模型可用"的牢笼——内部技术的出圈靠外部近似(论文证据:API 模型实验)。推广:基于内部日志的系统优化要留"仅凭外部行为"的降级路径。
- 历史组织的价值随上下文长度超线性增长:长上下文 2.51× vs 通用 1.62×——信息越多,“取用调度"的杠杆越大(论文证据:四域收益梯度)。推广:知识管理(文档越多检索质量越关键)、代码库(仓库越大导航越值钱)、个人笔记(积累越多索引越重要)。
- 效率与效果的分离计量:token −62.6% 与准确率提升同时报告、分域报告——防止"拿效果换效率"或反之的模糊叙述(论文证据:双维度完整表格)。推广:任何系统优化的报告纪律(延迟/质量/成本三轴缺一不可)。