论文链接:State of Thought Enables Endogenous Reasoning 发表时间:2026年9月 机构:Nanyang Technological University(新加坡)+ KTH Royal Institute of Technology(瑞典) 领域标签:cs.CL / Test-time Reasoning

一、论文背景

测试时计算(test-time compute)是什么:不改模型权重,靠推理阶段多花算力换更好输出——o1/R1 类推理模型的核心思路。现有范式分两族:外部推理程序(CoT 的 step-by-step、Plan-and-Solve 的先计划后执行、Cosential/Bullet 思维链模板)给模型强加固定的推理脚手架;约束空间扩展(Self-Consistency 采样多数投票、MCTS 树搜索、GRPO-SP 类策略搜索)靠多轨迹覆盖换正确率。

两族共同的盲点:控制信号都是外生的——推理程序由人预先写定(不管模型此刻卡在哪),搜索扩展不管当前状态只管多铺路。泛化与效率因此受限:固定程序对新任务未必适配,暴力搜索的 token 成本线性甚至指数增长。

内生信号的可行性线索:模型内部表征已被发现携带丰富的推理状态信息——注意力流(information flow)能定位关键证据、潜在表征预测输出质量。“推理的下一步该干什么"是否也写在模型内部状态里?

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
外部推理程序CoT、Plan-and-Solve、模板化提示固定脚手架控制外生、任务不自适应
搜索扩展Self-Consistency、MCTS、beam 类多轨迹换覆盖代价高、不看状态
记忆导向H2O/SNAP(KV 驱逐)、STREAM压上下文保 token启发式保留,非状态条件化
潜在推理COCO(潜伏思维链)潜空间推进推理无显式历史激活
表征分析attention flow/信息流研究内部信号可解释诊断用途,未做控制
RL 测试时策略GRPO-SP 等训练测试时策略需要训练、策略空间受限

定位结论:SoT 开出”内生状态驱动推理“范式——用一个极小的控制器读模型内部状态来决定推理如何展开,与外生程序(固定)和搜索扩展(暴力)形成三分法;且免训练/低训练两档设定验证了信号的因果性。

三、问题定义

具体场景:模型做一道多步推理题,何时该回看哪些历史步骤、何时该展开新分支——这个调度决策通常由人写模板或靠采样撞。

抽象问题:推理过程的控制权能否从外部(程序/搜索)移交回模型的内部状态——即用模型自身的信息传递动力学作为推理调度的反馈信号。

形式化:从 backbone 的内部信息传递提取状态 s_t(动力学-几何紧凑表征);控制器 π_φ(s_t)(|φ|=582 参数)在冻结 backbone 上输出对历史推理支持(retrieved evidence/历史步骤)的选择性激活 a_t;推理轨迹 τ=(x,a_0,o_1,…) 由状态-条件化策略 μ(a|h_t) 生成——历史不再是全部保留也不是全部丢弃,而是按当前状态"取用”。

精妙之处:把推理重定义为"状态条件化的证据组织过程“而非"token 链的顺序生成”——历史步骤的价值不由位置(新/旧)或相似度决定,由"当前推理状态需要什么"决定。

四、问题解法

状态提取

从模型各层注意力/信息传递模式提取紧凑的动力学-几何特征(刻画"推理现在进行到什么相位、缺什么"),降维成低维状态向量——作者强调这是几何量(轨迹形状/相变点)而非简单标量。

582 参数控制器

极小的策略头读 s_t,输出离散控制动作:激活哪些历史支持(检索证据、先前推导)、以何种粒度注入上下文。控制器可在三种模式下工作:(1) 完整模式(读内部状态);(2) training-free 模式(不训练控制器,用状态统计量直接驱动);(3) embedding-only 模式(只允许用嵌入层可得的信号——模拟 API 黑盒模型仅能获取的内部信息)。

与基线的可比性

同预算对比:CoT/PS(单轨迹程序)、SR/SC/CB/MCTS(采样/搜索扩展)、H2O/SNAP/STREAM(记忆压缩)、COCO(潜伏推理)、GRPO-SP(RL 测试时策略)——效率维度统一报生成 token 与端到端延迟。

五、评估指标与实验证据

维度关键数字证明什么
四域平均提升(Llama-3.1-8B,vs 最强基线)量化 +10.3 / 通用 +6.8 / 符号代码 +15.9 / 长上下文 +10.1 点(相对 18.6%/10.7%/37.4%/46.3%)内生控制在全域有效
相对 mean-baseline 提升量化 1.34× / 通用 1.62× / 符号代码 1.76× / 长上下文 2.51×越依赖历史组织的任务收益越大
效率生成 token −62.6%、端到端延迟 −44.6%(vs 全体基线均值)不是拿钱换分
效率极端值GU 域 74.9 tok/1.8s vs CoT 212.9 tok/12.8s;vs 搜索类 token −74.9%/延迟 −73.5%(VLM)状态调度远便宜于暴力扩展
免训练信号training-free 保留 38.2%、embedding-only 36.5% 增益内生信号真实且部分免费可得
API 黑盒可用性轨迹-only 裁判与内部状态判读 84.1% 一致(3 个 API 模型)无内部访问也能近似状态信号
跨模型3 LLM + 2 VLM 规模一致收益非单模型怪癖
数据集13/16 最佳或并列最佳稳定性

证明力分析:免训练与 embedding-only 两档是因果链的关键一环——如果增益纯粹来自"控制器学到了什么",免训练档应归零;保留近四成说明模型内部状态本身携带可用的推理调度信号(存在性证明),训练再把利用率翻倍(充分性证明)。84.1% 的轨迹裁判一致性则面向实用:闭源 API 模型拿不到内部状态,但仅凭轨迹也能以高一致性复现状态判断——这把 SoT 从"必须开源模型"扩展到"任何模型"。长上下文 2.51× 的最大收益符合机制预期:长上下文任务的历史组织问题最严重,状态条件化的边际价值最高。

六、效果优势的根源解释

根源机制与证据链

  1. 外生程序的根本局限是"程序不知道模型此刻的状态"(论文机制论证+对比实验支持):固定模板对任何题目施加同一脚手架——简单题被拖沓(多余步骤)、难题被欠支持(该回看时不回看)。SoT 的控制器读状态后按需分配——GU 域 74.9 token vs CoT 212.9 的 2.8× 节省正是"简单题不啰嗦"的直接体现。
  2. 搜索扩展的根本局限是"覆盖换正确率的边际成本陡增"(论文对比实验支持):SC/MCTS 不看状态地铺开轨迹,token 线性/指数增长;状态调度把"该探索的分支"集中火力——74.9% token 节省即两者信息效率之差。
  3. 历史组织的状态条件化在长上下文收益最大(论文实验已支持):长上下文推理的瓶颈是"历史证据的取用"而非"生成能力"——2.51× 增益远超其他域,与"控制器本质是历史取用调度器"的定位一致。
  4. 内部状态的推理信息早已存在,缺的是控制接口(论文免训练档支持):38.2% 免训练增益说明信号免费可得——此前范式不是信号不存在,而是没人把读出器接到控制回路里。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
Chain-of-Thought(2201.11903)外部推理程序分步提示提升推理程序固定外生对照:SoT 的程序自适应
Self-Consistency(2203.11171)采样多数投票多轨迹换正确率不看状态、成本高对照:状态调度省 74.9% token
CoT outperforming RL(GEPA 线)提示进化 vs RL上下文适应潜力优化提示非状态控制补充:上下文侧仍有未开发维度
Attention flow / 信息流可解释性内部信号诊断信息流定位推理关键只解释不控制支持:内部信号携带推理信息的先证
COCO 潜伏思维链潜空间推理潜变量推进无显式历史激活与状态读出相邻:都主张"内部",机制不同
STREAM/H2O 记忆压缩上下文压缩KV 驱土保 token新旧/打分启发,非状态条件对照:保留策略的信息源不同

相反结论检索:未发现主张"内部状态信号不可用于推理调度"的研究;最接近的张力是 COCO 线的"潜伏推理更优"——但 COCO 不做历史激活,与 SoT 的证据组织目标正交,不构成反例。另一潜在张力来自"推理程序在特定域更稳"的普遍观察——本文数据承认 SoT 在个别数据集并列而非全胜,与该张力一致。

综合判断与未决问题

多研究共同支持:模型内部表征携带推理相关信息(可解释性文献+本文免训练档);暴力搜索 token 成本高(SC/MCTS 共识)。仍属推测:状态提取的具体几何构造的必要性(vs 简单池化统计)——论文未做状态表征消融;582 参数控制器的容量上限。适用边界:16 个标准推理数据集与 3 个 LLM;超长推理(数千步 agentic 任务)下状态漂移问题未测。失效条件:模型内部表征的推理信息随规模/后训练变化(RLVR 后的模型状态空间可能不同构)时,控制器需重校准。

七、必要知识反推

领域知识层:Transformer 内部机制(注意力/信息流如何编码推理进度)——状态提取的特征工程全赖于此;测试时推理范式谱系(程序/搜索/记忆/潜伏各自的机制与代价结构)——否则无法定位"内生控制"这个空位。

方法论知识层:控制论思想(状态反馈 vs 开环程序)——SoT 名字里的 State 即反馈控制;低维流形/动力学系统分析(从高维表征提取几何特征);免训练/受限访问的消融设计(证明信号存在性独立于学习器)。

工程知识层:冻结 backbone 上的轻量控制器训练(582 参数的过拟合防治);跨 16 数据集×3 模型的统一评测管线;延迟/token 的公平计量(含缓存语义的明示)。

知识融合关键节点:核心融合是"把控制系统论的状态反馈搬进 LLM 推理调度"——需要同时懂 (a) 模型内部什么信号可读(可解释性),(b) 控制论里状态反馈为什么优于开环(理论),(c) 测试时计算的工程预算现实(效率)。三者交集处才有"582 参数控制器"这种反直觉的极简设计——它之所以敢这么小,是因为状态信号本身信息密度高,控制器只需做"读出-选择"。

八、通用性灵感

  1. 控制信号优先于控制力度:外生程序与暴力搜索都在"怎么使劲"上加码,SoT 证明换对信号源(内生状态)后 582 参数就够——信号质量 » 控制器规模(论文证据:小控制器+全域增益)。推广:管理(好指标胜过强干预)、医疗(精准监测优于盲目加大剂量)、自动驾驶(感知准确比控制激进重要)。
  2. 免费信号的存在性证明优先于利用率优化:training-free 档保留 38.2% 先证明"信号在那",再谈训练放大——分离存在性与充分性两个问题(论文证据:三档模式设计)。推广:任何"要不要上 ML"的决策——先用统计基线证明信号可分,再上模型。
  3. 黑盒可用性决定技术的生态位:84.1% 轨迹裁判一致性让 SoT 逃出"仅开源模型可用"的牢笼——内部技术的出圈靠外部近似(论文证据:API 模型实验)。推广:基于内部日志的系统优化要留"仅凭外部行为"的降级路径。
  4. 历史组织的价值随上下文长度超线性增长:长上下文 2.51× vs 通用 1.62×——信息越多,“取用调度"的杠杆越大(论文证据:四域收益梯度)。推广:知识管理(文档越多检索质量越关键)、代码库(仓库越大导航越值钱)、个人笔记(积累越多索引越重要)。
  5. 效率与效果的分离计量:token −62.6% 与准确率提升同时报告、分域报告——防止"拿效果换效率"或反之的模糊叙述(论文证据:双维度完整表格)。推广:任何系统优化的报告纪律(延迟/质量/成本三轴缺一不可)。