论文链接:Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 发表时间:2026年8月 机构:清华大学(一作单位)、MIT(Song Han)、NVIDIA(Ligeng Zhu通讯)、独立研究者(多机构合作;论文声明将开源实现、数据与网站) 领域标签:cs.AI / 测试时计算、并行推理、推理引擎协同设计

一、论文背景

推理模型的成功配方朴素而粗暴:测试时多想,答案更好。Chain-of-Thought、OpenAI o1、DeepSeek-R1都证明长推理链能显著提升数学与逻辑能力。但这个配方撞上了系统层面的硬墙——自回归解码是一个token接一个token的串行过程,每个中间思考都必须等上一个完成。更长的推理直接翻译成更长的等待:难题的推理轨迹可以膨胀到几十万甚至上百万token。Google的AlphaProof解IMO 2024题目要跑最长三天;交互式agent、coding助手等延迟敏感应用根本等不起。

出路显然是让推理并行。但现有并行推理系统有个共同的盲区:它们几乎都专注于子任务式分解——把一个大问题切成小块、各自求解、合并结果。可是打开任何强推理模型在难题上的思考轨迹看看:它 spends 大量token在"试一条路→发现死胡同→换一条路→再换一条"上。这种试探性探索也是并行化的天然候选——五条思路可以同时试,何必排队?此前没有工作把这两种并行性分开度量,更没有系统同时利用它们。

类比:一群人算1到800的和,可以直接分四段各算各的(每段都要,缺一不可);而开锁问题里五把钥匙谁配谁知道,那就五个人各拿一把同时试(一把对就够)。前者是"分工",后者是"赛马"——执行语义完全不同:前者必须收齐所有结果,后者一条活下来就行。

二、论文定位和关联工作

Parason站在"测试时扩展"与"并行推理"两条脉络的交汇处,其定位靠一个语义分类学的确立。

测试时扩展脉络:CoT提示、o1/R1式长思考证明了算力换准确率的可行性;但串行解码让"想更长"等于"等更久",测试时算力的延迟代价未被正视。

独立采样脉络:Self-consistency(多样本投票)、Best-of-N(验证器选优)、DeepConf(置信度采样)——它们隐式地做了trial式计算(不同样本试不同路径),但样本是独立完整轨迹:不共享中间工作、不暴露分支结构、不告诉推理引擎并行区间在哪。准确率是买了,延迟没人管。

结构化/自适应并行脉络(最直接的竞品):Tree-of-Thoughts、Graph-of-Thoughts、Skeleton-of-Thought给出树/图/大纲结构;近期的Multiverse、ThreadWeaver、Parallel-R1、APR、PASTA、PaCoRe训练或提示模型创建并行分支并合并。但它们的主流机制仍是子任务中心:分解→并行→合并。试探式探索(试错、否决、保留活路)作为一等公民的并行模式被系统性忽略。

维度独立采样结构化并行(ToT等)自适应并行(Multiverse等)Parason
并行单位完整轨迹思维树节点分解出的子任务子任务+试探双轨
分支语义无结构AND为主AND为主AND/OR显式标注
引擎可执行否(外层循环)部分部分CFG→SGLang工具调用
延迟优化无有限有限奖励中显式关键路径项

定位结论:Parason的差异化贡献不是"又一个并行推理框架",而是补上了缺失的分类学基础——先测量证明Trial并行是可并行推理计算的多数派(且难度越高占比越大),再让训练目标、数据格式、推理引擎三件套都围绕这个二分法构建。这是典型的"先看清问题结构,再设计系统"的路线。

三、问题定义

具体场景:推理模型在难题上生成数十万token的串行思考链,延迟不可接受;直接并行采样多整条轨迹又造成冗余计算且不降单条轨迹的延迟。

核心洞察:一条推理轨迹内部并非均匀串行。有的步骤推导彼此独立的事实(之后都会用到);有的步骤在不确定状态下试探多条假设路径、汇总幸存者。这两种行为对应两种语义不同的并行性:

  • Subtask Parallelism(AND分支):问题分解为独立子目标g1…gk,各分支算出必要结果r1…rk,主轨迹聚合全部结果继续。缺一分支就缺一块拼图。
  • Trial Parallelism(OR分支):不确定状态下并行发射竞争尝试a1…ak检验不同假设,合并方式是把各分支轨迹拼接进推理历史(保留探索记录供综合),而非只选一条。这是单条推理轨迹内部的并行搜索。

两者执行语义的本质差异(合并规则):AND分支全收集,OR分支记录探索史。混用单一分支接口(此前系统的通病)会让引擎不知道该"等齐"还是"留痕"。

论文先做的测量(分类学的实证基础):用LLM标注各模型推理轨迹中的步骤类型,统计两类并行性占可并行推理步骤的比例:

模型OpenMath Subtask/TrialHLE Subtask/Trial
DeepSeek-R131.5% / 68.5%26.2% / 73.8%
Qwen3-30B-A3B43.6% / 56.3%38.8% / 61.2%
DeepSeek-V441.9% / 58.1%34.5% / 65.5%
Claude-Opus-4.544.9% / 55.1%29.9% / 70.1%
GPT-5.534.4% / 65.6%23.9% / 76.1%
Gemini-2.5-Pro62.9% / 37.1%49.4% / 50.6%

规律清晰:HLE(更难)上所有模型Trial占比都高于OpenMath;开源模型里Trial占比普遍更高(R1在HLE上73.8%)。难推理不只是分解,更是对不确定路径的反复试探与提炼——只做子任务分解的系统漏掉了难题中大部分可并行计算。

形式化的问题定义:给定串行推理轨迹集,求一个训练-推理协同设计:(1)把轨迹转换为不改变最终语义的结构化并行表示;(2)训练模型学会在合适位置发射合适类型的并行结构;(3)推理引擎能真实并发执行这些结构,使最长token路径(关键路径)缩短而准确率不塌。约束:不修改模型架构、不深改推理引擎。

精妙之处在于把"延迟"定义为关键路径token数(并行块只计最长分支而非分支之和)——这个量直接对应可用并发执行的引擎能兑现的墙钟时间下界。

四、问题解法

Parason = 分类学 + 数据格式(CFG)+ 训练算法(PA-GRPO)+ 引擎集成,四位一体。

4.1 并行轨迹格式:上下文无关文法

在普通<think>轨迹上扩展五个标签:<Parallel>标记并行区域、<Outlines>描述区域目的、<Subtask>/<Trial>标注分支类型、<Thread>存放分支结果。CFG产生式规定:并行区域=Outlines块(若干Subtask/Trial条目)+若干Thread体;Thread内部可递归嵌套并行区域(现实推理中子任务内部再生试探分支)。

设计围绕两个要求:

  • 语义性:标签说明分支是"必要的子任务"还是"投机的试探"——决定引擎合并时该收集还是留痕,而非仅仅"能并行";
  • 引擎可解析性:每个分支有显式起止标签,运行时无需改模型架构即可分发worker。CFG成为训练与推理基础设施之间的共享契约(XGrammar强制标签合法)。

24点游戏的例子直观展示结构:三个Subtask(用6凑4、用9×10做除法、验证更简方案)各自内部并行试探多条算式——正确解出现在第二个子任务第一条Trial分支里,其余分支的失败记录也被拼接保留。

4.2 数据构造

从ThreadWeaver发布的964条Qwen3-8B标注轨迹出发:Gemini-3-Flash为每个并行阶段标注Subtask或Trial;Trial阶段由Qwen-8B额外采样分支、Gemini生成其<Trial>目标。训练数据刻意保持两类分支的严格分离(虽然模型评估时能泛化到混合嵌套)。RL阶段用Polaris-53k复杂推理题。

4.3 PA-GRPO:并行感知的强化学习

SFT只能模仿格式,不直接优化延迟、也不会决定何时用哪种并行。PA-GRPO的奖励在正确性主信号上叠加三项整形:

$$R_i = -1 + 2 \times \mathbb{1}(\text{correct}_i) \times \Big(1 - \alpha f\big(\tfrac{T_i-\mu_T}{\sigma_T}\big) + \beta_{sub} f\big(\tfrac{R^{sub}_i - \mu_s}{\sigma_s}\big) + \beta_{trial} f\big(\tfrac{R^{trial}_i - \mu_r}{\sigma_r}\big) + \min(\rho \eta(s), \rho_{clip})\Big)$$

各项分工明确:

项作用类比
正确性门答错直接−1基础奖励一票否决:先做对再谈快
α·延迟项惩罚关键路径token数T_i罚"占用主线程的时间"
β_sub·子任务比例奖励放进AND分支的token占比奖励"会分活"
β_trial·试探比例奖励放进OR分支的token占比奖励"会赛马"
min(ρη, ρ_clip)加速项直接奖励(总token−延迟token)占比奖励"搬离关键路径的搬运量"

关键设计认知:β_sub与β_trial驱动不同的优化目标——Trial并行用总token换搜索宽度(提准确率),Subtask并行压缩最长路径(降延迟)——分开调参就是在分开调这两个维度。

4.4 推理引擎集成

并行分支实现为工具调用:运行时正常解码直到<Parallel>出现,解析Outlines,把每个Subtask/Trial派发给独立worker,<Thread>结果返回主轨迹。在SGLang上实现,XGrammar保证标签合法。这层设计让理论节省变成真实墙钟加速——此前工作要么只报理论加速比、要么需要深度魔改引擎。

五、评估指标与实验证据

指标体系:主指标为AIME24/AIME25/Math500/AMC准确率与模型延迟(最长生成路径的token数——顺序token正常计数,每个Parallel块只计最长分支);辅助指标为触发率(含至少一个并行块的样本比例)、加速比(总生成token/最长路径token);落地指标为A800 GPU上的实测墙钟时间。

实验1:准确率对比(8B模型打32B基线)。Parason-8B拿下表中最优的AIME25(70.6)与AMC(97.5)成绩,四基准平均84.7%超过ThreadWeaver-8B的81.0%;AIME24最高78.2接近ThreadWeaver的79.9——而对比名单里Multiverse、ThinkPrune、DYNASOR等多数是32B系统。

方法AIME24AIME25Math500AMC平均
Multiverse (32B)53.845.891.8--
ThreadWeaver (8B)79.960.592.391.481.0
Parason SFT only73.567.993.493.982.2
+PA-GRPO (β_trial=0.050)76.570.694.096.984.5
+PA-GRPO (β_trial=0.100)78.268.994.297.584.7

实验2:低延迟预算下优势放大。固定关键路径思考预算B,AIME24准确率:

模型B=2,048B=8,192B=16,384B=24,576
SFT only16.841.866.870.2
PA-GRPO (β_sub=0.100)34.7(+17.9)60.3(+18.5)74.4(+7.6)75.7(+5.5)

预算越紧增益越大:2k预算下翻倍还多。匹配8k预算的SFT性能只需约25%的预算。这说明PA-GRPO不是多花token,而是把有用的工作搬进并行分支、让关键路径保持短。

实验3:训练出的并行结构真的可执行。SFT已触发69.3%并行、1.27×加速;PA-GRPO把触发率推到98.8%(β_trial=0.100)、加速比1.71×,同时三基准平均数学准确率79.9→80.4%不掉;β_sub=0.050路线拿到最高1.75×加速。加延迟惩罚α=0.1后延迟最低的配置降到12.1k-13.2k(低于ThreadWeaver的14.8k),加速仍达1.72-1.74×。

实验4:难题并行度更高而非更低(动机的最终验证)。按难度分层实测墙钟(A800):

难度生成token最长路径token加速比省下token并行墙钟 vs 串行
易21.3k12.5k1.70×8.8k188.3s vs 304.2s
中36.8k21.2k1.74×15.6k336.2s vs 464.7s
难50.3k29.0k1.73×21.3k487.3s vs 716.3s

生成token随难度暴涨(21.3k→50.3k)而最长路径缓涨(12.5k→29.0k),加速比稳在1.70-1.74×,墙钟实测加速1.38-1.62×。难题暴露出更多可搬离关键路径的分支级工作——直接验证了核心动机:难题的计算量大,但其中大部分不必串行。

六、效果优势的根源解释

为什么一个8B模型能在准确率上逼近32B并行系统、在延迟上稳定兑现1.7×加速?因果链分四环。

第一环:分类学驱动的奖励分解。此前系统把"并行"当单一目标优化;Parason把AND/OR分开奖励,等于告诉模型**“分活"和"赛马"是两种可以独立调节的行为**。实验证据是β_trial与β_sub的选择性效果:β_trial系列拿下准确率峰值(84.7%平均、70.6 AIME25)——Trial并行把总token换成搜索宽度,多路试探提升解题命中(同真实推理中"试错-否决-保留"行为的并行化);β_sub系列拿下延迟与加速峰值(12.1k最低延迟、1.75×最高加速)——Subtask并行压缩关键路径。两个旋钮各转各的效果,证明分解不是概念游戏而是可操作的优化维度。

第二环:关键路径作为延迟的一等公民。延迟项直接惩罚最长token路径而非总token数,从机制上奖励"把工作搬离主线程”。反事实:SFT-only模型触发了69.3%并行却只有1.27×加速——有并行结构但没人教它把结构用在降延迟的方向上;PA-GRPO同样数据下推到1.71-1.75×。低预算实验(B=2k下34.7% vs 16.8%)进一步说明RL教会了模型在预算内优先安排并行结构。

第三环:CFG契约让节省可兑现。理论加速比(总token/关键路径)要变成墙钟收益,需要引擎真能并发。分支即工具调用+XGrammar约束+SGLang分发,这条链路使模型输出的结构无需翻译即可执行。对照此前工作:要么只报理论加速(无法翻译为实际延迟降低),要么深改引擎导致无法落地。实测墙钟加速(1.38-1.62×)低于token级加速比(1.70-1.74×),差距来自分支调度与合并开销——这也是诚实的工程测量。

第四环:OR分支的"留痕合并"保住了准确率。若Trial分支像传统OR语义那样只保留赢家,失败分支的探索信息就丢了,合并后的主轨迹上下文变薄。Parason把所有分支拼接进历史——失败路径的"此路不通"本身就是后续综合的素材(24点例子中三个子任务的失败试探共同指向正确方向的确认)。这解释了为什么加大β_trial(更倾向试探)反而提准确率:宽度换深度的搜索在不确定问题上数学期望更优。

完整因果链:分类学→奖励可分解(β_sub/β_trial分治延迟与准确率)→模型学会按需发射正确类型的结构→CFG使结构引擎可执行→关键路径缩短→1.7×加速在真实GPU上兑现且准确率不掉。反事实验证:去掉PA-GRPO只留SFT,加速比从1.71×掉回1.27×、低预算准确率减半——结构格式是必要非充分,RL才是把结构用对地方的教师。

七、必要知识反推

领域知识层:

  • 自回归解码的串行本质与测试时扩展的延迟代价——不知道AlphaProof三天、百万token轨迹这些量级,无法把"延迟"立为独立于准确率的一等目标
  • 推理模型思考轨迹的真实行为学(试错-回退-换路)——没读过R1式长轨迹的人不会注意到"试探"是可并行的模式
  • AND/OR分支的执行语义差异(全收集vs留痕)——来自体系结构与搜索算法的基本功

方法论知识层:

  • 测量先于设计:先用LLM标注做分类学普查(Table 1的9模型×2数据集矩阵),用数据证明Trial占多数,再动手建系统——这是"问题驱动"而非"技术驱动"的研究范式
  • GRPO框架及其奖励整形惯例(归一化、clip)——PA-GRPO是GRPO的直接扩展
  • 数据蒸馏管线设计:强模型标注(Gemini-3-Flash分类)+目标模型采样(Qwen3-8B补分支)的分工
  • 关键路径分析:延迟=最长分支而非分支之和,是并行系统领域的经典概念向token流的迁移

工程知识层:

  • SGLang推理引擎的工具调用机制与XGrammar结构化生成——没有这层,CFG只是纸面格式
  • 两阶段后训练管线(TRL做SFT、VeRL做RL)与超参配置(clip非对称0.2/0.28等)
  • 难度分层的评测设计(AIME24题目的易/中/难索引划分保证可复现)

知识融合的关键节点:最大的化学反应是**“分支语义"作为贯穿三层的统一抽象**——同一个AND/OR二分法同时出现在数据标注、CFG产生式、奖励项β_sub/β_trial、引擎合并规则里。这需要作者同时精通ML训练(知道奖励能塑行为)、形式语言(知道CFG能做契约)、系统(知道引擎要什么格式)三个社区的语言。第二个节点是把并行体系结构的"关键路径"概念迁移到token流——一个跨领域的翻译动作直接定义了整个优化目标。

八、论文中可以提取的通用性灵感

灵感1:先普查问题的结构,再设计解法——分类学是系统的地基

  • 核心思想:在动手优化前先测量问题空间的结构分布,被忽视的多数派往往藏着最大的机会。
  • 论文证据:Trial并行占可并行推理的58-76%(HLE),而此前所有系统只优化Subtask——一个未被看见的多数派市场。
  • 推广场景:缓存系统的访问模式普查先于替换策略设计;团队工作量分析先于流程再造;数据库查询的负载画像先于索引设计。

灵感2:AND/OR语义分离——执行语义决定合并规则

  • 核心思想:并行单元不仅要"能并发”,还要声明"结果如何汇合"(全要vs一条即可),这决定了运行时行为与资源策略。
  • 论文证据:Subtask全收集、Trial留痕拼接,混用单一接口的系统无法正确决定等待与放弃策略。
  • 推广场景:微服务编排中的关键路径vs可选路径标注;科研项目分工中的必答vs探索题;投资组合的核心仓vs卫星仓。

灵感3:把延迟定义为关键路径而非总量——优化什么就度量什么

  • 核心思想:当并行资源充足时,决定体验的是最长依赖链而非总工作量;奖励直接瞄准关键路径才能学会"搬工作"。
  • 论文证据:PA-GRPO的延迟项惩罚T_i(关键路径token),模型学会把50.3k生成token压到29.0k路径;SFT只给格式不给方向时加速仅1.27×。
  • 推广场景:产品交付的端到端关键路径管理;CI/CD流水线的瓶颈工序治理;组织协作中的依赖链缩短。

灵感4:格式即契约——结构化中间表示打通训练与执行

  • 核心思想:让模型输出满足严格文法的结构,训练侧与推理引擎共享同一契约,理论收益才能免翻译地落地。
  • 论文证据:CFG+XGrammar+SGLang工具调用三层对齐,实现1.38-1.62×实测墙钟加速;此前只报理论加速的工作无法兑现。
  • 推广场景:LLM输出JSON Schema约束用于自动化工序;机器人任务的技能DSL;协议设计中接口定义语言(IDL)的作用。

灵感5:宽度换深度——不确定场景下并行试探是准确率的杠杆

  • 核心思想:在路径不确定的问题上,与其串行地试错,不如并行发射竞争假设、把所有结果(含失败)留痕供综合。
  • 论文证据:加大β_trial提升准确率至84.7%(AIME25 70.6),失败试探的拼接历史为最终综合提供素材。
  • 推广场景:A/B测试的多方案并行验证;药物筛选的高通量并行试验;创业公司的多假设商业模式测试;debugging中同时检查多个嫌疑点。