Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读
清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈:自回归解码把整条推理链串行执行,难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行(AND分支,分而治之)与Trial并行(OR分支,多路试探),并测量发现Trial并行占了可并行推理计算的多数(DeepSeek-V4在HLE上65.5%),而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构,配合PA-GRPO多目标奖励(正确性+关键路径延迟+两类并行比例)训练,经SGLang真实执行。AIME24/25等基准上平均加速约1.7×,8k token延迟预算下用25%预算匹配全额性能。