论文链接:Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training 发表时间:2026年8月 机构:ByteDance Seed(字节跳动)+ 南京大学 + Evolvent AI——企业+高校合作(研究在字节完成,南大/Evolvent 参与合作;第一作者许前恺在字节工作期间完成) 领域标签:cs.CL,合成数据 / 持续预训练 / 学术写作
一、论文背景
本文处在「高质量文本枯竭 → 合成数据」与「重建隐藏思考」两条叙事的交汇处。需要理解的概念:合成训练数据、隐藏思考重建、持续预训练(CPT)。
合成数据与改写路线。随着高质量人类文本接近耗尽,合成数据在预训练/中训练中的占比越来越大。早期方法多把网页文本改写得更干净、更像教科书或 QA 形式。但改写无论怎样都改变了内容本身,且递归训练于模型自生成数据会丢失分布尾部(模型坍缩风险)。
隐藏思考重建路线。另一条路线出现了:保留原文不动,重建原文背后的隐藏生成过程。动机很直觉:一篇完成的文本是作者思考的压缩产物,那些从未落到纸面上的判断与推导,恰恰是模型从扁平文本里学不到的东西。把重建的思考与原文一起训练,能提升数据效率与推理能力(Ishibashi et al. 的 hidden thoughts、Ruan et al. 的 latent thoughts 等,规模已达 100B token)。但现有方法几乎都建立在 1–2K token 的短网页文档上,由此产生两个局限:(1) 分割机械化——按句子块或等分切割、在切点插思考,把文档当成无结构的字符流;(2) 重建过程是扁平注释——合成的思考是一整块贴在原文前后,数据退化为「文档+旁白」。根源在语料:一两千 token 的文档没有全文规划可言。且这条线瞄准推理,写作几乎未被触及。
为什么是科学论文? 三个理由:(1) 专家为同行而写、被页限挤压,密度高、压缩重——留下特别多可恢复的判断;(2) 引言/方法/实验/结论各有明确修辞角色,分解可以沿论文自身结构进行;(3) 最关键的:想重建的过程真实发生过——作者确实有全局规划,每一节的存在都有理由。
CPT 是什么? 在已预训练好的基座上继续用领域数据训练。风险是灾难性遗忘(单一学术领域会把基座拉偏),需要混入通用文本缓解。本文的配方是 30B 轨迹 + 20B FineWeb-Edu。
二、论文定位和关联工作
谱系一:合成训练数据。预训练侧重写网页或围绕实体关系扩写,后训练侧指令合成;半合成(只编辑真实文本)比全合成更鲁棒。共同点:多数改变或发明内容。
谱系二:从真实文本重建训练信号。两支——思考重建(hidden thoughts 系列至 100B token;Megadocs 在等分点插入推理把文档拉成超长训练单元;REER 为开放式写作搜索最佳解释已知好答案的思考)与指令重建(instruction backtranslation:把真实文本当答案、反推能引出它的 prompt;FineInstructions 推到预训练规模;还有从全文反推大纲的工作)。代码域最接近的工作从 GitHub 仓库反向工程项目级开发轨迹。共同局限:自然语言侧语料是短网页文档、重建过程无内部结构。本文重建的是有自身修辞结构的长文档,作为含全文规划与逐节思考的多轮轨迹。
谱系三:科学文献的适配与评测。SciLitLLM 等在论文与教材的干净散文上训练——本文训练的是这些散文背后的写作过程。写作基准侧,WritingBench 按提示生成评分标准,AcademicEval 从 arXiv 多抽象层级构建任务——PAW-Bench 则把每个任务锚定在具体一篇论文上,沿「评分量规 + 代码可查清单」双轴打分。
| 维度 | 改写式合成 | 短文思考重建 | Megadocs | 论文展开(本文) |
|---|---|---|---|---|
| 原文保留 | ✗(改写) | ✓ | ✓ | ✓ 逐字 |
| 文档结构 | — | 无结构 | 等分切割 | 沿论文自身章节 |
| 重建过程 | — | 扁平注释块 | 扁平注释块 | 多轮:请求→规划→逐节思考 |
| 文档规模 | 任意 | 1–2K token | 拼接超长 | 中位 11K→28K 整体拉长 |
| 附加产物 | — | — | — | SFT 数据 + 评测基准 |
定位结论:本文把「重建隐藏生成过程」范式从短网页提升到文档级,论据是论文的结构与压缩特性天然适合;并以同一反向构造三产(CPT/SFT/Bench),以纯文本对照隔离「构造」的因果贡献。
三、问题定义
具体问题:如何把「重建文本背后隐藏思考」的合成数据范式提升到整篇科学论文的粒度,用于 CPT 以提升学术写作而不损害推理?
核心洞察:一篇论文 = 一次真实发生过的多轮生成过程的压缩快照。展开就是这次压缩的逆运算——类比考古:出土的是成品陶器(论文原文),要按陶轮上真实存在的工序(先有意图、再盘筑全局、再逐段塑形、最后通体打磨出摘要)反向复原制作过程,且每一步成品残片必须与出土陶器逐字吻合(原文 verbatim)。
形式化:一个统一构造——固定真实文本 $T$ 为最终输出,反向推导「会产出 $T$ 的潜上下文」$C$:
$$T \xrightarrow{\text{derive backwards}} C, \quad \text{训练数据} = C \oplus T$$三个产物只差「固定的单元」与「推导的东西」:
| 产物 | 固定单元 | 反向推导 | 规模 |
|---|---|---|---|
| CPT 语料 | 整篇论文 | 写作请求+全局规划+逐节思考+摘要思考 | 1.8M 篇 → 57–60B token/生成器 |
| SFT 数据 | 单个段落 | 任务 prompt + 答前思考 | 200K 样本、29 任务类型 |
| PAW-Bench | 留出论文 | 任务 + 评分量规 + 清单 | 2,940 题、15 任务类型 |
这个抽象的精妙之处:答案固定在先、提问反推在后,使每个格式约束都「答案可证满足」——SFT 数据里的每条格式指令都是答案确实满足的,顺带训练了指令跟随;事实核心来自真实论文,数字与主张有真实出处,从根上切断幻觉。
四、问题解法
4.1 共享预处理干线
三个产物共用一条 arXiv 清洗管线:定位主 LaTeX 文件、合并 \input/\include、展开自定义宏;只保留正文(截掉参考文献/致谢/附录/基金声明),剥离引用标记、图表环境与排版命令(保留公式与表格)——剩下的文本必须能独立成读,因为满是指向未见材料的指针的文本会教模型幻觉它。结构规则过滤空正文/超长/章节过少的论文与勘误增补;按正文哈希去重;剔除包含下游基准完整题目的论文(防泄漏)。三个产物分叉在时间窗与过滤严格度:CPT 要量(小模型低阈值打分,留 1.8M 篇);SFT 要质(正文长度/语言/章节/字母比/LaTeX 命令密度/重复段比更严 + 强模型高分,356K→按八学科均衡配额 220K);PAW-Bench 只用 2026 年 2–6 月的论文(晚于训练窗,按时间留出,保证基准探测真实泛化),均衡采样 2,000 篇、取各科前 50% 留 735 篇。
4.2 CPT 数据:展开为多轮轨迹
轨迹形状(镜像人类写长文档的方式):具体写作请求 → 全局规划(含逐节大纲)→ 每节前的写作思考 + 该节正文(原文)→ 最后通读全文的思考 + 摘要(原文)。全文正文中,章节文本与摘要逐字取自论文,只有包裹其外的思考是合成的。
四步构造(每步都是可百万篇规模执行的便宜调用):
- 逐节摘要:模型读每节写摘要(关键主张/方法/结论),后续所有步骤以摘要代表全文——控制每次调用输入规模、把注意力锁在节实质上;
- 推导写作请求:从标题+全部节摘要,写「用户请 AI 助手写这篇论文时会怎么说」;
- 推导全局规划与逐节思考:全局规划=以「研究已完成、一字未写」的作者身份思考章节顺序与各节职责;第 $i$ 节的思考=看到前后节摘要与本节真实正文,写「这节到底写什么、在整体论证中处于哪」的粗想。提示刻意少约束格式与长度——合成预训练数据里内容多样性比格式整齐重要,过约束会产生高度重复样本;
- 推导摘要思考:以全部节摘要+真实摘要为条件,思考如何蒸馏全文核心贡献。
生产规模:Qwen3.5-4B/9B/27B 三个生成器,1.8M 篇,温度 1.0、每次调用 8,192 token 预算。30B 源 token → 每生成器 57–60B 轨迹 token(约 2 倍膨胀);中位正文 11.2K → 中位轨迹 29.3K/29.4K/28.3K。
每个生成器有自己的语域(对 10,000 篇三方共同论文、约 315M 思考词的词频分析):4B「展示思考」(imagine、walking through)、9B「自我指令」(okay、wait、let me check)、27B「正式论证」(however、ultimately、critical reader)。27B 轨迹更短是因为砍掉了 think-aloud 旁白——这个语域差异后面会用来解释训练动力学。
4.3 SFT 数据:从论文段落反推任务
29 种手工设计的任务类型,按答案从论文的获得方式分三族:改写(一段改造成指定交付物,56%)、问答(问题答案都从材料推导,18%)、重组(多段重组成新体裁如决策备忘录,26%)。构成刻意平坦(最大类型 7.8%);34% 样本不附论文文本(闭卷,所需事实写进题目,中位答案最长约 1.1K token;附全文的任务偏紧凑抽取,中位约 300)。合成采用答案先行:先选段清洗成可独立成读的交付物→反推能引出它的用户请求(请求可以明说答案恰好具有的形态:字数、标题、表格)→最后写只用请求与材料中可见信息的思考。程序检查剔除机械失败(残留 LaTeX、思考提及「所给答案」),LLM 打分留高分。Qwen3.6-27B 生成约 200K 样本。
4.4 PAW-Bench:论文锚定的写作基准
735 篇留出论文 × 每篇 4 题 = 2,940 题、15 类型(9 类附材料考论文理解与接地写作,6 类无材料考真实工作场景的通用学术写作)。材料形态一半无/四分之一摘录/四分之一全文(1,470/764/706)。同类型任务的材料形态、目标长度、格式要求随机抽取——同类型两题很少要求完全相同的东西。评分材料:加权量规维度(内容覆盖/组织/忠实度等,逐题新写;接地任务的忠实度占量规 31% vs 无材料任务的 6%)+ 独立清单(硬性要求,一半可代码直查)。评测时 LLM 分别打量规分与过清单。答案长度 20–2,100 词、中位 1,000。
五、评估指标与实验证据
训练配方:Qwen2.5-7B 基座,CPT 50B token(30B 轨迹 + 20B FineWeb-Edu),lr 2e-5 余弦衰减、1 epoch、序列截断 64K、种子 42。五组对照共享全部超参:三个 Our-Data(4B/9B/27B 轨迹)+ 两个对照——FineWeb-Edu CPT(50B 纯通用)与 Plain-Paper CPT(30B 同源论文纯文本 + 20B FineWeb-Edu,只差「展开与否」)。后用三套开放 SFT(DeepWriting-20k 写作 / OpenThoughts 推理 / SmolTalk2 no-think 通用)分别配同一 SFT 配方——组内分差即中训练语料的净贡献。
写作主表(GPT-5.5 单一裁判):
| 模型(CPT + DeepWriting SFT) | WritingBench | PAW-Rubric | PAW-Checklist | HelloBench | LongBench-Write | 平均 |
|---|---|---|---|---|---|---|
| 无 CPT(直接 SFT) | 49.3 | 55.42 | 0.529 | 41.6 | 60.76 | 51.90 |
| FineWeb-Edu CPT | 47.7 | 53.71 | 0.535 | 42.5 | 60.35 | 51.08 |
| Plain-Paper CPT | 49.2 | 57.51 | 0.540 | 42.2 | 59.65 | 52.12 |
| Our-Data-4B CPT | 52.5 | 59.47 | 0.551 | 46.1 | 59.27 | 54.34 |
| Our-Data-9B CPT | 51.1 | 59.34 | 0.555 | 43.1 | 60.42 | 53.48 |
| Our-Data-27B CPT | 51.0 | 58.88 | 0.557 | 44.4 | 60.07 | 53.59 |
关键读数:(1) 纯论文文本对照不产生写作提升(52.12 ≈ 51.90)——同样论文换成轨迹后全面超越对照组,增益只能归因于「构造」;(2) 最大增益恰好落在与语料最接近的两个学术指标上(PAW-Bench +3.5~+4.0、WritingBench 学术工程 +2.4~+3.9);(3) 多加 50B 通用 token 无益甚至有害(FineWeb-Edu CPT 51.08)。
两阶段叠加:若能力可在 SFT 阶段补回,CPT 优势应消失——但同一 DeepWriting 配方下三个 Our-Data 仍高出无 CPT 基线 1.6–2.4。换 Our-Mixed SFT(用自家 SFT 数据替换 10K DeepWriting 样本)单用即把 PAW-Rubric 从 55.42 拉到 63.73;先轨迹 CPT 再 Our-Mixed SFT 达到全表最高 54.38(PAW-Rubric 64.13)。含 CPT 的所有配置(≥53.48)全部高于不含 CPT 的最高(52.35)——微调建立在中医训之上,两阶段收益相加。
推理不受伤(+OpenThoughts SFT):FineWeb-Edu CPT 反而侵蚀推理(46.32→44.30),替换 30B 为轨迹后回到直 SFT 水平(45.66–46.82)——写作收益不以牺牲推理为代价,还顺带缓解了遗忘。论文理解与长上下文(+SmolTalk2):Qasper 上 Our-Data-27B 43.01 超基线 3.19 而 Plain-Paper 反低 3.93;LongBench v2 ≤64k 档 27B +3.3、9B +2.2,Plain-Paper 在档位放宽时跌 5.06(全表最大跌幅)——94% 原论文在 32K 内、约三分之一轨迹进入 32–64K 带,文档整体拉长覆盖了原文到不了的长度带。
训练动力学(最有信息量的诊断):三个轨迹语料的 CPT loss 按生成器规模排序——4B 1.453、9B 1.416、27B 1.374,且 4B 是唯一 loss 超过原文纯文本(1.422)的语料,却拿下最佳写作平均 54.34 与最佳推理平均 46.82。下游成绩与 loss 反序。
为什么实验设计能证明论点:核心主张是「展开构造(而非论文内容或生成器强度)带来提升」。三重隔离:(1) Plain-Paper 对照同预算同论文只差展开与否;(2) 三生成器下游平均差仅 0.86(远小于与 Plain-Paper 的差距 2.22)且 4B 反而最好——排除「蒸馏更强生成器」解释;(3) 两套 SFT 配方下 CPT 优势都在——排除「SFT 可补回」解释。loss 反序现象则把「弱采样器/难拟合数据更好」的已知效应放到新轴上(同一管线内的生成器规模)并上溯到训练损失本身。
六、效果优势的根源解释
为什么展开轨迹胜过纯论文文本? 因果链:纯文本只提供压缩的结果(论证的最终形态),思考过程(为什么这样组织、这节在全文论证中承担什么、摘要如何蒸馏)从未出现在数据里 → 模型只能从成品逆推过程,而逆推信号稀疏。轨迹显式暴露「全局规划→分节决策→写作」的分层决策链,且文档整体拉长至 28K+(覆盖原文到不了的长度带 → 长上下文收益)。Plain-Paper 对照证明:信息增量不在论文内容(两组同内容)而在重建的过程结构。写作基准需要模型「先规划后产出」,轨迹数据的监督信号恰好对齐这个计算图。
为什么最难拟合的语料下游最好(4B 悖论)? 机制因果链:4B 生成器语域是 think-aloud(imagine、walking、feel 等词频最高)→ 语料 register 更多样、逐篇差异更大 → 对学习模型而言每篇都有「意外」→ CPT loss 最高(1.453)→ 但这些难拟合的 token 恰恰是多样性的载体,为写作提供了更宽的风格/角度分布 → 微调后泛化最好(54.34)。27B 语料用低 loss 买来的均匀性(篇与篇更相似)使 30B token 的信息量缩水——「更大生成器未必更好」在此不是经验现象而是有 loss 证据的机制:低 loss = 高冗余 = 少信息。这与已知结论(剪最易拟合样本改善预训练、弱采样器给更好推理数据)一致,本文的贡献是把它放到「同一管线内的生成器规模」这一受控轴上。诚实边界:27B 语料在长文档任务上领先(Qasper 43.01、两个 LongBench 档均最高)——均匀性损害开放式写作、却买来持续连贯性,没有一个语料处处最优。
为什么答案先行的反推能减少幻觉? 事实核心先锚定在真实论文 → 数字与主张有可溯源出处 → 思考只允许用请求与材料中可见信息写(程序检查剔除违规)→ 模型学到的「思考→答案」通路建立在接地证据上。这不是事后过滤幻觉,而是在数据构造时就消除幻觉通道。
七、必要知识反推
领域知识层:
- 学术论文的修辞结构(引言/方法/实验/结论各有角色)与页限压缩特性——选语料与「沿自身结构分解」的依据;
- CPT 与灾难性遗忘、通用文本混合的缓解作用——配方设计的出发点;
- 写作/推理/长上下文各自的基准生态(WritingBench/HelloBench/LongBench-Write、OpenThoughts 系、Qasper/QASA)——评估覆盖面。
方法论知识层:
- 隐藏思考重建与指令反译两条已有脉络及其短文档局限——本文的直接前置;
- 「答案固定、反推上下文」构造的一般性(三产同构)——需要把三个看似不同的任务统一成一个反向推导问题;
- 数据多样性与可拟合性的权衡(过约束提示→重复样本;低 loss=高冗余)——提示设计与生成器选择的依据;
- 按时间留出的防泄漏设计(PAW-Bench 只用训练窗之后的论文)。
工程知识层:
- 百万篇规模的 LaTeX 源处理(宏展开、include 解析、剥离图表但保留公式表格、答案可独立成读的清洗标准);
- 生成管线工程(摘要代表全文以控制调用输入、8,192 token 预算、温度 1.0 保多样性);
- 大规模 CPT 训练配置(64K 截断、小学习率防拉偏、五组对照严格同参)。
知识融合的关键节点:(1) 「过程真实发生过」的语料选择洞察——把「重建隐藏思考」从任意短文迁移到论文,理由不是论文更长,而是「作者确实有全局规划」使反推有对齐的真实参照;(2) loss 反序的诊断——需要同时看语域词频分析(语言学的显微镜)与训练曲线(优化的温度计),把「弱生成器更好」从 folklore 变成可复现的机制陈述。
八、论文中可以提取的通用性灵感
灵感一:数据的价值在「过程」不在「产物」——把成品反推成过程再训练。 核心思想:领域内大量存量数据是压缩的最终产物;固定产物逐字不动、反向重建生成过程,能制造出产物本身不含的监督信号。 论文证据:同预算同论文下纯文本对照无写作提升(52.12 vs 51.90),展开轨迹 54.34;增益随任务与语料接近度递减递增(学术指标最大)。 推广场景:(1) 数学教育——从正确解反推解题决策点构造教学对话;(2) 代码训练——从提交历史反推设计权衡(文中引证 GitHub 版);(3) 法律——从判例文书反推论证构造过程;(4) 产品设计——从成熟产品反推需求分析与设计文档。
灵感二:答案先行、反推请求——每条格式约束都「可证满足」。 核心思想:合成指令数据时先固定答案再生成请求,请求即可显式陈述答案恰好具有的一切形态约束,天然训练指令跟随且杜绝不可满足指令。 论文证据:SFT 数据中「每条格式指令都是答案确实满足的」;思考只允许引用请求与材料可见信息,程序检查剔除违规。 推广场景:(1) 阅读理解数据集生成——先选段落再出题;(2) 对话系统训练——先写理想回复再反推用户消息;(3) 表格/JSON 结构化输出训练;(4) 检索增强任务的查询构造。
灵感三:小生成器造的数据可能更好——难拟合≈高信息。 核心思想:合成数据的生成器不必最强;弱生成器的多样、不均匀、难拟合输出往往信息密度更高,选择标准应看下游而非生成 loss。 论文证据:4B 语料 loss 最高(1.453,唯一超原文)却写作/推理双最佳;三生成器下游差 0.86 远小于与纯文本对照差 2.22;27B 低 loss 语料仅在长文档任务胜出。 推广场景:(1) 数据增强——温度/采样策略优先于换更强模型;(2) 教师模型选择——蒸馏小模型可能保留更多模式多样性;(3) 测试用例生成——弱的生成器覆盖更多边界;(4) 众包——多样低技能标注者可能优于单一专家的均匀标注。
灵感四:一个反向构造,三类数据资产(训练+指令+评测)。 核心思想:当数据构造原理是「固定真实内容、反推上下文」时,改变固定的单元与推导的目标即可批量衍生配套的训练集、SFT 集与评测集——三者天然对齐且评测可按时间留出。 论文证据:CPT 轨迹(固定整篇)/SFT 样本(固定段落)/PAW-Bench(固定留出论文+推导评分量规)同构;基准用 2026.02–06 论文与训练窗不交。 推广场景:(1) 代码域——仓库轨迹/SFT/基准三产;(2) 医疗——病历反推诊疗思路+基准;(3) 企业知识管理——文档过程化+员工评测任务;(4) 多语言——平行语料的过程化扩展。
灵感五:文档级拉长是覆盖新长度带的手段,长上下文能力可由数据驱动。 核心思想:想获得某个输入长度带的能力,可以在数据侧把现有文档结构化地扩展到该长度带,而非只靠架构或位置编码改进。 论文证据:中位 11.2K→28–29K,约三分之一轨迹进入 32–64K 带;LongBench v2 ≤64k 档 27B +3.3、9B +2.2,而纯文本对照在档位放宽时跌幅最大(−5.06)。 推广场景:(1) 多轮对话数据——把单轮任务串成依赖链长对话;(2) Agent 轨迹——把短任务组合成跨工具长轨迹;(3) 长文档摘要训练数据;(4) 视频理解——把短视频事件链扩展为长时序标注。