Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training 精读
字节跳动 Seed、南京大学与 Evolvent AI 合作提出「论文展开」管线:保持论文原文逐字不动,用教师模型反向重建写作请求、全局规划与逐节写作前的思考,把整篇论文展开为多轮生成轨迹用于持续预训练。1.8M 篇 arXiv 论文的 30B token 原文被展开为 57–60B token 轨迹,中位文档长度从 11.2K 提升到 28–29K token。同一反向构造还产出 200K 样本 SFT 数据集与 2,940 题的 PAW-Bench 学术写作基准。受控实验(同预算纯论文文本对照)证明增益来自「构造」而非论文内容:写作四项平均 54.34 对纯文本 52.12/无 CPT 51.90,推理不降反稳,长文档理解提升;且 4B 小生成器的语料最难拟合(loss 1.453)却下游最好——生成器越弱、数据越难拟合,收益越大。