论文链接:OPEN-1B: A Fully Auditable Training Run 发表时间:2026年9月 机构:Gensyn(去中心化训练公司) 领域标签:cs.LG / Reproducibility / Open Source LLM
一、论文背景
模型透明度的三层现状:闭源(GPT/Claude/Gemini/Grok——只给 API,架构与训练轨迹未知);开放权重(Qwen/Kimi/DeepSeek/GLM——给最终权重,数据与方法部分保密,注入的偏置无法排除);开源(OLMo/Apertus/Marin/Pythia——权重+数据+配方全给)。
开源的隐藏裂缝:浮点加法不满足结合律——(a⊕b)⊕c ≠ a⊕(b⊕c)。GPU 按硬件特有模式并行求和、不同硬件指令序列不同,即使严格照开源配方重训,最终权重也会有微小差异。因此没有人能验证"这个 checkpoint 是不是声明的数据训出来的"——未公开数据、注入偏置、埋后门(几个数据点即可)在原理上无法排除。proof-of-learning / proof-of-training-data 只能概率性验证。
“完全可审计"的定义:训练中每个数据样本上的每个操作,都可在异构商用硬件上以逐位确定性独立复现。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 开源 LLM | OLMo 2、Apertus、Marin、Pythia | 数据+配方+权重全放 | 复现是"近似"的,不可验证 |
| 训练验证 | proof-of-learning、proof-of-training-data | 概率性证明 | 可被持续优化攻击绕过 |
| 确定性训练 | 框架 deterministic mode、Arun et al. 2025 可复现算子 | 同机可复现 | 不跨硬件;BR(逐位跨机)更强 |
| 量化训练 | LSQ QAT、SpinQuant/QuarRot 类旋转 | int8 训练与外点抑制 | 本文原生 QAT 预训练+审计约束 |
| Llama 系架构 | Llama 3、OLMo 2、Gemma | 主流 decoder 配方 | 本文按可复现+低精度稳定改造 |
定位结论:OPEN-1B 开出第四层透明度——“fully auditable”:不满足于"你可以试着重训一个类似的”,而是"你可以在自己笔记本上重放第 52,341 步并逐位对上哈希"。
三、问题定义
具体场景:怀疑某开源模型训练数据里藏了偏置或后门——你想验证发布方声称的"就是这些数据、这个配方"。
抽象问题:分布式深度学习训练能否做成一个纯函数——输出(权重轨迹)由输入(种子+数据清单+配方)完全决定、与执行拓扑无关,从而任意片段可在任意单机上重放验证。
形式化:对每一步 t,任何人在任何支持的硬件上重放 step(t) 应得到逐位相同的权重/优化器状态,且整跑存在一个总哈希;由于单人验全程不可行,设计集体审计协议——多名审计者各认证若干步,拼接覆盖全程。
精妙之处:把"复现"从统计概念(跑出来差不多)升为比特概念(差一个 bit 就算失败)——一旦接受这个更严的标准,所有模糊的"差不多开源"都变成明确的"没开源"。
四、问题解法
RepOps:跨硬件逐位复现算子库
四个破坏源逐一加锁:(1) 规约顺序——所有求和(matmul 内、norm、loss/梯度规约)在所有硬件上按同一固定顺序算,牺牲硬件最优顺序;(2) FMA 融合——a×b+c 单指令舍入一次 vs 乘加两次舍入差 1 ULP,编译器自行选择融合策略,RepOps 强制单一约定;(3) 次正规数——Apple GPU 默认 FTZ/DAZ 清零而 CPU/NVIDIA 保留,统一"向最弱后端看齐"全部清零;(4) 随机数——各平台生成器内部状态不同,换成计数器式生成(第 i 个随机数=纯函数 f(seed, i),与并行划分无关)。
拓扑不变数据流
训练 token 流定义为种子+语料清单的纯函数:三个计数器式 RNG 分别决定源交错(web/code/math 按权重)、分片顺序(SHA-256 哈希源名做种子,跨进程稳定)、文档顺序。切出固定 4,097 token 窗口;数据并行只改"哪个 rank 加载哪个窗口"(m mod R = r),不改流本身——换集群规模、断点续训、单机重放,看到的都是同一条流。
确定性通信与集体审计
跨副本梯度 all-reduce 用递归倍增 butterfly(固定规约顺序,非 2 幂节点有额外代价);每步做状态哈希(可开关)。审计 harness 支持重放任意步并与公开轨迹对哈希;全程由多审计者分片认证。
Open-1B 模型本身
1.61B 参数(24 层/2048 hidden/GQA 16:4/混合滑窗 512);全线性层 int8 W8A8 LSQ QAT 原生量化(前反向都走 int8 张量核,梯度 GEMM 经 Walsh-Hadamard 旋转把权梯度误差 5%→1%);QK-norm 无增益(防注意力熵塌缩)、嵌入后加 RMSNorm(稳定量化);400B token(DCLM/FineWeb-Edu/Stack v2/Proof-Pile-2)、48×H100、29.5 天。
五、评估指标与实验证据
| 维度 | 关键数字 | 证明什么 |
|---|---|---|
| 可复现性 | 任一步重放逐位一致(跨 NVIDIA/x86/ARM/Apple Silicon);整跑单一哈希 | 第四层透明度可实现 |
| 复现税 | MFU ~5%,比优化非复现内核低一个数量级;单节点 BR-bf16 仅 3.3% MFU | 明码标价:可验证换速度 |
| 扩展 | 1→6 节点 40.0k→169.4k tokens/s(71% 效率,含每步哈希);关哈希 217.4k(86%) | 瓶颈=状态哈希(≈6s/步)+跨节点规约 |
| 通信 | butterfly 在 2 幂节点近乎免费(1-2 跳),非 2 幂(6 节点)串行跳开销大 | 确定性通信的拓扑税 |
| 质量 | OLMES 50.1 vs OLMo2-1B 61.5(400B vs 4T token);逐任务复现对方表格数值 | 400B 下合理,配方无暗病 |
| 产物 | 最终权重+全部 100 步间隔中间检查点+全数据+全代码+审计 App | 审计对象完整 |
证明力分析:本文的核心主张(可审计性)由构造证明——重放机制本身就是证明。真正有信息量的是代价量化:5% MFU 意味着同等算力下训练 token 数缩水约一个数量级,这是"逐位确定性 vs 硬件最优执行"的不可调和冲突(固定规约序放弃了 GPU 的树形归约优势)。单节点 BR-bf16 3.3% MFU 的分解实验很关键——它把代价拆到"内核层"(BR 约束)而非"量化"(QAT 另有其账),排除了"慢是因为 int8"的误读。
对照设计:三种内核(stock PyTorch bf16 / repop bf16 / repop QAT)同架构同数据流同批协议——把"复现税"与"量化效果"干净分离。
六、效果优势的根源解释
根源机制与证据链
- 逐位不可复现的根因是"并行归约的自由度"而非浮点本身(论文机制论证+构造证明):浮点数本身是确定的,不确定来自"谁先跟谁加"——GPU 车道划分、树形归并模式、编译器融合策略都是自由度。固定这些自由度(规约序/FMA/次正规数/RNG)后跨硬件逐位一致。机制链:自由度锁定→每步舍入序列跨机相同→轨迹逐位收敛。
- “向最弱后端看齐"是跨异构集合确定性的必然策略(论文设计原则):只要有一个后端做不到(如 Apple GPU 清次正规数),所有后端都得迁就它——因为验证要求的是"任意两台机器一致"而非"大多数机器一致”。这解释了为什么性能税无法用更好的 GPU 摊薄。
- 数据流与拓扑解耦是单机重放的关键(论文构造):传统 data loader 的批序依赖 world size/rank/prefetch——换并行度流就变。把流定义成纯函数后,rank 只决定"谁读哪个窗口",重放者在单机上按同一定义枚举即可。
- 性能税的主项可定位(论文实验已支持):前反向(含节点内确定性 reduce-scatter)强扩展效率 99.7%——内核层几乎无损扩展;累积损失来自每步状态哈希(常数 ≈6s)与跨节点复制规约(6 节点 2.6s)——即"审计基础设施"而非"数学运算"拖慢了训练。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| OLMo 2 | 全开源训练 | 配方级可复现 | 近似复现,无逐位验证 | 对照:第三层与第四层的差距 |
| Proof-of-Training-Data(2402.07762) | 训练数据证明 | 概率性验证 | 可被插数据点绕过 | 支持:概率证明对后门不足 |
| Proof-of-Learning(2003.01769) | 训练过程证明 | 哈希链验证 | 优化攻击可伪造 | 同上 |
| [Arun et al. 2025 可复现算子(论文引用)](https://arxiv.org/abs/2505. see paper) | 确定性算子 | BR 算子可行 | 库完整度/模型规模 | 支持:算子层基础已有 |
| Marin(社区开源) | 社区共建开源 LLM | 全流程开源 | 无 BR 目标 | 对照:社区路线 vs 审计路线 |
| Pythia | 千检查点开源 | 中间权重研究 | 无重放验证 | 补充:中间产物价值有先例 |
相反结论检索:未发现主张"开源配方足够、逐位验证无必要"的正式研究;社区常见反对意见是"复现税不值"(一个数量级 MFU)——本文的回应是明码标价并让生态自己选择,同时指出税的主项(哈希/通信)随硬件进步可摊薄,而内核税是结构性的。
综合判断与未决问题
多研究共同支持:浮点非结合导致跨机不可复现是数值分析常识(论文引 Srivastava et al. 2024);概率性训练证明可被绕过有专门攻击文献。仍属推测:集体审计协议的现实激励(谁来当审计者)与经济学——论文给出机制但未给出参与动机设计。适用边界:1.6B/400B token 规模——BR 约束在大规模(千卡 MoE)下的税是否线性放大未知;int8 QAT 配方对更大模型是否稳定待验。可能的失效条件:若未来硬件提供原生确定性归约原语,“向最弱看齐"的税可大幅下降——本文的约束是当前硬件世代的产物。
七、必要知识反推
领域知识层:浮点运算的舍入细节(次正规数、FMA、ULP)——不知道这四个破坏源就理解不了 RepOps 每条约定的必要性;并行训练的数据流实现(data loader 的 rank 条带化、prefetch、梯度 all-reduce)——才能看出"拓扑不变"改变了什么。
方法论知识层:确定性与可复现性的概念区分(同机重复 vs 跨机逐位);密码学哈希作为承诺的用法(整跑单哈希);集体/分片验证思想(开放源码社区的多模块分别审计)。
工程知识层:QAT 原生预训练的稳定性工程(QK-norm 无增益、嵌入 norm、z-loss、梯度旋转压外点);跨四类后端(CUDA/x86/ARM/Metal)的算子实现与 CI;强扩展基准设计(固定批协议、分桶计时)。
知识融合关键节点:最深的融合点是”把数值分析家的显微镜对准分布式系统"——浮点细节(数学)× 通信模式(系统)× 编译器行为(工具链)三者交叉处才有"跨硬件逐位"这个问题;单懂任何一门都会把问题误诊为"设个种子就行"。第二个节点是审计的经济学设计——验证全程不可行,借鉴开源社区"分模块各自验证"的组织智慧把审计变成公共品。
八、通用性灵感
- “开源"的三重门:给结论、给配方、给可验证过程:多数领域的"透明"停在配方层——只有做到"任何人可重放并逐位核对"才算过程透明(论文证据:三层透明度分层+第四层构造)。推广:临床试验(公开方案≠可验证数据生成过程)、审计报告(给结论≠给底稿可重算)、政务公开(给结果≠给可复算的明细账)。
- 确定性是"向最弱环节看齐"的协议:跨异构集合的统一行为必然以能力最低的成员为基准——追求整体确定性就要接受整体降速到短板(论文证据:Apple GPU 清次正规数→所有后端统一清零)。推广:跨国标准协商(就低不就高)、多平台软件(以最弱平台特性为公约数)、团队协作节奏(同步成本由最慢成员决定)。
- 并行自由度是不确定的来源,锁定它要用性能买单:浮点本身确定,“谁先跟谁加"的自由度才产生分歧——消除自由度=放弃并行归约的最优编排(论文证据:固定规约序→MFU 降一个数量级)。推广:分布式账本(串行化共识的吞吐代价)、并行版本合并(锁定合并顺序 vs 自由 rebase 的速度差)。
- 验证不了的全程可以分片验证:单个审计者重放全程不可行,多审计者各认证若干步即可拼出完整信任链(论文证据:集体审计方案)。推广:开源代码审计(多人分包 review)、区块链轻节点(抽样验证)、众包事实核查。
- 把"信任声明"升级为"对哈希”:发布方说"我是这么训的"不可信,发布方公布哈希、任何人重放对哈希才可信——信任的锚点从主体转移到计算(论文证据:整跑单一哈希)。推广:供应链溯源(声明来源 vs 哈希比对)、学术数据(“我跑了这些实验” vs 可重跑对账)、艺术品鉴定。