论文链接:ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 发表时间:2026年9月 机构:中关村人工智能研究院 + DeepSeek-AI 系作者 领域标签:cs.CL / Foundation Model(技术报告型——按 SenseNova-U1.5 先例解读,不按常规论文精读展开全部九部分的技术细节,聚焦配方与开放价值)
一、论文背景
“全开放"意味着什么:不只是权重(MIT),还包括训练配方——数据混合物、RL 设计、Agent-SFT 管线的细节。在闭源前沿与"只开权重"之间,全配方开放是第三档:研究者可以复现、改进、衍生。Mozilla 同日报告(中国开源与硅谷差距缩至 4.4 个月)为此提供了产业背景。
极致高效的双关:模型高效(7B-8B 级逼近大模型推理能力)+ 训练高效(配方探索用代理模型,成本降一个量级)。
二、定位:技术报告的谱系位置
与 DeepSeek-R1 系列、Qwen 技术报告同谱系——模型发布 + 配方公开。差异点:ZGCM-1 聚焦"数学 + Agentic Search"双能力,且把 AI-Native R&D(AI 参与自身配方研发)作为公开卖点。同日 Atria Dawn(744B Agent 基座)走"大而全”,ZGCM-1 走"小而精"——开源生态的两种互补策略。
三、问题定义(浓缩)
在小参数量下逼近前沿数学推理与 Agentic Search 能力,同时把训练配方的探索成本压到可负担——训练经济学是隐含的一等问题。
四、解法核心(浓缩)
配方一:代理模型混合物搜索。用约 30B token 的小规模代理训练(proxy training loss 与评测信号指导)迭代数据混合物候选——先在便宜的世界里找到好配方,再花大钱全量训练。与 Dream-RSI"先重放改进策略再上场"共享同一工程哲学:昂贵决策前用廉价代理预演。
配方二:混合 RL + Agent-SFT。RL 部分针对可验证数学推理;Agent-SFT 用 verifier-successful 轨迹子集(22,309 配对视图中的 15,748 成功子集——论文注明该子集是消融产物非最终 SFT 集)注入工具交互能力。两路信号互补:RL 给推理深度,SFT 给工具流畅性。
五、评估证据(浓缩)
| 基准 | ZGCM-1-7B | 定位 |
|---|---|---|
| AIME 2026 | 75.0% | 7B-8B 级第一 |
| MATH-500 | 97.1% | 接近饱和 |
| HMMT 2025 | 70.4% | 高难竞赛 |
| 14 基准平均 | 7B-8B 级第一 | 综合推理 |
| Agentic Search | 与前沿大模型竞争 | 小参数量挑战量级差距 |
证明力说明:技术报告的分数为自报口径(同 Atria Dawn 的限定),但配方开放使独立复现成为可能——这是开放报告与闭源发布的本质区别。
六、根源解释(浓缩)
小模型逼近大模型的两条杠杆:数据配方密度(代理搜索找到的高密度混合物使每参数的信息效率最大化)与能力定向后训练(数学 RL 的奖励密度高,小模型在窄域可逼近通才大模型——窄域强化是参数效率的第三条路径,与知识蒸馏、量化并列)。交叉验证:DeepSeek-R1 的纯 RL 提升、Qwen 的数学专项系、OLMo 的开放配方传统均支持此路线。
七、必要知识反推(浓缩)
数据混合物优化的方法论(proxy-model mixture optimization 的采样与评测协议);RLVR 奖励设计;Agent 轨迹的数据工程(verifier-successful 过滤);开放科学的合规(数据来源审计)。融合节点:把"AI 参与配方搜索"(AI4AI)本身作为可公开的方法论——大多数实验室把这一步藏在幕后。
八、通用性灵感
- 代理预演降本:昂贵全量动作前用小规模代理迭代决策(混合物搜索的 30B 代理)——推广至任何高成本实验设计(芯片流片前的仿真、药物临床前的计算筛选)。
- 窄域强化是参数效率路径:小模型+高密度可验证奖励可在专项域逼近大模型——推广至企业私有模型的性价比策略(专才小模型 > 通才大模型)。
- 配方的开放比权重更稀缺:权重是结果,配方是过程——开放过程才能被真正改进(推广:开源项目的"设计文档"价值高于代码本身)。
- 成功子集的数据工程:verifier-successful 过滤是质量-数量权衡的实用解——推广至任何经验数据的清洗(只保留可验证成功的示范)。