论文链接:Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work 发表时间:2026年9月 机构:Accio-Lab(开放研究团队) 代码/模型:HuggingFace | GitHub 领域标签:cs.CL / cs.AI — 开放权重 agent 模型
一、论文背景
Co-work 任务的成本结构:办公协作类 agent 一次"任务回合"由几十次模型调用组成(查信息、用工具、写代码、理文件)——成本与延迟沿整段累积。但其中多数步骤是状态追踪、协调、恢复、跟进——不需要前沿级推理能力。
错配:用 SOTA 大模型跑全部步骤,为 10% 的难步骤付 100% 的溢价;且闭源 API 有数据隐私与锁定问题。
路线主张:在"能力-成本"帕累托前沿上,35B-A3B(MoE 每 token 激活 3B)规模经过针对性后训练可以覆盖 co-work 的绝大多数步骤,重步骤按需调用大模型——本文交付这个规模的开放模型与训练配方。
二、论文定位和关联工作
| 谱系 | 工作 | 关键区别 |
|---|---|---|
| 同规模 agent 模型 | Qwen3.6-35B-A3B(底座)、Agents-A1、Nex-N2-mini、BigBang-1.0、Ornith-1.5 | Occamy 主打执行接地的分阶段后训练与性价比协议 |
| 前沿参照 | GPT-5.6 Sol、Qwen3.8-Max、DeepSeek V4 Pro、GLM-5.2 | 作为高能力参照系(非对手) |
| 开放 agent 模型 | 本系列前轮 Feyospace-v1(cyber 域) | Occamy 面向通用 co-work 域 |
本文定位:35B-A3B 规模的开放 co-work 模型 + 执行接地训练管线的完整技术报告(按 LLaDA-Image/SenseNova 先例,技术报告型工作)。
三、问题定义
具体场景:长时程 co-work 工作流(跨几十次调用的状态/工具/文件操作复合)。
抽象问题:给定任务延迟与成本由全回合累积的结构,如何在受限参数规模下训练出覆盖多数步骤能力的模型?
形式化:性能 P(model) 与每任务成本 C(model) 的帕累托效率;评测协议明示价格与配置(“stated evaluation and pricing protocol”)。
精妙之处:把评测口径从"峰值能力"转向"交付效率"(capability per dollar per episode)——与 co-work 的真实价值函数对齐。
四、问题解法
执行接地的数据与环境:
- 构造真实执行环境(非模拟打分):任务在真实工具链上完成;
- 可重放长时程轨迹:跨多个 harness 采集(Claude Code 式、开放式 harness 等),保证轨迹多样性;
- 轨迹带完整环境状态(可重放=可验证可复现)。
分阶段后训练:
- 阶段划分开发互补的执行能力(工具调用、状态管理、恢复);
- 阶段间巩固——避免后续训练冲掉先前能力(与 LifeMem 的遗忘治理同问题意识)。
评测纪律:12 benchmark 尽量用完整任务集、官方 harness、隔离执行环境、benchmark 原生评分器;复制/修改协议(GDPval、τ³-Bench 配置)显式标注——评测诚实度在技术报告中少见。
五、评估指标与实验证据
| 维度 | 结果 |
|---|---|
| 同规模对比(35B-A3B 组:Qwen3.6/Agents-A1/Nex-N2-mini/BigBang-1.0/Ornith-1.5) | 12 benchmark 四能力域(co-work/office、coding 中心 TB2.1、工具自动化 BFCL v4/AutomationBench/VitaBench、指令遵循 IFEval)中稳定居最强之列 |
| 前沿参照 | 部分任务与 GPT-5.6 Sol/Qwen3.8-Max/DeepSeek V4 Pro/GLM-5.2 竞争 |
| 性价比 | 声明的评测与价格协议下,4 个代表性 benchmark 聚合性能价格比优 |
| 开放性 | 权重+评测代码公开,数据与训练配方陆续发布 |
为什么这套设计能证明论点:性价比主张要求价格协议显式(否则不可比)——论文把协议写进声明;同规模组控制参数量、前沿组提供上限感——双参照系是"够用且便宜"论证的标准结构。
六、效果优势的根源解释
为何 35B-A3B 能覆盖 co-work 多数步骤?
因果链:co-work 步骤的能力分布重尾——多数步骤低难度高频率(状态/协调/恢复),少数步骤高难度(机制前提)→ 通用大模型的多数算力花在难步骤能力上,对易步骤是浪费(机制:能力-成本错配)→ 35B 经执行接地训练补齐的是易步骤的可靠执行而非难步骤的推理深度(方法差异)→ 覆盖率上升而单价大降(机制变化)→ 帕累托改善(指标)。多 harness 轨迹采集的作用(机制分析):单一 harness 轨迹学到 harness 特有模式(过拟合 harness),多 harness 强制学习任务本身的普适结构——与本轮 harness 效应研究(2609.11987 ±24pp)的警示一致。
外部交叉验证:MoE 稀疏激活的性价比(DeepSeek/Qwen 系产品化证据)支持"A3B 激活覆盖中低复杂度任务";本系列前轮精读的 Minima GDN 4-bit(09-07,独立团队小模型路线)与 Feyospace-v1(7 人团队开放 cyber 模型)证明小团队+针对性后训练可交付可用开放模型的模式;Is Bash All You Need?(同日)证明接口表达力对 agent 能力的一阶影响——Occamy 的多 harness 训练正吸收这一教训。反方/边界:TB2.1 等编码中心任务上与前沿模型仍有实质差距(论文自己作为参照系呈现);性价比结论依赖声明的价格协议,API 定价变化会改变结论——这是所有性价比类工作的共同边界。
七、必要知识反推
- 领域知识层:co-work 工作流的步骤构成与能力分布;主流 harness 的接口差异。
- 方法论知识层:执行接地 RL/SFT 的分阶段课程设计;帕累托评测协议(性能-成本双轴)。
- 工程知识层:长时程轨迹的可重放架构(环境状态快照);多 harness 采集管线;隔离执行环境。
- 融合关键节点:“步骤难度分布"洞察 × “执行接地训练"方法——前者决定规模够用性判断,后者把判断变成模型能力。
八、通用性灵感
- 按步骤难度分布选模型规模,而非按任务峰值。论文证据:35B 覆盖多数步骤+性价比最优。推广:微服务资源分配(热路径重配冷路径轻配)、团队人才结构(高级岗攻坚+标准岗吞吐)。
- 多环境采集防过拟合环境。论文证据:多 harness 轨迹强制学任务普适结构。推广:多设备用户研究、多地区 A/B——训练/结论要跨环境稳健。
- 性价比主张必须显式价格协议。论文证据:stated evaluation and pricing protocol。推广:任何"更便宜"的技术选型报告都应写明计价口径与敏感性。
- 可重放轨迹是训练资产的质检标准。论文证据:replayable trajectories 支撑验证与复现。推广:数据管线 lineage、实验记录的可重放性——不可重放的资产无法信任。