论文链接:Praxist: From Experimental Artifacts to Solution Lineages 代码仓库:github.com/sapientinc/praxist | 项目页:praxist.sapient.inc 发表时间:2026年8月 机构:Sapient Intelligence(企业)+ Nanyang Technological University(南洋理工)+ Tsinghua University(清华)+ Carnegie Mellon University + University of Pennsylvania——企业+高校合作:企业侧(Sapient Intelligence)主导系统构建与全部实验执行,高校合作者(含清华 Sen Song 等)参与研究;通讯作者 Yuhao Sun。 领域标签:cs.MA / 自主科研 Agent / 机器学习工程
一、论文背景
自主 R&D Agent 是近两年兴起的方向:让 LLM Agent 写代码、跑实验、依据自动评估反馈迭代改进可执行工件。支撑它的评测生态已具规模——机器学习工程 benchmark(MLE-bench 等)、软件工程 Agent、科学复现 benchmark。当这些系统从「单次尝试」走向「长周期战役(campaign)」,一个结构性问题浮出水面:如何让之前的尝试塑造未来的构建?
主流做法是把战役状态存成「候选解的搜索树」。问题在于:随着树的生长,每个节点工件越来越组合化——混合了来自多次尝试的数据选择、算法、超参、实现技巧与诊断。一个机制的价值可能只有通过组合才显现,工件级搜索会在其效用可见之前就把它剪掉。于是战役产生了大量已评估的经验,却只有一小部分以「后续尝试可以直接构建其上」的形式被保留——长战役不断重学同样的教训。
论文借用装配理论(Assembly Theory)给出另一种原语:复杂物体由可复用子结构的形成历史刻画,选择决定哪些子结构留存。因为每一步都作用于已保留的部分,成本随装配操作数(而非空间大小)扩展,每个元素在后续构建中被摊销。搜索不必预见哪个变体重要,只需以正确的角色保留正确的元素、保持可重组。作者把这种「把已评估结果转化为可行动的、锚定工件的状态」称为证据继承(evidence inheritance)。
论文还点出当前自主 R&D 的另一面:成果是「实验室仪器」式的——在精选 benchmark 上演示、增益难以追溯到原因、成本远超可持续工程实践所能吸收。生产级研究需要的是可审计的运行画像:每个增益都附带「如何得到」的记录。
二、论文定位和关联工作
PRAXIST 站在六个传统的交汇处,每个传统贡献一块拼图、也各有缺口:
- 反思与记忆(Reflexion 等):跨尝试复用观察,但反思是轮内的、非类型化的——没有「证据强度」与「继承角色」。
- 多智能体系统:跨角色分布规划与修订,但角色通常服务于单次任务而非研究治理。
- 图结构组织(agent 计算图、推理图、记忆图):提供组织原语,但未与「评估-继承」接口对接。
- 质量-多样性搜索(QD):在高性能区域维持覆盖,PRAXIST 把 QD 从「最终工件」搬到「研究设计空间」。
- 溯源系统(provenance、ML 实验跟踪):连接输出与产出过程,但不决定「证据以什么角色被继承」。
- 搜索树式 R&D 系统(AIDE、程序数据库类):本文的直接对照——它们继承的是「按分数排名的工件集合」,一个未类型化对象。
| 维度 | 搜索树式(AIDE 等) | 反思/记忆类 | PRAXIST |
|---|---|---|---|
| 继承单位 | 分数排名的工件 | 轮内反思文本 | 类型化 findings + 继承动作 |
| 失败的处理 | 低分即剪枝 | 口头教训 | negative/diagnostic 一等证据→约束 |
| 证据强度 | 只有分数 | 无分级 | smoke/scout/complete 证据阶梯 |
| 探索控制 | 贪心分数 | 无 | QD 设计单元配额 |
| 可审计性 | 树结构 | 日志 | 全程 lineage 图(第二交付物) |
定位结论:PRAXIST 的贡献是系统级的——把上述传统焊接成一个「评估-继承」接口,让长周期自主 R&D 第一次拥有类型化、可继承、可审计的研究状态。
三、问题定义
具体问题:自主 R&D 战役在数十次世代、上百次尝试后,如何让「学到的教训」以可复用、可验证、可重组的形式留存,而不是散落在原始转录与标量分数里?
核心洞察:证据绝不能以原始转录或标量分数的形式被继承——在被允许影响未来工作之前,每条证据必须被赋予明确的操作角色:是可构建的成熟父代、待验证的脆弱候选、要避开的失败、还是该记住的教训。
形式化:PRAXIST 是世代状态转移过程。世代 g 继承状态 S_g = (F_g, A_g, G_g, L_g)——frontier(可继承证据)、agenda(世代政策)、Gems(跨代持久教训)、lineage(溯源轨迹)。每代执行 C 个并行 peers 后发射 S_{g+1}。核心循环:Artifact → Finding → Frontier → Agenda → Lineage。finding 是可复用知识的单元,定义为元组 φ = (intervention, outcome, evidence, τ, m, α):做了什么干预、结果如何、证据是什么,加上三个支配继承的标签——类型 τ ∈ {positive, negative, diagnostic, uncertain, procedural}、证据成熟度 m(继承工件的证据阶梯)、推荐继承动作 α ∈ {reuse, validate, avoid, diagnose, preserve, archive}。
类比:搜索树式系统像「只保留最高分试卷的刷题学生」;PRAXIST 像「建立实验记录本的实验室」——每条记录写明假设、结果、置信度,以及「下一步该拿它怎么办」(继续/停止/验证/探索),失败实验记录「此路不通」的原因,导师组(PI 面板)定期合议把记录归档进不同可信等级的货架(frontier 车道)。
四、问题解法
一代的完整流程(论文图 1)分顶行(局部实验)与底行(全局综合):
4.1 设计分配:DIG 门 + QD 量化多样性
- 深度创新门(DIG):写码之前的预工件契约。peer 必须检视继承状态、识别可测试机制、固定预期干预。契约锁定:机制族、干预面、扩展的父系 lineage、支持或削弱它的证据签名、使结果可解释的验证/消融钩子、会使测试失效的禁止变更。DIG 只读不跑——目的是让后续 finding 提取能把「预期实验」与工件「观测行为」对比。
- 量化多样性(QD):队列级分配规则。每个契约占据行为空间 C 的一个设计单元 c = (机制族, 干预面, 意图),QD 把 C 个 peer 撒到不同单元而非挤在当前看起来最好的方向。首代用带硬上限的贪心分配器,后续世代 Chair 在同上限下软规划。一代之内可同时分配 peer 去:开发已确认方向、验证脆弱候选、诊断失败模式、探索新机制族。
4.2 peer 构建与外部评估
Peer 是拥有单一契约的自主实验工人:写码、跑实验、内部迭代直到工件可报告。C 个 peer 并发运行,只通过发布的证据协调、绝不直接编辑共享状态。工件由任务的外部评估器打分(任务自身指标,绝非 Agent 自评),返回任务结果 + 有效性状态 + 证据阶梯:smoke(廉价健全性检查)→ scout(部分探查)→ complete(完整评分及复现)——不同任务可自定义中间档名(火箭用 canary/development/complete,交易用三级复现档)。证据阶梯与分数刻意分离:只在初步阶段拿到的高分视为不成熟,不得在晋升时挤出完整证据。
4.3 类型化发现提取与 PI 面板综合
INTERPRET 算子把(工件、结果、契约)转成一条或多条锚定工件的 claim。失败是一等证据:negative finding(被削弱的假设/干预)与 diagnostic finding(约束、失败模式、无效条件)被继承为约束,让后代「继承失败」而非独立重新发现它——这把语言 Agent 的轮内言语反思泛化为跨世代继承。随后 PI 面板(Builder 组装最强证据主线 / Skeptic 审计无支撑或脆弱主张 / Portfolio 平衡方法族间的投入;高风险模式加 External-validity 检查可复现性与证据边界)独立出备忘录、匿名互审,Chair 仲裁合成下一代 agenda:给每个方向判 continue / stop / validate / explore,并为每个 peer 附上角色、假设、成功信号与禁止动作的契约。
4.4 四车道 frontier、Gems 与 lineage
- frontier 晋升:四车道 F = F_cf ∪ F_cd ∪ F_dg ∪ F_vl——confirmed(成熟到可当父代或约束)、candidate(有前景但不成熟)、diagnostic(塑造探索的失败/对照/失败模式)、validation(待复现/消融/核查)。车道是任务可自定义的(交易战役用 confirmed alpha / alpha 孵化器 / benchmark 下限 / 诊断对照)。晋升规则把不成熟证据挡在门外。
- Gems 记忆压缩(默认关闭):每 ρ 代把平衡后的 frontier 蒸馏成少量持久教训——已验证机制、被拒假设、复发失败模式、程序性约束——在重置边界后存续(交易战役每 6 代压缩、最多 4 个活跃 Gem)。
- lineage 轨迹:运行中持续追加(而非事后重建)的类型化事件记录——工件、发现、综合决策、议程、记忆更新,及 derived-from / supports / challenges / updates 等类型化关系,物化为共享标识符的多本相关联账本。执行期间 lineage 决定后代继承什么;执行之后它是研究轨迹的结构化账目——与最终工件一起构成「解答谱系」这第二交付物。
最终输出 a* = argmax SCORE(art(F_cf)):默认从 confirmed 车道选最佳——且论文诚实标注:火箭与交易案例的报道工件是赛后从 confirmed 车道之外选取的,并明说选取规则。
五、评估指标与实验证据
评估两段式:MLE-bench 标准对比(唯一可做跨系统直接对比的设置:同任务、同数据、同奖牌阈值)+ 四个开放域案例研究(各自领域原生评估器,非标准化对比)。
MLE-bench(75 题):PRAXIST 用 deepseek-v4-pro(1M 上下文),Claude Code 基线用 Opus 4.8(最大思考预算、同 H100 池、每任务 24/36 小时墙钟)。
| 系统 | 基座模型 | Low(22) | Med(38) | High(15) | 总奖牌 | 金/银/铜 | 花费 |
|---|---|---|---|---|---|---|---|
| Claude Code | Opus 4.8 | 81.8% | 76.3% | 53.3% | 55(73.3%) | 34/16/5 | $38,370 |
| PRAXIST | deepseek-v4-pro | 90.9% | 81.6% | 60.0% | 60(80.0%) | 49/10/1 | $3,054 |
每层皆优、金 NUM 更高(Low 层 20 枚奖牌中 19 金),花费约 1/12。诚实到罕见的细节:发布账本对 75 题逐题做了完整性裁决——污染 lineage 的尝试被彻底排除(跨战役共拒 90,423 次尝试),9 个任务的整个 lineage 被替换为清洁 actor 的提交(其中 4 题奖牌因此降低)。逐题对比的坦白:70 个双方均计分任务中,基线原始分赢 36 个、PRAXIST 赢 33 个(1 平)——PRAXIST 的优势在奖牌等级(阈值跨越)而非逐题分数;基线在图像隐写、Notebook 单元排序、IceCube 重建等计算密集型任务上保持银牌优势。
火箭着陆案例:冻结的 Swordfish C05 六自由度刚体植物(2,000m 起始、29,200kg、RK4 0.1s 步进),只许改控制器。三个固定初始态库共 12,288 条轨迹:起始工件 4.03%;自主代码优化器 Weco(AIDE 树搜索)793 次评估、$1,009.66 达 17.12%;**PRAXIST 12 代×16 peers、697 次评估、$196.05 达 12,288/12,288(100%)。赛后全库审计每库 40,959/40,959/40,960 成功(仅有的 2 次失败都在初始半径 [0,450)m 桶、只违反横向速度合取项)。发现的控制器全程确定性、无任何神经网络**:滚动 ZEM/ZEV 制导 + 燃料承诺调节器 + 相位守卫 + 终端下降走廊 + 几何姿态控制 + 第 11 代新贡献的闭式箱约束分配器(枚举裁剪 KKT 候选取最小代价可行点,把俯仰/偏航扭矩需求在万向节与栅格翼间分配)。增益沿父链累积而非一步到位:燃料承诺调节器→P0 姿态权限→初始半径分支,第 9 代已达 100%,分配器是锦上添花(单键消融证明它改善 P95 但不导致成功增益——增益属于整个累积 lineage)。逆向指标也如实保留(万向节总变差 +80.43%)。
量化交易案例:100 股美国多板块宇宙的日度配置,walk-forward 28 个季度(每季前推 36 个月训练、留 5 个交易日间隔、结构上因果)。发现工件:LSTM actor-critic + PPO + 有界 replay + 确定性执行适配器(top-k/现金/集中度/流动性/换手约束)。53% CAGR vs 配对等权基线 23%(2.3 倍),28 季 26 正,逐年全胜基线;训练外 2026 验证(1/2–5/21)21.85%;加 50bp 成本仍正。诚实边界:该工件是赛后按报道指标选取的全战役最高 CAGR,未通过战役自身的清洁晋升门(单种子一级证据 + 三项硬约束违反,战役自身的 confirmed 最佳是另一个五种子干净的低 CAGR 注意力策略);修复步骤未达自己的预注册成功信号。
SLAM 案例:在 FAST-LIVO2(LiDAR-惯性-视觉里程计 SOTA)上发现 COVSCHED——把稀疏直接视觉更新从「无条件步骤」变为「按边际价值分配的资源」:帧级调度器以 LiDAR 平移可观测度 o_min 为键(高 o_min=视觉边际价值低→跳过,nya_03 上高 o_min 帧跳 74.9% vs 低 o_min 帧 0.3%,硬上限连续跳 3 帧防饿死)+ 去重地图准入(0.08m 同体素且法向偏差 <15° 判为重观测)。14 条 NTU-VIRAL 序列:评估器记录的视觉路径处理时间平均降 72.4%(每条都降,43.2%–81.6%)。最诚实的一段:两臂位姿时间戳约定不同(测量时间 vs 墙钟),APE 差异主要由时间戳混淆主导——同一规则重关联后平均相对 APE 变化仅 −0.09%——所以论文拒绝报告 45% 的原始精度提升,只主张弱得多的命题:「大幅减少视觉计算不损失轨迹精度」,并列出缺失的因子实验。
聚变控制案例:FreeGSNKE 自由边界 Grad-Shafranov 求解器包装的 MAST-U 型托卡马克磁控(0.5ms 步、12 线圈电压、9 个目标、硬物理违例即终止)。合成的控制律在聚合生存率与公共时程跟踪误差上超过任务原生基线(基于 MAST-U 部署的等离子体控制系统),但基线在原始全时程指标与完成率上仍占优——混合结果照报。
为什么实验设计能证明论点:核心主张是「证据继承让固定预算内更靠近奖牌阈值」。MLE-bench 同 grading harness、同硬件池、本地对照;完整性裁决排除污染(防止虚高);逐题坦白(承认原始分不占优、优势在阈值跨越——这恰与「frontier 保留强父代+安排额外尝试跨越阈值」的机制预测一致)。案例研究每个都区分「主张了什么/没主张什么」,SLAM 的时间戳混淆自曝是方法论自觉的范本。
六、效果优势的根源解释
搜索树式系统的根本局限:工件级组合带来两个不可逾越的障碍——(1) 过早剪枝:机制的效用可能只有通过组合才显现,但工件级搜索在单工件分数低时就把它剪掉,组合可能性随之消失;(2) 未类型化继承:经验以分数排名的工件集合存储,后代继承的是「一个对象」而非「什么可信、什么该做什么」——同一失败模式被不同分支反复撞上。
因果链:PRAXIST 把结果解读为类型化 findings → negative/diagnostic 变成可继承约束(α=avoid/diagnose)→ 后代不再重学失败(消解障碍 2);QD 把每代 peer 撒到不同设计单元 → 一代同时测试多假设 → 未验证机制的组合空间保持开放(消解障碍 1);证据阶梯使 smoke 高分不能挤出 complete 证据 → 晋升的父代可信 → 金牌率随世代累积;DIG 契约使 finding 提取能对照「预期 vs 观测」→ 结果可归因到设计元素 → 增益可追溯到 lineage 中的具体节点。成本优势的结构性来源:deepseek-v4-pro(1M 上下文)单价远低于 Opus 4.8,这是 1/12 成本差的主因——但金牌数同时更高说明方法本身有效(便宜模型+更好的状态组织 > 贵模型+无类型继承)。
反事实推理:若去掉类型化(退回分数排名),失败教训丢失、长战役重复学习;若去掉 QD,每代挤在同一方向、机制组合空间塌缩;若去掉证据阶梯,smoke 高分的「假成熟」会污染 confirmed 车道。火箭案例的累积谱系(第 9 代已达 100%、第 11 代分配器只是改善品质指标)是「增益属于 lineage 而非单点」的直接证据。
必须如实指出的边界:单 sweep 无种子方差(作者自己声明奖牌率是单次扫描结果而非重复扫描的分布估计);量化案例的报道工件未过清洁晋升门;SLAM 的精度对比被时间戳混淆主导;聚变是混合结果。这篇论文的力量恰恰在于:它把「没证明什么」写得和「证明了什么」一样清楚。
七、必要知识反推
领域知识层:(1) 机器学习工程竞赛的完整技能面(Kaggle 型任务的数据处理-建模-调参-提交链)与 MLE-bench 的评分机制;(2) 四个案例域的专门知识——火箭终端制导(ZEM/ZEV、万向节/栅格翼/RCS 执行器配置)、量化交易(walk-forward、执行成本、约束配置)、LIVO 里程计(ESIKF、可观测性)、托卡马克磁控(Grad-Shafranov、垂直位移不稳定性)——每个案例都需要足够的域知识来定义「机制族/干预面」;(3) 装配理论——继承原语的理论框架。
方法论知识层:(1) 质量-多样性搜索——把 MAP-Elites 类思想从工件空间搬到设计空间的迁移能力;(2) 溯源系统与 ML 实验跟踪模型(实体-活动-派生结果);(3) 多智能体角色分工(Builder/Skeptic/Portfolio 的研究治理映射);(4) 证据分级的实验方法论(smoke/scout/complete 与复现档);(5) 预注册思想(契约先行、成功信号预定义、SLAM 的「不主张未记录的统计量」)。
工程知识层:(1) 大规模并行实验的资源调度(单 GPU 作业、8 并发在飞、墙钟封顶的 pacing);(2) 账本级 lineage 实现(共享标识符的边表/工件索引/事件轨迹);(3) 完整性裁决流水线(SHA-256 对账本验证、污染 lineage 排除);(4) 成本核算(美元等价账本、汇率换算的出处)。
知识融合的关键节点:第一个化学反应在「装配理论 × Agent 状态管理」——把一个复杂科学理论(对象由形成历史与选择刻画)压缩成一个工程接口(类型化 findings + 车道 + 继承动作),理论变成 schema。第二个节点是「PI 治理结构 × LLM 面板」——学术实验室的治理分工(一线研究员/审稿怀疑者/项目平衡者/仲裁者)被映射为 LLM 角色,使「证据综合」有了组织学结构。第三个节点是「诚实报告作为系统属性」——证据契约(不主张未记录的统计量、时间戳混淆自曝、清洁晋升门)不是美德装饰,而是继承系统的正确性前提:错误证据一旦被继承会被放大。
八、论文中可以提取的通用性灵感
1. 经验必须被类型化才能被继承。核心思想:原始日志与标量分数不是可复用知识;在被允许影响未来之前,每条经验需要「类型(正/负/诊断)+ 成熟度 + 继承动作」三标签。论文证据:60 枚奖牌 vs 55 枚的同时金牌 49 vs 34;逐题分数不占优但阈值跨越占优——类型化继承让「强父代+额外尝试」持续跨越阈值。推广场景:个人知识管理(失败笔记带「为何失败/以后怎么办」标签)、企业事故复盘系统、自动化测试的失败分类库、科研组会的发现台账。
2. 失败是一等证据,应被继承为约束而非丢弃。核心思想:失败工件揭示的无效假设、评估器约束、脆弱分数,编码后让后代「继承失败」——把错误变成边界条件。论文证据:negative/diagnostic findings 进入 diagnostic 车道塑造探索;跨战役 90,423 次污染尝试被排除并转化为完整性裁决规则。推广场景:工艺路线的禁行条件库、药物研发的阴性结果登记、编译器优化 pass 的反回归清单、安全审计的攻击面记录。
3. 证据成熟度必须与分数分离。核心思想:只在初步阶段验证过的高分是「假成熟」;证据阶梯防止它挤出完整证据、占据父代位。论文证据:smoke/scout/complete 阶梯 + 晋升门挡不成熟证据;量化案例中单种子高 CAGR 工件被正确留在孵化车道而非 confirmed。推广场景:论文评审的证据等级(预印本 vs 同行评审 vs 复现)、招聘的面试信号强度分级、风控的尽调深度分级、自动化实验的早停 vs 全量验证。
4. 多样性应是设计空间的显式坐标,而非随机扰动。核心思想:把「探索不同的方向」量化为(机制族×干预面×意图)的单元配额,一代同时测试多假设。论文证据:QD 硬上限让 16 个 peers 覆盖开发/验证/诊断/探索四焦点;火箭 lineage 显示多机制分支在第 9 代会师 100%。推广场景:研发组合管理的技术路线图单元、投资组合的赛道分散、内容平台的选题多样性、人才团队的技能矩阵配置。
5. 每个增益应附带可审计的形成谱系。核心思想:交付物不止是最终工件,还有「怎么得到的」结构化账目——支持它的证据、约束它的失败、待验证的候选。论文证据:lineage 是第二交付物;火箭增益归因到累积父链而非单点;SLAM 拒绝报告时间戳混淆的 45% 提升。推广场景:AI 生成内容的溯源标签、企业决策的依据链记录、监管科技的模型可解释性要求、学术 reproducibility 包。
6. 「主张什么」与「不主张什么」同样重要。核心思想:报告的边界(混淆变量、未做的因子实验、未过晋升门的工件)是结论可信度的组成部分;过度声明会污染下游继承。论文证据:四个案例全部明示边界——量化工件的选取规则、SLAM 的 −0.09% 重关联结果、聚变的混合结果、MLE-bench 单 sweep 性质。推广场景:学术写作的 limitations 节规范化、产品 A/B 测试的效应边界声明、医疗诊断的置信区间沟通、新闻报道的信源分级。
一句话总结:PRAXIST 把自主 R&D 从「刷题式搜索」升级为「实验室式传承」——每条经验带着类型、成熟度与继承指令入库,失败变成约束、多样性变成配额、每次增益附带完整谱系;于是十分之一的价格买到了更多的金牌,以及这门学科一直稀缺的东西:可审计的诚实。