Praxist: From Experimental Artifacts to Solution Lineages 精读
自主 R&D Agent 已经会写代码、跑实验、改工件,但多数系统把每次尝试当作近乎独立的事件——日志记下了「发生了什么」,却没建立「哪个设计元素带来了提升、证据是否经受住验证、如何与其他元素重组」。长周期研究于是反复重学同样的教训。Sapient Intelligence 联合南洋理工、清华、CMU、UPenn 的 PRAXIST 提出「证据继承」:把可复现工件与评估结果转化为类型化的发现(正/负/诊断/不确定/程序性)、四车道 frontier(confirmed/candidate/diagnostic/validation)与世代议程,失败与诊断成为一等证据。MLE-bench 全 75 题拿下 60 枚奖牌(49 金),花费 3,054 美元——约为 Claude Code+Opus 4.8 基线(38,370 美元、55 枚、34 金)的十二分之一;火箭着陆案例从 4.03% 起步做到 12,288/12,288 满分。