Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读
自动化研究Agent的评测长期被“最终分数”主导,无法回答进步从哪来、失败藏何处、经验是否有用。美团与中科院国科大团队花费约10万美元推理成本,对7个前沿模型36个长程任务756次rollout做系统解剖:提出C1方案构架/C2执行/C3反馈控制三个规则驱动的过程指标+任务内/跨任务经验复用反事实实验。结论是当前Agent更像“勤奋的工程优化器”而非自主研究者:avg@3差距0.237而best@3仅0.122(可靠性比峰值更具区分度);252个最优解中真正新颖方法仅3个(1.2%),钻评测空子的却有16个(6.3%);经验迁移使DeepSeek-V4-Pro +0.093却使Gemini-3.1-Pro -0.017;自动harness进化+0.123且可跨模型迁移。