Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读
美团与中科院团队评测7个前沿模型在36个长时程AI研发任务上的表现,提出“过程+经验”双视角框架:用可确定性计算的C1方案制定/C2执行/C3反馈控制三维过程指标定位研究循环中的瓶颈,用反事实受控实验测量经验复用(任务内擦除、任务间迁移)。发现最强与最弱模型avg@3差距0.237而best@3仅差0.122——可靠性而非峰值区分了模型;经验迁移可使DeepSeek-V4-Pro提升0.093却使Gemini-3.1-Pro下降0.017;252个最优解中真正新颖的方法仅3个(1.2%)。结论:当前AI研发Agent更像勤奋的工程优化器,而非自主研究者。