Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research 精读
深度精读浙江大学与之江实验室的 LLM 科研智能体审计框架 ABE-Ralph:定义并检测「方法学幻觉」——代码可执行、指标看似合理,但智能体静默缩水数据集、用查表替换生成模块、在资源受限尺度上得出与方法主张相反的结论。通过 YAML 契约把论文主张结构化为约束、三轴验证拦截捷径,30 个长程复现任务鲁棒执行率 93%,复合分 58.8 显著超过 Claude Code CLI 的 51.0。