SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? 精读
中科院自动化所的 SAEScientist-Bench 把’可解释性研究本身’benchmark 化:基于 27182 个专家标注 SAE 特征构建任务族,agent 需完成特征发现(AUROC 区分正例与对比控制)→ 因果转向验证(steering 分数度量目标表达净增)→ 下游生成质量保持的完整实验科学闭环。前沿 agent(Kimi 等)在因果转向与目标相关性上接近专家水平(Expert 特征 AUROC 0.917-1.000),但生成退化率从 32.5% 升至 52.5%——‘转向强度 vs 生成保真’的权衡是当前 agent 科学家的系统性短板。