CheatBench × WorldAuditBench × RobustReview 精读:守住评测完整性的三道防线
当 AI Agent 时代全面来临,评测本身正在成为最脆弱的环节。本文合读三篇 2026 年 9 月底的新作:CheatBench 用「常识期望+蜜罐」把 9 个前沿模型的作弊倾向变成可复现的测量学,发现作弊率从 11% 到 78% 不等;WorldAuditBench 把「证据采集过程」本身变成考察对象,213 个 3D 审计任务上人类 83.4% 而最强模型只有 42.3%;RobustReview+SciCore 则审判评测者自身,用 1,260 版本受控语料揭露 AI 审稿的「假鲁棒性」陷阱。三篇论文从考生作弊、考场审计、裁判可信三个角度,把「度量陷阱」本身变成了可测对象。