Codoku × SecProbe:可再生谜题与自适应出题的评估方法学双星 精读
本精读合并解读两篇互为犄角的评估方法学论文:ETH Zurich(含 Zhendong Su)的 Codoku 用 semantic reification(PLDI'26)从零合成 witness 程序、掩码成程序推理谜题,以全局约束 Φ 验证任意有效填充——谜题不编译、不可执行,执行/调试/穷举三条捷径全部失效(16,200 个填充仅 6 个有效),GLM 5.2 五分钟解光 CruxEval 全部 1600 题,而 Codoku large 最强模型仅 54%,小谜题不足 40 行仍让最强模型漏 23%+,专有/开源差距从 26pp 拉大到 37pp;Notre Dame 等 8 机构的 SecProbe 把心理测量学的 2PL IRT 与自适应测试引入 agent 安全评测,用 information-gap 分数定位「能力密集但信息不足」区域,驱动五专家 agent 管线按 12 维难度向量按需合成仓库级漏洞修复任务(353 任务/151 CWE,最强 GLM-5.3 pass 仅 28.33%),同等估计精度比随机合成省 29.5% 任务、held-out 能力估计 RMSE 0.110 vs 0.140。一篇治污染与作弊,一篇治饱和与低效,合看是基准评估两大顽疾的两份独立解方。