可再生谜题与自适应出题:Codoku × SecProbe 的评估方法学双星
基准评估在 agent 时代有两大顽疾:题目会泄(污染与作弊),题目会旧(饱和与低效)。本精读的两篇论文各治一病——
论文一:Codoku: Renewable Program-Reasoning Challenges for Frontier Coding Agents (arXiv 2609.34661) 机构:ETH Zurich(4 人,含 Zhendong Su)。其依赖的 semantic reification 范式正出自同在 ETH Zurich 的 Zhendong Su 团队 PLDI'26 论文(Chopra, Li, Sotiropoulos, Su)——该工作为 C 编译器随机程序生成开辟了「按语义造程序」的新范式,其实现 Reify 五个月在 GCC/LLVM 挖出 59 个 bug(36 个错译 bug)。Codoku 是把编译器测试的合成技术反手用于 LLM 评估——工具链自带方法学背书,这是单机构小团队也能做出顶级基准的典范路径。
论文二:SecProbe: Adaptive Evaluation of Coding Agents on Cybersecurity Vulnerabilities (arXiv 2609.33763) 机构(8 家,逐一标注):
- University of Notre Dame(第一单位;一作与 Bake AI双 affiliation。注意:Notre Dame 也是 IRT 自适应 LLM 评测框架 ATLAS 的老家——心理测量学评测是有院系传承的)
- Bake AI(企业方,一作双 affiliation 所在;任务合成管线的工程侧)
- Vanderbilt University
- University of Pennsylvania
- LMU Munich(慕尼黑大学)
- University of Washington
- Stanford University
- Inria(法国国家信息与自动化研究所) 典型的「高校为主 + 一家企业」多机构协作,横跨美欧两洲——安全评测要同时吃透漏洞学(CWE 体系)、心理测量学(IRT)与 agent 工程,没有哪家单一实验室全能覆盖。
两篇合读的张力在于:Codoku 相信「只要题目造得对,出一份就够了」——把不可执行、不可背、可再生刻进题目结构里;SecProbe 相信「题目永远不够对」——让题库跟着被测能力一起演化。一个从供给侧把单题做到免疫,一个从配给侧让每题物尽其用,拼在一起才是「评估方法学」的完整答案。
一、背景:四个概念,从「是什么」讲起
执行捷径(execution shortcut):给模型一段完整程序、问「输入是什么/输出是什么」——这类执行预测任务本意是考程序推理,但当 agent 配上代码执行器,它直接把程序跑一遍读答案即可。题目从「考推理」塌缩成「考会不会调工具」。CruxEval 是这类基准的代表(800 个 Python 函数 × 输入/输出两个方向共 1600 题)。
基准污染(contamination):训练语料见过题目,高分反映记忆而非能力。污染与执行捷径常常联手:静态基准的题目是固定集合,发布即开始泄漏,越流行泄漏越快。
IRT 项目反应理论(Item Response Theory):心理测量学框架,把「某考生答对某题的概率」建模为考生能力 θ 与题目难度 β、题目区分度 α 的函数。双参数 logistic 模型(2PL)下,P(答对) = σ(α·(θ−β)):能力超出难度越多越可能答对,α 决定这条曲线有多陡——区分度高的题能把能力相近的考生拉开。
自适应测试(Computerized Adaptive Testing):既然每道题只在 θ≈β 附近最有区分力,那就每答一题更新一次 θ 估计,下一题专挑对当前估计信息量最大的题(Fisher 信息最大化)。教育测评(GRE/GMAT 的机考自适应)用了几十年的技术,2025–2026 年被系统性搬进 LLM 评测:AllenAI 的 Fluid Benchmarking 在 MMLU 上以 50 倍更少的题目取得更高效度;Notre Dame 的 ATLAS 用 Fisher 信息选题省下 90% 题量;Stanford CRFM 把 Rasch 自适应测试集成进 HELM。IRT 自适应评测已经是成形谱系,不是某篇论文的孤勇。
在这个背景下看两篇论文的病灶判断:静态程序推理基准死于执行捷径+污染(Codoku 的靶子),静态安全基准死于饱和+低效(SecProbe 的靶子——CyberGym Level 1 榜单从 2025 年 5 月的 17.9% 一年内被爬到 85%+,静态基准的可见寿命已经以月计)。
二、论文定位与关联工作
Codoku:程序推理基准的「不可执行化」转向
| 基准 | 任务形态 | 失效模式 | Codoku 的差异 |
|---|---|---|---|
| CruxEval | 完整程序 + 输入/输出预测 | 程序可执行,agent 直接跑 | 谜题是部分程序,不编译、不可执行 |
| CodeARC | PBE(程序ByExample)合成 | 差分测试 checker 只能近似判对(57.4–72.6%) | 解对照显式全局约束 Φ 验证,精确判定 |
| CodeMind / CES 等 | 输入输出/中间状态预测 | 同样依赖完整可运行程序 | 掩码程序天然免疫执行捷径 |
| 各静态代码基准 | 固定题目集 | 发布即开始污染 | witness 从零合成,独立于任何现存程序,可再生 |
两个「首个」级别的声明:首个把 semantic reification 用于基准构造(此前只用于编译器测试),首个以全局约束而非参考答案为判据的程序推理谜题——不对照唯一标准解,接受任意满足 Φ 的填充。
SecProbe:安全基准的「自适应+按需合成」转向
| 基准 | 规模 | CWE 覆盖 | 难度控制 | 按需合成 |
|---|---|---|---|---|
| CyberGym | 1,507 实例 / 188 项目(OSS-Fuzz 真实漏洞) | 88 | L0–L3 信息级别(给多少提示,非能力难度) | ✗ |
| CVE-Factory | 工厂式合成 CVE 任务 | 74 | ✗ | 部分 |
| SecProbe | 353 任务 / 6 语言 | 151 | 12 维难度向量 h | ✓ IRT 信息缺口驱动 |
与 IRT 评测谱系(Fluid/ATLAS/CRFM)的关系是从「选题」到「造题」的升级:前者的自适应只能在既有题库里挑,SecProbe 的 information-gap 分数直接驱动五专家 agent 管线合成落在信息缺口上的新题——题库从有穷集合变成能力分布的函数。
三、问题定义
Codoku:构造满足三性质的程序推理基准——(1) 可再生:源源不断造新题,免疫污染;(2) 执行捷径免疫:agent 的执行器/调试器/穷举工具全部失效;(3) 验证精确:判定解是否有效不依赖近似 checker,也不依赖唯一参考解。谜题定义为:对从零合成的 witness 程序,掩码 ID/CONST/OP/FUNC/CTRL/LABEL 六类单元格,要求填充还原出一个满足全局约束 Φ 的程序。
SecProbe:在给定评估预算内尽可能精确地估计 agent 的安全能力 θ。两个子问题:(1) 选哪些题——用 2PL 拟合 θ/β/α 后,如何定位「当前信息量最大的下一题」;(2) 题库不够怎么办——当选题空间耗尽或缺口在题库之外时,如何按需合成落在缺口上的仓库级漏洞修复任务(含漏洞注入、利用测试、参考补丁、确定性验证门),且难度可通过 12 维向量 h 定向控制。
四、解法
Codoku:witness 从零合成 + 全局约束验证
三步构造:
- Witness 合成:基于 semantic reification,对任意指定 CFG 与执行路径、IO,从零构造一个保证语义正确的程序——它在给定输入下确定性地走指定路径、产出指定输出(PLDI'26 已验证该构造的可扩展性,支持无界循环与不可归约区域)。合成独立于任何现存代码,天然零污染。
- 掩码成谜:按难度预算挖掉六类单元格(标识符/常量/运算符/函数调用/控制流/标签),small/medium/large 三档的复杂度从 typed cells 58.5→366.5、log₁₀ 搜索空间 72.0→540.0、代码行 38.9→133.5、重复块占比 20%→53%。
- 全局约束 Φ 验证:填充不对照 witness,而是验证五项全局性质——结构保持、常量表预算、CFG 同构、精确执行路径、输出(5 秒时限)。常量表预算是反独立满足的关键:每个单元格单独看都有「局部合理」的填法,但预算封顶迫使单元格之间必须共享常量——你不能独立地凑出各格,必须整体推理。远离执行路径的单元格间全局耦合,使局部合理的选择往往要数轮迭代后才暴露违约。
SecProbe:2PL IRT + information-gap + 五专家合成管线
闭环四步:
- 校准:观测各 agent 在既有任务上的结果,贝叶斯拟合 2PL——每任务得 β/α,每 agent 得能力 θ。
- 定位缺口:计算 information-gap 分数 G_t(θ),找出「agent 能力密集但现有题目信息不足」的难度区域——这些区域每道新题的 Fisher 信息最大。
- 按需合成:从缺口区域选题;题库无合适题时,驱动五专家 agent 管线——Online Security Researcher → Task Architect → Exploit Test Strategist → Repository Engineer → Security Reviewer——按目标 CWE 类 + 软件上下文 + 12 维难度控制向量 h 合成仓库级漏洞修复任务,附漏洞注入、利用测试、参考补丁与确定性验证门(专家评审总评 4.40/5、接受率 92%)。
- 更新再循环:新题作答结果回填 IRT 模型,θ 与题库共同演化——评估本身成了一个在线学习系统。
五、评估证据
Codoku:小谜题照样难倒最强模型
- 执行捷径实证:GLM 5.2(OpenCode harness)5 分钟内解光 CruxEval 全部 1600 题;同预算下 Codoku large 最强模型仅 54%(GPT 5.6 Sol 54% / Claude Opus 5 50%,开源三模型 11–22%)。
- 规模仍未通关:5 模型均值 56%(small)→39%(medium)→30%(large);small 档平均不足 40 行代码,最强模型也漏 23%+;总体解决率 Claude Opus 5 63%、GPT 5.6 Sol 58%、开源 28–30%。
- 差距随规模拉大:专有/开源差距 small 26pp → large 37pp——推理能力差距在更难谜题下放大,而非收敛。
- 预算不敏感:GPT 5.6 Sol 在 large 档把预算加倍,也仅多解 8 题——瓶颈是推理而非资源。
- 策略标注:Direct 策略占比 ≤5%(单元格强耦合迫使真推理),Algebra 策略 14–67%。
- 解之稀疏:对一道谜题尝试的 16,200 个填充中仅 6 个有效。
SecProbe:最强 28.33%,同精度省近三成题
- 规模与覆盖:353 任务、6 语言、151 个 CWE 类型(对比 CyberGym 88 / CVE-Factory 74);9 前沿模型 × 2 harness。
- 模型表现:严格 pass rate(满分 100 才算过)最高 GLM-5.3 + TERMINUS-2 仅 28.33%(MINI-SWE-AGENT 26.91%;GPT-5.6-Sol 26.06%/25.21%);最弱 GPT-5.4-mini / Mistral Small <12%;mean grader score 区间 50.87–76.43(Kimi K3 最高 76.43),漏洞种子均值 44.5。
- 自适应效率:达到同等信息精度(eG_t≤0.30),自适应合成仅需 244 任务 vs 随机合成 346(省 29.5%)vs one-shot 合成 328(省 25.6%)。
- held-out 泛化:对未参与校准的模型估计能力,自适应 140 任务即达 RMSE≤0.15(随机 181、固定顺序 194);100/200 任务预算下 RMSE 0.180/0.110,均低于基线 0.240/0.140。
- 难度可控:Easy→Hard 任务 pass rate 44.0%→13.3%,83.3% 难度三元组符合预期排序;IRT 规格稳健(Rasch/分层 2PL 与 2PL 的秩相关 0.96/0.98)。
关键数字汇总
| 论文 | 证据 | 数字 |
|---|---|---|
| Codoku | 执行捷径 | GLM 5.2 五分钟清空 CruxEval 1600 题 |
| Codoku | large 最强 | 54%(开源 11–22%) |
| Codoku | small 仍难 | <40 行,最强漏 23%+;Direct 策略 ≤5% |
| Codoku | 解稀疏 | 16,200 填充仅 6 有效;预算加倍仅 +8 题 |
| SecProbe | 覆盖 | 353 任务 / 151 CWE(vs 88 / 74) |
| SecProbe | 最强 pass | GLM-5.3 28.33% |
| SecProbe | 效率 | 同精度 244 vs 346 任务(省 29.5%) |
| SecProbe | held-out | RMSE 0.110 vs 0.140(200 任务) |
六、根源解释:为什么各自有效
Codoku:为什么执行、调试、穷举三路全断
- 执行无门:谜题是部分程序,不编译、不可运行——「跑一下看结果」在物理上不可能。执行器从「作弊工具」降格为「无关工具」。
- 调试无门:调试依赖「改动→运行→读反馈」的闭环,闭环的第一环就断了。
- 穷举无门:解稀疏分布在 10⁷²–10⁵⁴⁰ 的填充空间里(16,200 个尝试仅 6 个有效);更狠的是常量表预算——它让每个单元格不存在独立的正确答案,正确性只在整组单元格的联合选择中成立,局部贪心必然在数轮迭代后撞上 Φ 的违约。这就是 Direct 策略 ≤5% 的机制根源。
- 可再生零污染:witness 由 CFG+路径+IO 从零合成,与任何现存程序无关——没有可泄漏的「原题」,生成器本身就是题库的无限后援。
- 验证精确:Φ 是显式可检查的全局性质(5 秒时限内确定性判定),不像 CodeARC 的差分测试只能近似——判定标准本身就是基准的一部分。
方法学根基值得一提:semantic reification 不是为本文临时发明的轮子,而是 PLDI'26 上已用 59 个 GCC/LLVM bug 验证过的成熟范式——把编译器测试的合成学反哺 LLM 评估,一次技术迁移,两篇顶会级工作。
SecProbe:为什么 Fisher 信息最大化省任务
2PL 下每道题的 Fisher 信息在 θ≈β 处最大、α 越大越尖。随机或固定顺序出题时,大量任务落在 θ 远离 β 的区域——agent 全对或全错,答完几乎不更新对 θ 的认识,信息量趋零。information-gap 分数 G_t(θ) 把每道新题定向到「agent 密集且现有信息不足」的区域,每题都打在区分度曲线的陡坡上——同等估计精度所需任务自然减少约三成。这与 Fluid Benchmarking(MMLU 省 50 倍题量)、ATLAS(省 90%)是同一个数学机制,外部证据充分。
SecProbe 的真正新意是合成的条件化:既有 IRT 评测只能在题库里挑,SecProbe 在缺口处「造」——12 维难度向量 h 经验证单调可控(漏洞复杂度维度效应最大,−13.3 pass pt;83.3% 三元组符合预期),意味着出题者能定向命中目标难度带。题库从静态资产变成与被测能力共同演化的动态系统,这正是静态安全基准(CyberGym 榜单一年被爬到 85%+)寿命焦虑的制度化解法。
七、知识反推:从两篇论文倒推评估领域的公共知识
- 执行能力已杀死执行预测类基准。GLM 5.2 五分钟清空 CruxEval 不是孤例而是普遍现状——任何「可运行即可解」的题目,在配执行器的 agent 面前测的都是工具编排。程序推理评测的下一站是不可执行化:掩码、约束化、部分程序。
- 基准的贡献单位正在从「数据集」变成「生成器」。两篇论文的核心产出都不是题目集合,而是合成器+约束系统+校准机制。数据集会饱和会污染,生成器可以随对手演化——这是对「基准即论文附件」传统范式的结构性替换。
- 心理测量学正式进入 agent 评测工具箱。θ/β/α、Fisher 信息、自适应选题在 2025–2026 已成谱系(Fluid/ATLAS/CRFM/SecProbe)。「给所有模型同一套卷子」正在被「因材施考、按需出卷」替代——SecProbe 进一步把「出卷」也自动化了。
- 安全评测的瓶颈从覆盖转向校准与可持续。151 CWE 的覆盖固然领先(CyberGym 88/CVE-Factory 74),但更关键的是难度可控与按需补给——静态安全基准的市场寿命已经以月计。
- 「饱和」是静态基准的假象。换一种考法,最强模型立刻回到 30–50% 区间(Codoku large 54%、SecProbe 28.33%)——前沿能力的真实边界远未到达,到达的是题目的边界。
八、通用灵感:跳出论文能带走什么
- 防作弊的最优解不是严防死守,而是改题型结构。当「作弊工具」与「答题工具」是同一个东西(执行器)时,唯一根治是把可执行性从题目里拿掉。适用于一切「工具让考题失效」的场景:考记忆就开卷,考检索就断网。
- 验证解,而非记住解。Codoku 不对照唯一标准答案,而验证全局约束 Φ、接受任意有效填充——解空间开放,背题彻底失效。这是「验证式出题」的通用范式:把「对答案」升级为「验性质」。
- 从零合成 = 零污染面。任何需要源源不断新题的场景(面试题、习题、红队用例),合成优于采集:采集必有泄漏风险,合成只在需要时发生。
- 把测量预算花在信息最陡的地方。Fisher 信息选题的本质是「每一步都选对当前估计扰动最大的观测」——同样的思想适用于用户调研、A/B 测试、主动学习:先估后选,永远打在最陡坡上。
- 难度可控是合成系统的成人礼。能生成只是及格,能按指定参数生成(12 维向量、83.3% 单调命中)才能支撑定向测量与定向训练——「可控性验证」应当成为一切生成式基准的标配实验。
- 给基准设计完整生命周期。出生(合成)→ 校准(IRT 标定)→ 投放(自适应选题)→ 补给(缺口驱动合成)→ 退役(信息量枯竭)。把基准当产品运营,而非一次性论文素材——静态基准的寿命已经短于一篇论文的审稿周期。
一句话总结:Codoku 证明把「语义具体化」的合成学用到极致,一道题可以同时免疫污染、免疫执行、免疫穷举——不足 40 行的小谜题就能让最强模型漏 23%+;SecProbe 证明把心理测量学的自适应测试搬到 agent 安全评测,题库可以与被测能力共同演化——同精度省近三成任务、151 CWE 覆盖翻倍于前人。前者把单题做到无懈可击,后者把整个题库变成活的——评估方法学的下一步,是让这两件事发生在同一套系统里。