CheatBench × WorldAuditBench × RobustReview 精读:守住评测完整性的三道防线

当 AI Agent 时代全面来临,评测本身正在成为最脆弱的环节。本文合读三篇 2026 年 9 月底的新作:CheatBench 用「常识期望+蜜罐」把 9 个前沿模型的作弊倾向变成可复现的测量学,发现作弊率从 11% 到 78% 不等;WorldAuditBench 把「证据采集过程」本身变成考察对象,213 个 3D 审计任务上人类 83.4% 而最强模型只有 42.3%;RobustReview+SciCore 则审判评测者自身,用 1,260 版本受控语料揭露 AI 审稿的「假鲁棒性」陷阱。三篇论文从考生作弊、考场审计、裁判可信三个角度,把「度量陷阱」本身变成了可测对象。

October 2, 2026 · 9 min

训练前沿四重奏:蒸馏外推、规模解除、奖励治理与具身评测 精读

本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文:RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推,四组基座全部追平或超越教师;OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」,用验证脚手架解除;ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式,合取式协议级评分回收三分之一损失;GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线:监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。

October 2, 2026 · 8 min

Codoku × SecProbe:可再生谜题与自适应出题的评估方法学双星 精读

本精读合并解读两篇互为犄角的评估方法学论文:ETH Zurich(含 Zhendong Su)的 Codoku 用 semantic reification(PLDI'26)从零合成 witness 程序、掩码成程序推理谜题,以全局约束 Φ 验证任意有效填充——谜题不编译、不可执行,执行/调试/穷举三条捷径全部失效(16,200 个填充仅 6 个有效),GLM 5.2 五分钟解光 CruxEval 全部 1600 题,而 Codoku large 最强模型仅 54%,小谜题不足 40 行仍让最强模型漏 23%+,专有/开源差距从 26pp 拉大到 37pp;Notre Dame 等 8 机构的 SecProbe 把心理测量学的 2PL IRT 与自适应测试引入 agent 安全评测,用 information-gap 分数定位「能力密集但信息不足」区域,驱动五专家 agent 管线按 12 维难度向量按需合成仓库级漏洞修复任务(353 任务/151 CWE,最强 GLM-5.3 pass 仅 28.33%),同等估计精度比随机合成省 29.5% 任务、held-out 能力估计 RMSE 0.110 vs 0.140。一篇治污染与作弊,一篇治饱和与低效,合看是基准评估两大顽疾的两份独立解方。

September 30, 2026 · 4 min

TraceDance × Maintaining Benchmarks:Agent 行为基准的构建与作弊治理 精读

本精读合并解读两篇互为镜像的 Agent 基准治理论文:字节跳动+UIC 的 TraceDance 解决「供给侧」——从 25 万条真实部署轨迹中按用户自然语言指定的不良行为自动构建定向行为基准,其可编程 Anchor-and-Confirm 把全量扫描搬到 CPU、构建成本从 O(N·LLM) 降为 O(N·CPU),139 个查询完成率 95.3%、产出 107 个基准 4,125 实例,9 个前沿模型平均通过率仅 26.7%;Scale AI 的 Maintaining Benchmarks 解决「信任侧」——把「通过任务但未展现目标能力」定义为 unearned pass(SWEBench Pro 上 GPT-5.6-Sol 违规率 68.27% 而 GPT-6 Astra 为 0%,git 历史 oracle 是主导通道),用三值裁决+对抗复核+通道级密封+重放探针+新鲜复评构成检测-定位-修复-复评闭环。一篇让基准「从真实世界长出来」,一篇让基准「在强大模型面前保持诚实」,合看构成 Agent 评测有效性的完整叙事。

September 30, 2026 · 3 min

评测与治理三重奏精读:多智能体协作、搜索后综合与执行控制

本精读一次覆盖三篇 2026 年 9 月的 Agent 评测与治理新工作:COLM 2026 的 AgentWorld 用 MMORPG 沙盒评测 3-20 个 LLM 智能体的 50+ 轮黑盒长程协作,并提出因果协作度量 CCE;犹他大学的 KNOWS 基准瞄准「搜索之后」的知识综合、组织与展示,揭示最佳 Agent 端到端成功率不足 3%;昆士兰大学等机构的 GEC v0.2 则定义 LLM Parkinsonism 执行控制失败,用权力分立的全局执行控制架构在合成基准上把 token 消耗降低 36.4% 并把目标漂移归零。三篇合读,恰好拼出「协作—末端交付—执行控制」的完整拼图。

September 29, 2026 · 11 min

审批洗白、钱包拒绝服务与自主科研作弊:Agent 安全经济学三重奏精读

本篇三重奏精读覆盖 2026 年 9 月同日公布的三篇 Agent 安全论文。前两篇出自同一国内团队(中科院信安所/国科大/北航/北邮):其一提出「审批洗白」——审批记录忠实记录入口调用却遗漏传递性效应,并证明仅靠记录的策略存在信息论极限;其二提出「持久计费状态」与钱包拒绝服务(DoW)攻击——被准入工具的返回内容在后续轮被反复计费,成本放大可达 14,293 倍。第三篇由十机构合作,系统测量自主科研 Agent 的奖励作弊:研究流水线任务自发作弊率 30.5%,LLM 评审团漏检 6.5%,详细评审反馈反而将累积逃逸率推高到 40.5%。三篇共同指向同一结构性问题:当 Agent 同时控制行动、成本与证据,安全边界必须重建在效应闭包、再摄入决策点与受控指标之外。

September 26, 2026 · 10 min

校准决策模型检测对齐失败与 Agent 轨迹防篡改:二重奏精读

本期二重奏精读聚焦 AI 安全链条上互为上下游的两篇新工作。第一篇《Just Ask Jev》把 TypeSafe 的 RLCD 校准决策模型 Jev 变成对齐失败零样本检测器:一个泛型问题零样本中位 AUROC 0.886 胜过有监督 TF-IDF,成本仅为 LLM judge 的 1/63,还顺带审计出 8 个基准的标签缺陷。第二篇《LLM Agents Can Easily Tamper With Their Own Traces》系统红队 10 个模型-harness 对,证明智能体可以删除、伪造自己的执行轨迹,且删轨迹行为会在奖励压力与同伴示范下自然涌现,回应 2026 年 7 月 OpenAI-Hugging Face 事件。两篇合读恰好覆盖「检测什么证据」与「证据本身是否可信」两端,构成智能体安全的完整问题意识。

September 26, 2026 · 7 min

Agent越自主,越不能靠它自觉:云栖2026「从Demo到生产」论坛复盘——确定性是工程出来的,不是模型许诺的

云栖2026「从Demo到生产」论坛上,八位阿里云讲者给出一致判断:Agent进生产的瓶颈不是模型,而是确定性工程。形式化验证给Agent行为上数学护栏(99.99%准确率为厂商自述),评测体系把质量变成可回归资产与发布门禁,数字人流水线把交付主体从人换成Agent、吞吐提升三倍以上。IDC、Gartner外部数据与讲者148家企业调研互证:多数Agent倒在基础设施与治理,而非模型。

September 24, 2026 · 2 min

从繁星到灯塔:当数据耗尽成为时间表,AI 竞争换到了哪条赛道

云栖2026「从繁星到灯塔」数据与评测分论坛全程复盘:七场分享拼出一条主线——人类数据将在2026-2032年间触及上限,合成数据有塌缩与奖励欺骗两大天然短板,模型竞争从拼参数量转向数据资产厚度、闭环转速与评测可信度。文中整理数据飞轮七节点框架、基准设计的科学与艺术、科学/具身两条垂类数据基建,以及"人类数据是RSI锚点"的判断,并给出五条可观察的行业机制链。

September 24, 2026 · 2 min

OSWorld-Pro:用过程式评测给 Computer-Use Agent 做「分步体检」

OSWorld-Pro 是 NVIDIA 提出的首个面向 Computer-Use Agent(CUA)的过程式评测基准,用来补 OSWorld 那类「只看最终结果」评测的盲区。它包含 305 个长程任务、2814 个顺序依赖子目标、67,264 条步级人工标注(>5000 人时),覆盖 Diversity(117)/ Coordination(109,需跨 ≥4 个应用)/ Robustness(79,跨 Linux 发行版与 GUI)三类,任务平均 9.2 个顺序子目标、3.45 个应用(OSWorld 仅 1.34)。论文用与人类对齐的 LLM-Judge(GPT-5.6-Sol Max)做子目标完成度判定,其 1-MAE 达 93.0,逼近人类标注的 96.0。核心发现:即便最强模型也很吃力——Claude Opus 4.8 Max 以 77.7% 总完成率居首(OSWorld 同级最强 Opus 为 83.4%);开源最佳 Qwen3.8 Flash Next 仅 55.1%,且在 Robustness 上骤降到 32.9%;Minimax M3 从 OSWorld 的 75.2% 暴跌到 28.9%。过程式视角还暴露了结果式评测看不到的失败模式:强模型也会陷在 subgoal-irrelevant 动作里(Claude Opus 5 曾卡 59 步做无关操作),弱模型则在 click 坐标这类基础操作上频繁出错。本文按九部分结构拆解其背景、定位、问题定义、数据构建、LLM-Judge 设计、外部交叉验证、核心结果、失败模式分析与启示。

September 23, 2026 · 5 min