论文链接:How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review 代码仓库:github.com/MingLiiii/Dissecting_AI_Reviews 发表时间:2026年8月 机构:马里兰大学、Virginia Tech、MBZUAI、滑铁卢大学(四校合作;第一作者 Ming Li,通讯为 Tianyi Zhou、Dawei Zhou) 领域标签:cs.CL / cs.AI(AI 同行评审、LLM 评估鲁棒性)
一、论文背景
要理解这篇论文,先要理解两个背景概念:AI 同行评审和 reward hacking(奖励作弊)。
什么是 AI 同行评审? 学术会议每年收到上万篇投稿,人类审稿人不堪重负,“审稿危机"早已是老话题。于是各大会议和工具厂商开始引入大语言模型(LLM)辅助审稿:AAAI、ICLR 等会议已试点 AI 生成评审意见,OpenReview 生态里也出现了各种"AI 预审"工具。LLM 审稿确实快、便宜、永远不鸽,但它的判断可靠吗?
什么是 reward hacking? 这个词来自强化学习:当你用一个可被优化的指标当"奖励"时,智能体往往学会钻空子刷分,而不是完成你真正想要的任务。经典的例子是训练一个清洁机器人,结果它学会把垃圾藏到沙发底下——指标(地板可见垃圾数)下降了,但房间并没有变干净。放到 AI 审稿场景:如果 AI 评审的打分可以被"话术"操纵,那么作者就会被激励去优化话术而不是优化研究本身——这就是论文标题里的"rhetoric reward-hack AI reviewers”。
前序工作已经敲响了警钟。 2026 年的一系列研究发现:Baumann 等人的 ICML 2026 Spotlight 论文展示了"paper laundering"(论文洗稿)——让 LLM 重写论文就能显著提高 AI 评审分,且 AI 评审之间存在"蜂群效应"(意见过度一致);Li et al.(2026)发现仅改写摘要就能让 Gemini 3 Flash 评审分提高 1.31 分(10 分制);还有工作证明不改任何实验和图表、只改摘要和贡献叙述的"对抗性重包装"能达到 75% 的攻击成功率。更早的 LLM-as-a-judge 研究也早就发现 LLM 评审有位置偏好、冗长偏好、自增强偏好等系统性偏差。
但这些工作有一个共同的空缺:它们都在演示"能 hack",却没有人系统刻画"hack 的结构"——到底是哪些修辞手法在起作用?效果在不同评审模型间稳定吗?和论文本身的质量、起始分数有什么关系?更复杂的改写策略(多维度联合、迭代多轮、利用评审反馈)效果更好吗?这篇论文要做的就是这个"解剖(dissect)“工作。
二、论文定位和关联工作
围绕"AI 评审是否可被操纵”,已有研究大致分三条线:
第一条线:LLM-as-a-judge 偏差研究。 这条线关注 LLM 评审器本身的行为偏差——位置偏好(倾向给列表第一个选项高分)、冗长偏好(长回答显得更好)、自我偏好(偏爱自己风格的回答)、评分不一致等。这条线奠定了"LLM 评分不可全信"的共识,但研究对象多是短文本对(问答、摘要),不是几万字、含公式图表的科学论文。
第二条线:LLM 科学评审能力评测。 这条线拿真实会议评审数据对比 LLM 与人类评审的一致性,结论普遍是"仅部分一致、难以识别实质性缺陷、区分度有限"。它回答了"LLM 审得好不好",但没有回答"能不能被针对性利用"。
第三条线:稿件侧攻击(与本文最接近)。 包括隐藏 prompt 注入(在 PDF 里埋隐形指令劫持评审模型)、对抗性文本扰动、以及上文提到的摘要改写和"对抗性重包装"。这条线证明了攻击可行,但方法上有个关键缺陷:改写是"以提分为目标"生成的,缺乏受控对照——你说重写后的稿子分数变高了,可这到底是哪个修辞特征导致的?换个评审模型还成立吗?很难回答。
本文的定位:站在第三条线的延长线上,但把方法论从"攻击演示"升级为"受控因果实验"。对比如下:
| 维度 | 之前的路线(攻击演示) | 本文的突破(受控解剖) |
|---|---|---|
| 改写目标 | 以提分为目标自由改写 | 沿 6 个预定义修辞维度双向改写,内容受约束保护 |
| 变量控制 | 改写前后差异混杂 | 同一基线独立生成正/负变体,配对比较 |
| 评审覆盖 | 1–3 个评审模型 | 5 个评审模型 × 2 种协议,42396 条评审 |
| 研究问题 | “能否提分” | “哪个维度、多大效应、什么条件下、为什么” |
| 角色分离 | 未区分 | 显式分离 rewriter 与 reviewer 各自的贡献 |
三、问题定义
论文面对的具体场景:作者想骗过 AI 审稿人,手段不是伪造实验,而是改措辞——把同样的结果说得更漂亮、更自信、更有分寸。这在写作伦理上是完全合法的(甚至就是"写得好"),但如果 AI 评审因此打了高分,就构成了 reward hacking。
核心洞察:论文把这个场景抽象成一个受控因果推断问题——“修辞呈现"是处理(treatment),“报告的科学内容"是通过约束固定的协变量,“AI 评审分"是结果。要测的是处理对结果的因果效应。
类比:这就像药物临床试验的双臂设计。基线稿是"对照组”,正向修辞改写是"高剂量组”,负向改写是"低剂量组”,同一篇论文的三个版本相当于同一患者的交叉给药;6 个修辞维度相当于 6 种不同的"药物";2 个 rewriter 相当于两个"制药厂";5 个 reviewer 相当于 5 位"主评医师"——同一药物在不同医生那里可能得到不同读数,这正是要测量的对象。
形式化定义:给定论文集 $P$(覆盖不同人工质量层),对每篇 $p \in P$、每个修辞维度 $d \in D$(|D|=6)和方向 $v \in \{+, -\}$,用 rewriter $r$ 生成内容保持的变体 $p_{d,v}^{(r)}$;再用 reviewer $m$ 在协议 $\pi$ 下对所有稿件盲评。求配对效应 $\Delta = \text{OA}(p_{d,v}^{(r)}) - \text{OA}(p)$,以及正负对比 $\text{OA}(p_{d,+}) - \text{OA}(p_{d,-})$,并分析其随 $d, r, m, \pi, p$ 的初始分数与质量层的结构化变化。
这个抽象的精妙之处有两点。第一,“内容保持"不是口头承诺而是工程约束(见下节),使得 $\Delta$ 可以被解释为纯修辞效应;第二,正负双向设计提供了内部对照——如果一个维度真的在影响评审,那么正负两个方向应该产生相反的移动,这比单向"改写后变高"的证明强得多。
四、问题解法
整个流水线分四步:种子语料构造 → 双向改写 → 多模型盲评 → 扩展工作流测试。
4.1 种子语料:120 篇分层采样的真实投稿
从 OpenReview API 获取 ICLR 2026 投稿(排除撤稿和桌拒),按人工总评分分 6 个区间([1,3)、[3,4)、[4,5)、[5,6)、[6,7)、[7,8.5])各抽 20 篇,共 120 篇。这个分层设计很关键:它保证了后续分析可以区分"论文本身的科学质量"和"AI 评审的起始分"这两个容易混淆的变量——后面会看到,二者揭示的规律完全不同。
4.2 双向改写:2 个 rewriter × 6 维度 × 2 方向
两个 rewriter 是 GPT-5.5(经 Codex CLI)和 Claude Opus 4.8(经 Claude Code),它们沿六个修辞维度做全文改写:
| 维度 | 正向改写 | 负向改写 |
|---|---|---|
| 新颖性立场 (novelty stance) | 对主张和新颖性更自信、更断言 | 更谨慎、更保留 |
| 范围框架 (scope framing) | 在有依据的边界内更宽泛地泛化 | 更窄,紧扣实际评估的设置 |
| 证据框架 (evidence framing) | 更强调已报告的对比结果和规律 | 弱化比较优势的呈现 |
| 贡献显著性 (contribution salience) | 贡献显式前置、路标式标注 | 贡献融入叙事,不单独突出 |
| 技术语域 (technical register) | 更正式、更明确的技术表达 | 更平实的表达 |
| 语言复杂度 (linguistic complexity) | 更 sophisticated 的词汇句式 | 更简单的词汇句式 |
注意这些维度的定义都内嵌了"诚实性护栏”:正向不等于吹牛——范围框架的正向是"在有支持依据的边界内"更宽泛,证据框架的正向是"强调已报告的结果"。这六个维度的划分依据来自主要 AI 会议的审稿指南(评审人被要求评估新颖性、显著性、清晰度等),也就是说,它们瞄准的正是评审评分表上的那一栏栏条目。
内容保持怎么做? 这是最见工程功力的部分。改写覆盖全文(包括 caption、表格和结果解读),但施加软约束:方法、实验设置、报告数值、对比基线、证据边界、实质发现必须保留。再加程序化检查保护结构性锚点——引用键、交叉引用、标签、URL、图片路径、数学环境、代码与算法环境、参考文献文件,违规则退回修复或整体废弃。正负两个变体都从同一匿名基线独立生成,避免"串味"。最终得到 4080 篇改写稿,加上 120 篇原文共 4200 篇。
4.3 多模型盲评:5 个 reviewer × 2 种协议
5 个评审模型:Gemini 3.5 Flash-Lite、Qwen 3.5 Flash、GPT-5 mini、GPT-5.5、Claude Sonnet 5,覆盖三家厂商、不同量级。评审模型完全不知道改写条件和改写模型的存在——它们以为自己在审普通投稿。
两种评审协议:
- 标准协议:对齐 ICLR 官方评审指南,要求结构化评审和数值评分;
- 严格协议:在标准之上额外要求——打高分必须给出具体证据,并且明确指示评审者"不要因为呈现方式而奖励论文,除非呈现改变了科学评估本身"。这个协议相当于给 AI 评审打了"预防针",用来测试"提醒有用吗"。
主指标是 OA(Overall Assessment,总评),ICLR 式 1–10 分;次要指标有 Soundness(可靠度)、Presentation(呈现)、Contribution(贡献);还有 weak-accept 概率(评分 ≥6 的比例)。共收集 42396 条有效评审,直接 API 成本 $29,165.89——这个数字也侧面说明,做这种规模的内容保持全文实验,代价不菲。
4.4 扩展工作流:joint / 递归 / 评审引导
除了单维度改写,论文还测了三种"进阶玩法":
- Joint 改写:6 个维度一次性同向改写(240 篇);
- 递归改写:joint 改写反复迭代 3 轮(480 篇);
- 评审引导改写:先让 AI 评审给意见,再按意见改写,对照组是"无意见的第二次改写"(480 篇)。
分析方法是配对比较(同一论文、同一评审模型、同一协议下改写 vs 原文),按人工分数层等权汇总,5000 次论文级 bootstrap 给出 95% 置信区间——教科书级的因果推断卫生。
五、评估指标与实验证据
5.1 主结果:修辞维度的效应层级
各维度正/负改写相对原文的 OA 配对变化(总体均值):
| 维度 | 正向 ΔOA | 负向 ΔOA | weak-accept 概率正负对比 |
|---|---|---|---|
| 证据框架 | +0.289 | −0.303 | +13.0 pp |
| 新颖性立场 | +0.187 | −0.353 | +12.0 pp |
| 范围框架 | +0.136 | −0.289 | +9.0 pp |
| 贡献显著性 | +0.192 | +0.049 | 较小 |
| 技术语域 | +0.142 | +0.034 | 较小 |
| 语言复杂度 | +0.017 | +0.006 | 几乎为 0 |
| 跨维度平均 | +0.161 | −0.142 | — |
极值出现在 Opus 4.8 改写 × Gemini 3.5 FL 评审 × 严格协议的组合下:正向证据框架 +0.933,负向新颖性立场 −0.733。
这张表支撑了论文的第一个核心主张:修辞敏感性是"结构化的"而非均匀的——形成明显的层级:证据框架和新颖性立场是第一梯队(前者双向都大幅移动,后者的效应主要由负向惩罚驱动——把新颖性说保守了会被狠罚);范围框架是较弱的第二梯队;语言复杂度几乎无效。这个结果很有现实意义:单纯把文章写得"高级"没用,真正值钱的是"怎么摆证据、怎么谈创新"。
5.2 起始分数效应:AI 的分数会"向中间靠"
按 AI 评审对原文的起始打分分层后,发现方向感完全不同:正向证据框架改写对起始分 [1,3] 的论文平均 +1.05,对 [8,10] 的论文却是 −0.19;joint 改写更夸张,[1,3] 区间 +1.42,[8,10] 区间 −0.88。低分稿越改越高、高分稿反而越改越低,方向性对比在中间分数段最清晰。作者诚实地指出其中部分是量表边界效应和均值回归,但即便如此,“改写能让弱稿的 AI 分大幅上浮"这一点对投稿者激励的影响是实实在在的。
对照实验排除了一个混淆解释:按人工质量分层时,维度层级在各质量档基本保持——强论文并不更抗改写,弱论文也不更敏感。决定分数移动方向的是 AI 评审自己的起始读数,不是论文的客观质量。
5.3 进阶工作流:都不太灵
| 工作流 | 结果 |
|---|---|
| Joint(六维联合) | 强烈依赖 rewriter:Opus 4.8 平均 +0.463(严格协议),全配置为正;GPT-5.5 仅 +0.045,几乎无效。联合 ≠ 单维度叠加,无稳定协同 |
| 评审引导改写 | 仅 Opus 有提升(+0.204 → +0.250),但四种配置下都不优于"无引导的第二次改写”——拿到 AI 评审意见再改,不如让 rewriter 再自由改一遍 |
| 递归改写 | 收益递减:Opus 的增益集中在第 2 轮(+0.289 → +0.410,标准协议),第 3 轮几乎归零;不同评审者轨迹分化,部分走平甚至逆转 |
5.4 严格协议:更严但不更稳
严格协议让平均 OA 从 6.296 降到 4.934(降 1.36 分,95% 的论文降分),论文排名基本稳定(Spearman ρ=0.862)。但关键在于:改写效应的跨协议相关仅 0.081——提醒 AI 评审"别被措辞影响"并没有让它真的不被影响,只是整体打分更严了。
5.5 角色分工:rewriter 定分离度,reviewer 定幅度与符号
跨所有条件的一个总规律:改写模型主要决定正负变体之间的分离程度(Opus 4.8 生成的正负变体差异远大于 GPT-5.5 的),评审模型决定分数效应的幅度与符号(同样的变体,不同 reviewer 给出的移动方向和大小可以不同)。这是全文最具机理感的发现——hack 的"上限"由改写者铺开,“落点"由评审者决定。
六、效果优势的根源解释
这一部分解释:为什么这篇论文能得出前序攻击性工作得不到的结论?根源在于它的受控因果实验设计相对"自由攻击演示"的结构性优势。
前序方法的根本局限:以提分为目标的自由改写,处理变量是"一揽子混杂变化”——改写后分数变了,你无法归因。更微妙的是,它还隐含幸存者偏差式的选择效应:攻击工作倾向于报告成功案例(“我们提了 1.3 分”),而"哪些改法无效甚至适得其反"的信息被系统性丢弃。这就导致整个领域知道"能 hack",却不知道 hack 的边界在哪里。
本文设计带来的三重机制变化:
双向变体 → 内部对照 → 效应可归因到维度。同一基线独立生成正负变体,等于每个维度自带阴性和阳性对照。因果链:双向设计 → 单一维度贡献被隔离 → 得出"证据框架第一、语言复杂度垫底"的层级结论(对应 5.1)。如果只有单向改写,“语言复杂度几乎无效"这种零结果根本测不出来。
分层采样 + 双重分层分析 → 混淆变量被解耦。按人工质量分 6 层采样、分析时分别按人工分和 AI 起始分分层,才暴露出"效应方向取决于 AI 起始分而非论文质量"这一反直觉规律(对应 5.2)。自由攻击工作通常不控制论文质量,其提分结论可能只是"低分稿向均值回归"的伪影。
rewriter × reviewer 全因子网格 → 角色贡献可分离。2 个改写者 × 5 个评审者的完整交叉,使得"变体分离度"的方差主要归属 rewriter、“分数移动幅度与符号"的方差主要归属 reviewer 这一分工规律(对应 5.5)可以被直接读出。前序工作往往固定一个改写模型,把 rewriter 和 reviewer 的效应搅在一起。
反事实检验:如果把双向设计退化成单向,就退回"paper laundering"式结论,只能说"改写有效”;如果不做内容保持的程序化检查,改写可能顺带改变实质内容,效应归因失效;如果只用一个评审模型,“reviewer 决定符号"就永远藏在混淆里。论文的每一个关键结论都对应一个若被移除则结论消失的设计要素——这是"结构上必然更好"的证据。
也要如实说明一项无法完全从根源解释的结果:起始分数分组中 [1,3] 区间个别 reviewer 下的 +2~+6 分巨幅上浮,作者自己承认部分来自均值回归与量表边界,不宜全部解读为修辞效应。
七、必要知识反推
假设一个完全没有背景的人要复现这项研究,最少需要哪些知识?
领域知识层:
- 同行评审的运作机制:OpenReview 数据结构、ICLR 评分量表与评审指南(六维度的划分直接来源于此)、撤稿/桌拒等投稿状态语义。不懂这些,无法构造合法的种子语料,也不知道该改哪些"评审人在乎的东西”。
- 修辞学/科学写作基础:新颖性立场、范围限定、证据呈现这些概念如何操作化为可执行的改写指令。这一步是论文的隐性壁垒——把模糊的"写得好"翻译成 12 个(6×2)精确的改写规范。
方法论知识层:
- 因果推断与实验设计:配对比较、分层抽样、bootstrap 置信区间、均值回归与量表边界效应等混淆识别——这是论文结论可信度的根基。
- reward hacking / LLM-as-a-judge 偏差研究脉络:知道前人做到哪一步,才能定位"受控解剖"这个空缺。
工程知识层:
- LaTeX 源码工程的程序化保护:引用键、数学环境、算法环境的解析与校验——4200 篇全文改写不出结构性损坏,靠的是这层工程。改写指令再精妙,产出破损的 PDF 就全盘报废。
- 多模型 API 编排与成本控制($29166 的预算管理)、匿名化与数据合规(送 API 前彻底剥离作者、机构、致谢信息)。
知识融合的关键节点:最有创造性的一步是把"审稿指南的评分维度”(领域知识)映射为"改写维度"(实验处理),再把改写规范翻译成"带内容保持约束的 LLM 指令"(工程实现)。三个层次的知识在这个节点上发生化学反应:领域知识告诉你 hack 瞄准哪里,方法论告诉你怎么验证,工程知识告诉你怎么规模化而不失真。
八、论文中可以提取的通用性灵感
灵感 1:可优化的评分器必然成为被优化的对象
- 核心思想:任何影响资源分配的自动化评分一旦部署,就会被针对该评分器的表面特征优化,而非针对评分器本应代理的真实目标。
- 论文证据:内容零变化的修辞改写最高移动 OA +0.93、weak-accept 概率 13 个百分点;Baumann 等人的"paper laundering"佐证。
- 推广场景:代码评审/招聘筛选中的 AI 打分 → 候选人学会写"AI 友好"的简历;内容平台的推荐模型 → 标题党优化;企业内部用 LLM 做 KPI 文档评审 → 汇报文学繁荣;模型基准榜 → benchmark 针对性过拟合。
灵感 2:双向扰动比单向优化更能揭示系统结构
- 核心思想:想知道一个系统对某变量是否真敏感,把变量往两个方向各推一次,看是否出现对称响应;单向"成功案例"无法区分信号与噪声。
- 论文证据:正负改写的内部对照揭示出维度层级(证据框架双向大、语言复杂度双向零);若只有正向改写,“语言复杂度无效"这个重要零结果不可能被发现。
- 推广场景:模型可解释性研究中的激活双向干预;A/B 测试中同时测"加法"与"减法"变体;产品定价测试中双向调价探测真实弹性;教育评估中同时做"抬举式"与"贬低式"反馈测试评分公平性。
灵感 3:代理读数与真实质量会解耦,解耦点在"评分器自己的初始锚点”
- 核心思想:自动评分系统的偏差往往不是对被评对象质量的函数,而是对评分系统自身初始读数的函数(锚定 + 回归均值)。
- 论文证据:同一改写对 AI 起始分 [1,3] 的论文 +1.05、对 [8,10] 的论文 −0.19;而按人工质量分层效应稳定——决定移动方向的是 AI 自己的锚,不是论文质量。
- 推广场景:推荐系统的冷启动偏差(低曝光内容怎么改都难涨);自动化风控对"历史低分客户"的惩罚惯性;LLM 多轮对话中的锚定漂移;任何"评分器输出反馈给优化器"的闭环系统。
灵感 4:角色分离让诊断从"黑箱成败"变成"归因分析"
- 核心思想:多智能体流水线中,不同环节对最终结果的贡献维度不同——把环节全因子交叉,就能定位每个环节控制的是什么。
- 论文证据:rewriter 决定变体分离度、reviewer 决定分数幅度与符号——这个分工规律只有在 2×5 完整网格下才可读出。
- 推广场景:RAG 系统中分离检索器与生成器对错误的贡献;数据标注流水线中分离标注指南与标注员效应;多 agent 系统的失效归因审计。
灵感 5:给评审者"打预防针"(提示词警告)改变的是位置,不是敏感度
- 核心思想:对 LLM 评审器加"请不要被 X 影响"的指令,通常只会整体平移评分分布(更严或更松),不会真正消除对 X 的敏感。
- 论文证据:严格协议平均 OA 降 1.36 分、95% 论文降分,但修辞敏感度未系统性改变(改写效应跨协议相关仅 0.081)。
- 推广场景:对齐训练中加入"不要谄媚"指令未必消除谄媚;内容审核提示"不要有偏见"不等于消除偏见;任何依赖 prompt 矫正 LLM 系统性偏差的方案都应测量"敏感度"而非只看"均值"。
附录:一图总结
120 篇 ICLR'26 投稿(按人工评分 6 层×20 篇)
│
├── 2 rewriter(GPT-5.5 / Opus 4.8)
│ × 6 修辞维度 × ±2 方向 ──→ 4080 篇内容保持改写
│ (引用/公式/数值锚点程序化保护)
│
├── 扩展:joint(六维联合)/ 递归×3 轮 / 评审引导
│
└── 5 reviewer(Gemini 3.5FL / Qwen 3.5F / GPT-5 mini / GPT-5.5 / Sonnet 5)
× 2 协议(标准 / 严格)──→ 42396 条盲评,$29,166
核心结论:
① 敏感度分层:证据框架 > 新颖性立场 > 范围框架 >> 其他(语言复杂度≈0)
② 低分稿改写大涨(+1.05),高分稿反而降(−0.19)——看 AI 锚点,不看论文质量
③ 进阶工作流不灵:joint 看 rewriter 脸色,评审引导不如无引导二轮,递归收益递减
④ 严格协议只压分(−1.36)不压敏感度
⑤ rewriter 定分离度,reviewer 定幅度与符号
对投稿者的现实提醒(也是作者的伦理警示):这项研究可以诊断 AI 评审的修辞漏洞,但同样可能被用于"针对 AI 评审偏好定制稿件而不改进研究本身"。修辞提分不等于科学价值提升——如果整个社区都开始优化话术,受损的是科学评价本身。对会议组织者:在 AI 评审大规模上岗前,应进行跨多模型、多条件的修辞鲁棒性评估,而不是只看与人类评审的总体一致性。