Opera × CER:长程编码智能体的评论家介入与早期奖励预测

长程编码 agent 的困境有个时间结构:反馈来得太晚。任务要跑几十上百轮工具调用,奖励只在最后由隐藏测试给出——中途走偏的 agent 会把早期错误假设滚成长而连贯但注定失败的轨迹。本精读的两篇论文在同一时间轴上各切了一刀:

论文一:Opera: A Verbal Critic Framework for Long-horizon Coding Agents (arXiv 2609.33987) 机构:Salesforce AI Research(第一单位,一作与通讯均在企业)+ Rutgers University + Lehigh University。典型的企业主导 + 高校合作模式:Salesforce 出框架、算力与评测基础设施(Harbor 任务管理 + Pier 网络隔离防作弊),Rutgers 的 Dimitris N. Metaxas 等提供学术指导,Lehigh 学生为合作者。作为 Salesforce AI Research 的 preprint 出品,这延续了其在 SWE agent 评测与工具链上的系统性投入。

论文二:Before the Rollout Ends: Early Terminal Reward Prediction for Long-horizon Coding Agents (arXiv 2609.31995) 机构:University of Washington(第一单位,Jihan Yao 一作,Yulia Tsvetkov 组)+ Independent Researcher(Sihan Zeng)+ HKUST。纯学术组合,ICLR 2027 在审。作者阵容横跨 NLP 与 agent 训练,代码开源于 github.com/yaojh18/RLER。

两篇的互补张力一目了然:Opera 是「过程中介入」的评论家——向内诊断当前轨迹哪里出了问题、给出修正并跟踪到真正解决;CER 是「结束前预判」的预测器——向前看这条前缀最终能不能拿到终端奖励。 一个改变轨迹的走向,一个预测轨迹的结局;但它们共享同一个底层判断:长程轨迹的中段信息足以支撑质量信号,不必等终点。

一、背景:测试时监督的几个关键词

从「是什么」讲起。

测试时扩展:不改模型权重,在推理阶段投入更多计算来换更好的输出。对编码 agent 而言,这笔计算可以花在三个地方——生成更多候选(并行采样)、探索替代路径(树搜索)、或审查正在进行的轨迹(本篇 Opera 的选择)。前两者已被广泛研究(Tree of Thoughts、SWE-Search、S*),第三类「把测试时算力花在诊断与纠正上」是 Opera 切入的角度。

过程奖励模型(PRM):与只给最终结果打分的结果奖励模型不同,PRM 对轨迹中每一步(或每个状态)打分,提供稠密的中间信号。对长程任务这尤其重要——终端二值奖励把「定位了正确模块但没修完」和「全程浏览无关文件」打成同一个零。但 PRM 有两个痛点:训练需要过程标注或蒙特卡洛续跑(对长程 agent 代价惊人),且训练好的 PRM 对策略与脚手架漂移敏感。CER 的定位恰恰是「不做 PRM」:它预测的不是某步动作好不好,而是当前前缀隐含的最终成败概率。

口头评论家:不训练任何模型、用自然语言给执行中的 agent 提反馈的外部监督者。谱系可从 Self-Refine(自反馈迭代)、Reflexion(跨尝试的言语强化)、CRITIC(工具接地批评)一路数到 SWE-PRM(周期性审查轨迹并按失败分类学给纠正反馈)。Opera 对这条谱系的诊断很尖锐:它们都止步于「评轨迹 + 发反馈」,从不跟踪反馈发出之后发生了什么——而反馈的价值恰恰只在事后才显现。

Rubric 评估:让 LLM 评委按一组预先构造的行为准则给轨迹打分,代替执行隐藏测试。Agentic Rubrics 先检查仓库再构造上下文接地的检查单;OpenHands Rubrics 从真实人机交互中学习固定行为特征。CER 继承这条线但做了两处关键改造:rubric 按任务与阶段自适应合成而非固定清单,且只在同父兄弟续跑组成的组内共享打分——这使它能在轨迹未完成时区分细微的行为差异。

二、定位与关联工作:两条谱系,两篇坐标

Opera:评论家谱系的「第三步」

相关工作做法与 Opera 的差异
SWE-PRM(Gandhi et al., 2025)周期性审查轨迹近 8 步,按 12 类低效分类学给反馈只按固定周期审查;Opera 是周期 + 事件混合触发,且反馈按持久笔记跟踪到解决
SWE-Search(Antoniades et al., 2024)MCTS 价值函数给上一步打分(−100~100)+ 文字评估数值打分面向树搜索设计;Opera 的算子契约绑定证据与解决判据
LLM-as-verifier(Kwok et al., 2026)给完成品按 1–20 细粒度打分结果验证器;Opera 复用其「显式判据」思想但用于过程中
Agentic Rubrics(Raghavendra et al., 2026)仓库接地 rubric 检查单给补丁打分(不执行测试)评的是完成品;Opera 在执行中介入,且每条笔记自带解决判据
Reflexion(Shinn et al., 2023)跨尝试的言语反思记忆反思在下一次尝试才生效;Opera 在当前轨迹内闭环

一句话定位:Opera = 过程评论家的时机感 + 结果验证器的判据感,再加上前两者都没有的「反馈后果跟踪」。 论文引用 Vasudev et al. (2026) 的发现作为动机——「准确的失败预测并不意味着有效的失败预防」,误导性干预会打断本会成功的轨迹,这正是 Opera 花大力气做审计的原因。

CER:奖励预测谱系的「提前量」

相关工作做法与 CER 的差异
SWE-RM(Shum et al., 2026)训练执行无关的生成式 resolved/unresolved 分类器需要完整轨迹;且在 Qwen 3 Coder 在策略数据上训练,对策略/脚手架漂移敏感(Nemotron 上落后 CER 最佳 6.0pp)
OpenHands Critic(2025)从终端单测结果传播 TD 目标训练 critic 模型学得的 critic 同样对策略漂移敏感,且要求前缀可比
OpenHands Rubrics(Wang et al., 2026b)从人类反馈学习的固定行为 rubric固定准则太粗,无法区分同组候选(top-tie 率极高)
Agentic Rubrics任务自适应 rubric 评完成品同样需要完成轨迹,不能提前预测
Monte Carlo PRM(AgentPRM 等)采样后缀估计状态价值长程 agent 采后缀不可行(rollout 本身就是最大成本)
ARBOR(Liu et al., 2026)可复用 rubric 缓冲给多跳 QA 加过程分短程轨迹完成后打分;CER 在长程编码 rollout 结束前预测

一句话定位:CER 是第一个把「终端奖励预测」明确为问题、并证明其足以支撑测试时搜索与 RL 训练两个下游的工作——比 PRM 更接近结果、比结果验证器更早、比两者都便宜。

三、问题定义

Opera:反馈即需要跟踪至解决的干预

长程编码 agent 需要及时纠正,但反馈在误判进行中的工作或没触及根因时可能无效甚至有害。把评论家反馈视为价值只在事后才显现的干预,引出三个挑战:

  1. 何时介入:周期性反馈可能来得太晚,而并非每个执行事件都需要纠正——agent 重复失败命令几次才等来下一次审查,或者被不必要的反馈打断本会成功的轨迹;
  2. 反馈是否有据:看似合理的诊断可能误读部分证据,把本会成功的工作引向歧途;LLM 评委即使在验证定义良好的准则时也充满噪声(论文引 RuVerBench 证据);
  3. 干预是否奏效:agent 可能遵从了建议(照做了)但底层失败依然原样——「遵从」(adherence)不等于「解决」(resolution)。

CER:从前缀预测终端奖励

给定未完成前缀 h_t(可见的工具输出与工作区 diff,不含未来动作、最终补丁或评测结果),估计其未来终端奖励 V(h_t) = P[y=1 | h_t]。与 PRM 的区别:PRM 评估局部动作的奖励,CER 评估当前交互对最终成功的蕴含。关键的理论放松是:下游任务(排名、组相对优势)只依赖组内成对顺序保持(论文 Eq. 2),不要求跨任务校准——这把「预测概率」的难题降为「组内排序」的难题,正是 CER 全部方法设计的支点。

四、解法

Opera:以持久化笔记为组织核心的三件套

① 混合审查调度。固定间隔审查反应太慢(agent 可能在下次审查前重复失败命令多次),纯事件触发又会漏掉安静型失败(自信地编辑错文件)。Opera 两者结合:每 k 轮周期性审查(默认 5 轮,DeepSWE 长任务 10 轮)+ 五类事件即时触发——Idle(无可见进展)、Repeat(重复动作)、Error(动作/工具失败)、Claim(宣称完成)、Submission(最终补丁提交)。同时信号合并为单次审查,事件触发会重置周期计时器。最重要的设计是:审查不等于干预——评论家可以选择沉默,让 agent 继续。

② 九个类型化算子 + 契约。自由形式的批评往往泛泛而谈(「考虑边界情况」)或混杂多个问题,agent 无从下手。Opera 要求每个诊断使用一个类型化算子,按代码修复阶段组织成五阶段九算子:

  • Search:repo_localization_search(目标未定位)、implementation_target_shift(编辑错误目标);
  • View:implementation_readiness_review(修复已明确却还在重读代码)、failure_signature_triage(误读工具输出);
  • Edit:requirement_contract_review(违反需求契约)、diff_scope_review(改动缺失或无关)、state_transition_review(执行逻辑错误);
  • Test:minimal_repro_or_focused_verifier(下一步决策缺证据);
  • Submit:submission_readiness_review(证据不足却宣称完成)。

每个算子按 Design by Contract(Meyer, 1992)范式规定:适用条件(When)、所需证据(Evidence)、可请求的修正(Correction)、解决判据(Done when)、排除项(Excludes)。排除项防止算子重叠,解决判据提供后续关闭检查的依据。每次审查至多开一条笔记——避免指令互相竞争,让后续结果可归因到具体修正。每次输出要么是 continue,要么是「一个有据的问题 + 最小修正」。

③ 审计化笔记管理。笔记有 open/closed 两态,至多一条 open。因为评论家本身是 LLM、诊断可能「看似有理实则错误」,两个审计把控全生命周期:

  • 准入审计(admission audit):创建与更新时核查证据是否支持诊断、修正是否必要、提议的检查能否确认解决;拒绝与任务无关的可选清理、无新证据的重复提醒。被拒提案不改变当前笔记。审计只接受或拒绝,从不改写提案——是验证者而非共同作者。
  • 发布审计(release audit):关闭笔记须对照固定解决判据(而非最新指导)给出执行证据——行为要求须有执行结果,静态要求须有可见编辑。防止「最新建议看起来被照做了就关闭」。
  • 更新可换算子换指导但保持笔记身份与判据不变——目标固定,建议改进。

依从性由规则检查(是否尝试了修正),解决性由 LLM + 审计判断,两者严格分离。实现上是 agent 模型端点前的代理:harness 无需改动、评论家从不执行命令/访问文件/跑测试,只在转发的请求中至多插入一条消息;评论家故障时请求原样转发——监督者永远不能阻塞被监督者。

CER:组条件 rubric 的两个场景实例化

公共核心:为当前任务与阶段合成自适应 rubric 集 R = {(准则 r_k, 权重 w_k)},judge 对组内每条前缀按每条准则给「证据 + 分数」,加权归一得分 s(h)。经验库的构造逻辑是:对历史任务中「rubric 判序与真实终局判序不一致」(pairwise 准确率 < 0.5)的组,让强教师模型生成一条结构化经验(适用情境/可观察触发/弃权条件/该奖什么该疑什么的教训/参考 rubric),只有回灌后判序确实改善的经验才被接受入库——经验本身就是被验证过的纠偏知识。

TTS 场景(Algorithm 1):束搜索式扩展 + 四个经验性组件——

  1. 回归停止:得分低于父前缀的续跑不再扩展,防止沿错误方向继续烧算力;
  2. 束父扩展:多个领先父节点并行扩展而非只留最优,保持多样性;
  3. tie-breaking:judge 初判常聚焦主要差异导致大量同分,对并列者生成只条件于并列续跑的额外区分 rubric 再打分;
  4. 检索经验库:BM25(四视图查询:任务描述/阶段/任务契约/状态摘要,加权倒数排名融合)取 top-6 经验注入 rubric 生成。

RL 场景:离线用教师模型从带验证奖励的历史 rollout 组蒸馏任务专属 rubric——教师先比较不同终局的续跑提出准则,权重经扰动鲁棒的坐标搜索优化(对打分加 ±1 扰动共 200 组,最大化扰动平均 pairwise 一致率,pairwise 准确率 66.41%→72.88%)。在线 rollout 在 40 步截断,组中心化 rubric 奖励替代终端验证器供 DPPO 更新,配弃权门控:judge 先做组级「实质不可区分」直判,加上组内加权分数极差 ΔR < 0.18 的组一并弃样重采——因为 judge 噪声会被组归一化放大,宁弃勿噪。

五、评估证据

Opera:三基准 × 四策略 × 三评委模型

主结果(策略 Qwen3.8-27B,评委 GPT-5.6-Sol):

方法TB-2.1SWE-ProDeepSWE
Non-critic65.9±1.775.3±1.232.4±1.0
SWE-PRM68.9±3.277.7±2.536.6±3.1
SWE-Search70.0±4.777.3±3.838.6±4.4
LLM-as-verifier71.2±2.678.7±2.338.9±2.3
Agentic Rubrics71.9±4.578.3±3.239.5±2.8
Opera73.8±2.3 (+7.9)79.3±3.5 (+4.0)41.3±3.1 (+8.9)

三基准均值全部第一(领先最强基线 1.9/0.6/1.8pp)。跨四策略模型最大增益 +12.4(Qwen3.5-9B, TB)/ +15.0(Qwen3.5-9B, SWE-Pro)/ +8.9(DeepSeek-V4-Flash, DeepSWE)pp——弱模型获益更大,但能力为零处评论家无效(Qwen3.5-9B 在 DeepSWE 上无论有无 critic 都是 0%)。

消融链条:

  • 去双审计:TB +7.9→+2.6(损失约 2/3)、DeepSWE +8.9→+4.5(约半)——误导性干预的代价极高,审计是过滤有害干预的闸门;
  • 算子消融:仅 Edit 算子保留大部分增益(+6.0/+3.7/+7.7);非 Edit 算子以约 1/5 的笔记量在 TB/SWE-Pro/DeepSWE 上恢复过半/四分之三/五分之四增益;
  • 自评有效:33 个策略-基准-评委组合中 32 个有效;DeepSWE 上 Qwen3.8-27B 自评 +6.2pp,与 Claude 相当——收益大头来自框架(时机、类型化、跟踪)而非评论家的额外知识;
  • 训练配方:Opera 引导的自反思轨迹 SFT Qwen3.5-9B,held-out SWE-Pro 仓库 +10.2pp(38.9% vs base 28.7%),追平教师蒸馏(39.5%);换 harness 后 TB-2.1 保持 25.8% 而教师蒸馏崩至 7.9%——近似在策略数据 + 专家诊断注入上下文,规避了蒸馏的分布漂移遗忘。

CER:TTS 与 RL 双下游(SWE-bench Verified 全 500 实例)

TTS(RM@8,token 含在线 rollout 与 judging):

方法Nemotron 3 Ultra RM@8Tok./Ins.Qwen 3.6 27B RM@8Tok./Ins.
SWE-RM61.625.67M67.65.27M
OpenHands Critic@20–8057.8–60.43.91–10.25M63.4–64.61.57–4.65M
Agentic Rubrics62.825.51M65.65.36M
Adaptive Rubrics(最强基线)63.425.95M69.45.38M
CER@2064.83.96M68.61.89M
CER@6067.69.14M71.45.01M
  • Nemotron:CER@20 即超最佳基线 1.4pp 且省 84.7% token;CER@60 达最高 67.6%(+4.2pp,省 64.8%);
  • Qwen:CER@60 达 71.4%(+2.0pp);40 步预算即超基线 0.8pp 且省 25.8%;
  • 区分度:Agentic Rubrics 的 top-tie 率(多轨迹同得最高分)57.2%/88.8% vs CER@20 仅 11.8%/3.0%——既有 rubric 粗到无法区分组内候选,组条件精修是关键;
  • Random→Oracle 差距闭合率:Adaptive Rubrics 27%/35% vs CER 51%/49%;
  • 消融:去兄弟比较(同父续跑联合评判)最伤,平均 RM@8 降 3.0/4.0pp——最关键组件;去经验库 −2.3/−1.3pp;去束父 −2.3pp;去 tie-breaking −0.5/−0.8pp。

RL(Qwen 3.5 9B 三折,SWE-bench Verified):

方法Fold 0Fold 1Fold 2均值
Qwen 3.5 9B(base)44.643.145.644.5
TMax(全轨迹)49.749.150.349.7
TMax-40(全轨迹奖励,40 步更新)49.649.150.749.8
CER(40 步截断 rubric 奖励)52.749.852.451.6
  • 超 TMax +1.9pp 的同时在线 token 省 52.7%(匹配检查点上 TMax 平均 60.2 轮/轨迹 vs CER 37.3 轮);
  • 弃权率 9.9% vs TMax 零方差组过滤 34.3%——43.8% 的二元同终局组中 CER 仍能训练 83.3%(rubric 分数仍有差异),把「无效组」变成「有效组」是比省 token 更深的收益;
  • 经验迁移有方向性:Qwen(强)经验给 Nemotron 每轮 +12pp,反向给 Qwen 掉 57pp——经验库会传递判断力,也会传递判断力上限。

合并速览

OperaCER
信号方向向内诊断(哪里错了)向前预测(结局如何)
作用时机执行中任意轮(事件+周期触发)固定截断点(40 步前缀)
核心机制持久笔记+契约算子+双审计组条件 rubric+经验库
主增益+7.9/+4.0/+8.9pp(resolve rate)+4.2pp RM@8 / +1.9pp RL
效率每轮至多一条消息插入省 84.7% token / 52.7% 在线 token
关键消融去审计损失 2/3 增益去兄弟比较 −3.0/−4.0pp

六、根源解释:为什么各自有效

Opera:为什么「评轨迹+发反馈」不够

三个失效源与三件套一一对应,消融给出量化证据:

  1. 误导性诊断的代价有多高:去双审计后 TB 增益从 +7.9 掉到 +2.6——放行全部提案意味着大量「看似合理」的干预涌入,其中误读中间证据者会把本会成功的轨迹带偏。TB-2.1 恰是中间证据最易误读的基准(终端任务的工具输出噪音大),审计的价值与之成正比。这不是假设:论文自评实验里 self-critic 的提案近半被预过滤(其中大头是「不断开新笔记而不跟进已有笔记」),过滤后弱评论家的干预频率被拉到与强评论家相当——框架的纪律性在替代评论家的判断力。
  2. 「一次一条笔记 + 固定判据」的归因收益:每条笔记有固定 ID 与解决判据,后续审查有历史可依——评论家在跟进自己的反馈而非每次从头开始。发布审计对照初始判据(而非最新指导)关闭,杜绝「指导漂移后自我满足」。「遵从≠解决」的分离则防止 agent 照做建议、测试仍挂时提前关闭(论文 Figure 3b 的例子:guard 加了但 test_empty 仍 FAIL——遵从了,没解决)。
  3. 为什么弱模型获益最大而零能力处无效:弱模型错误多且自身难以发现纠正,评论家供给的是「执行时忘记使用的知识」——自评有效的证据表明模型「知道」但执行时「没用上」,框架的时机与结构恰好把知识在正确的时刻注入上下文。但评论家不能替代能力:Qwen3.5-9B 在 DeepSWE 上连可行的起点都产生不了,反馈无处着力。评论家的价值上界是「策略可及但未达的空间」。

CER:为什么组内比较 + 检索校正比训练 RM 更稳

  1. 训练 RM 的漂移脆弱性有实证:SWE-RM 在 Qwen 系在策略数据上训练,落到 Nemotron 上落后 CER 最佳 6.0pp,落在 Qwen 3.6 27B 上只落后 3.8pp——缺口差与策略/脚手架距离成正比。CER 不训练参数化评分器,rubric 每次按当前组现场合成,「评分器」永远在分布内。
  2. 兄弟比较为什么是最关键组件:同父续跑只差「父前缀之后的分支决策」,共享前缀天然控制了任务难度与阶段——组内分数差异只反映行为差异。这正好满足 Eq. 2 的组内序保持条件:judge 只需在同准则下比较相对好坏,无需跨任务校准。去掉兄弟比较(每条续跑单独开 rubric 评)平均掉 3~4pp,且 @20 掉得最狠——早期候选假设最发散时,对比信息最值钱。
  3. 早期信号为什么存在:token 熵前 40 轮 0.399 nats > 后 40 轮 0.312——策略不确定性集中在前段,后段动作被累积的轨迹状态约束。这与「自纠偏多为局部而非假设级」的定性观察互证:agent 会从无产出的检查中恢复(多开几个相关文件),却极少放弃最初的错误根因假设——假设级错误在前 40 步已基本定型,所以前 40 步足够预测。但也别过早:10/20 步预算的训练分别只有 48.1%/48.3%(vs 40 步 52.7%),标注显示编辑与验证的中位进入轮次是 22/28——前缀必须含实现与验证证据,纯探索行为本身不是好指标(即便拿到金补丁目标文件,覆盖率预测终局的 AUROC 峰值也只有 0.608)。
  4. 弃权门控为什么必要:组归一化会放大 judge 噪声——同终局组硬打分等于给随机梯度加权。让 judge 先做「实质不可区分」直判 + 分数极差阈值过滤,把可教组(rubric 有差异的 83.3%)与噪声组分开。这是「知道何时不评分」的工程化。
  5. CER 不能当 PRM 用(论文诚实检查):对同一轨迹每 10 步单独打分,分数随步数单调升(0.431→0.852)而二元交叉熵恶化(0.755→3.514)——judge 越来越自信但并不更准,长度偏置明显。CER 只在固定截断点的组间比较中成立,跨时间点的分数不可比。

交叉验证:概念坐标的外部锚点

  • Test-time compute 的系统化研究(Snell et al., 2024 起)确立了「推理算力作为可分配资源」的范式,两篇论文都是把这份资源投向「监督」而非「更多候选」的具体化;
  • Process reward model 自 Math-PRM(Lightman et al., 2023)以来在数学推理成熟,但向 agent 场景迁移时遇到了轨迹更长、标注更贵、分布更漂移的三重摩擦——CER 的「不做 PRM 做组内排序」与 SWE-Shepherd 等坚持训练 PRM 的路线构成当下 agent 奖励建模的分岔口;
  • 「LLM 评委有噪声需驯化」已成方法学共识(RuVerBench、JET 等同期工作):Opera 用审计 + 契约,CER 用经验库回灌验证 + 弃权门控——同一共识的两种工程回应。

七、知识反推:从两篇论文倒推领域公共知识

把论文当成领域现状的探针,可以反推出 2026 年长程编码 agent 监督的几条公共认知:

  1. 「评完就完」的评论家已被判定不够——Opera 的框架化(时机/判据/跟踪三件套)之所以成立,是因为领域已默认:无跟踪的反馈在长程任务里净值可以为负。这与 Vasudev et al.「准确预测失败≠有效预防失败」互为印证;
  2. 执行无关的奖励预测是真实需求——CER 不是省 token 的锦上添花:测试执行本身是 agent 训练的效率瓶颈,SWE 类评测还有假阳/假阴(官方验证器也不完全可信),「终端验证器不够用」已是公开事实;
  3. 组相对比较是 agent 场景的默认评价单元——GRPO 式组内归一化从 RL 奖励蔓延到 judge 打分(CER 的组条件 rubric),「绝对分数不可信、相对顺序可用」成为 LLM-as-judge 的操作性共识;
  4. 「评论家知识 ≈ 策略自身知识」的边界被摸清——Opera 自评有效说明框架结构贡献大于评委模型的知识增量;CER 经验迁移的方向性说明蒸馏来的判断力有上限且会反噬——监督信号的可迁移性比强度更稀缺;
  5. 40 步是个有内容的数字——CER 的截断点由行为学锚定(编辑中位 22 轮、验证 28 轮、熵前高后低),Opera 的周期 5 轮、事件三连失败触发——两套完全独立的方法在时间尺度上互相印证:长程轨迹的「命运窗口」在前 1/3。

八、通用灵感

  1. 反馈的价值在发出之后才确定——所以要有反馈的生命周期管理。Opera 的笔记(开启-投递-跟踪-关闭)可以迁移到一切「建议发出后世界会继续演化」的场景:code review 意见要跟踪到修复验证,运维告警要跟踪到根因消除,「遵从了建议」和「解决了问题」必须是两个独立的检查点。
  2. 把自由生成的输出塞进类型系统,是驯化 LLM 输出的通用手段。九算子 × 五字段契约让「诊断」这个模糊动作变得可审计、可拒绝、可关闭。任何 LLM 参与的流程都值得问:它的输出能不能被赋予 schema 和验收条款?
  3. 监督者只应有一条影响通道,且永远不能阻塞被监督者。Opera 作为代理「至多插一条消息、故障即透传」的设计是监督系统的好品味——fail-open 而非 fail-blocking,单一通道使归因干净。
  4. 当绝对校准不可得时,设计成组内相对比较。CER 的 Eq. 2 松弛(组内序保持即可)是可泛化的工程哲学:排名类任务不需要校准的分数,只需要一致的序——「把不可测的问题约化成可比较的问题」。
  5. 对照组要共享前缀。同父兄弟续跑是「控制变量」在 agent 评测里的自然形态:共享前缀控制了任务与阶段,差异只剩分支行为。凡是要评估「行为导致的结果差异」,先问能不能构造共同起点的对照组。
  6. 知道何时不判断。CER 的弃权门控与 Opera 的「审查可以沉默」是同一美德:噪声信号经过归一化/放大后会变成系统性伤害,克制是监督系统的正确组件而非缺席。
  7. 经验要被验证后才能入库。CER 的经验库只接受「回灌后判序确实改善」的条目——这把「教训」从叙事变成了可回归测试的资产。任何组织的经验库都值得配一套准入回归。
  8. 监督框架可以让弱监督者逼近强监督者。Opera 的过滤纪律把 self-critic 的干预质量拉到强评委水平——当判断力不足时,流程纪律是可替代的补丁,这个结论对人类组织同样成立。

一句话总结:Opera 证明「发反馈」只是监督的开始——持久笔记、固定判据与双审计让干预的后果被跟踪,误导性诊断被拦在投递之前;CER 证明终端奖励不必等终端——组条件 rubric 与检索经验让 40 步前缀的组内排序就足以指导搜索与训练。一个把监督做成有生命周期的干预,一个把预测做成有对照的排序,合起来是长程 agent 测试时监督的当下答案:信号要早、要有据、要跟踪、要知道自己什么时候该闭嘴。