Opera × CER:长程编码智能体的评论家介入与早期奖励预测
长程编码 agent 的困境有个时间结构:反馈来得太晚。任务要跑几十上百轮工具调用,奖励只在最后由隐藏测试给出——中途走偏的 agent 会把早期错误假设滚成长而连贯但注定失败的轨迹。本精读的两篇论文在同一时间轴上各切了一刀:
论文一:Opera: A Verbal Critic Framework for Long-horizon Coding Agents (arXiv 2609.33987) 机构:Salesforce AI Research(第一单位,一作与通讯均在企业)+ Rutgers University + Lehigh University。典型的企业主导 + 高校合作模式:Salesforce 出框架、算力与评测基础设施(Harbor 任务管理 + Pier 网络隔离防作弊),Rutgers 的 Dimitris N. Metaxas 等提供学术指导,Lehigh 学生为合作者。作为 Salesforce AI Research 的 preprint 出品,这延续了其在 SWE agent 评测与工具链上的系统性投入。
论文二:Before the Rollout Ends: Early Terminal Reward Prediction for Long-horizon Coding Agents (arXiv 2609.31995) 机构:University of Washington(第一单位,Jihan Yao 一作,Yulia Tsvetkov 组)+ Independent Researcher(Sihan Zeng)+ HKUST。纯学术组合,ICLR 2027 在审。作者阵容横跨 NLP 与 agent 训练,代码开源于 github.com/yaojh18/RLER。
两篇的互补张力一目了然:Opera 是「过程中介入」的评论家——向内诊断当前轨迹哪里出了问题、给出修正并跟踪到真正解决;CER 是「结束前预判」的预测器——向前看这条前缀最终能不能拿到终端奖励。 一个改变轨迹的走向,一个预测轨迹的结局;但它们共享同一个底层判断:长程轨迹的中段信息足以支撑质量信号,不必等终点。
一、背景:测试时监督的几个关键词
从「是什么」讲起。
测试时扩展:不改模型权重,在推理阶段投入更多计算来换更好的输出。对编码 agent 而言,这笔计算可以花在三个地方——生成更多候选(并行采样)、探索替代路径(树搜索)、或审查正在进行的轨迹(本篇 Opera 的选择)。前两者已被广泛研究(Tree of Thoughts、SWE-Search、S*),第三类「把测试时算力花在诊断与纠正上」是 Opera 切入的角度。
过程奖励模型(PRM):与只给最终结果打分的结果奖励模型不同,PRM 对轨迹中每一步(或每个状态)打分,提供稠密的中间信号。对长程任务这尤其重要——终端二值奖励把「定位了正确模块但没修完」和「全程浏览无关文件」打成同一个零。但 PRM 有两个痛点:训练需要过程标注或蒙特卡洛续跑(对长程 agent 代价惊人),且训练好的 PRM 对策略与脚手架漂移敏感。CER 的定位恰恰是「不做 PRM」:它预测的不是某步动作好不好,而是当前前缀隐含的最终成败概率。
口头评论家:不训练任何模型、用自然语言给执行中的 agent 提反馈的外部监督者。谱系可从 Self-Refine(自反馈迭代)、Reflexion(跨尝试的言语强化)、CRITIC(工具接地批评)一路数到 SWE-PRM(周期性审查轨迹并按失败分类学给纠正反馈)。Opera 对这条谱系的诊断很尖锐:它们都止步于「评轨迹 + 发反馈」,从不跟踪反馈发出之后发生了什么——而反馈的价值恰恰只在事后才显现。
Rubric 评估:让 LLM 评委按一组预先构造的行为准则给轨迹打分,代替执行隐藏测试。Agentic Rubrics 先检查仓库再构造上下文接地的检查单;OpenHands Rubrics 从真实人机交互中学习固定行为特征。CER 继承这条线但做了两处关键改造:rubric 按任务与阶段自适应合成而非固定清单,且只在同父兄弟续跑组成的组内共享打分——这使它能在轨迹未完成时区分细微的行为差异。
二、定位与关联工作:两条谱系,两篇坐标
Opera:评论家谱系的「第三步」
| 相关工作 | 做法 | 与 Opera 的差异 |
|---|---|---|
| SWE-PRM(Gandhi et al., 2025) | 周期性审查轨迹近 8 步,按 12 类低效分类学给反馈 | 只按固定周期审查;Opera 是周期 + 事件混合触发,且反馈按持久笔记跟踪到解决 |
| SWE-Search(Antoniades et al., 2024) | MCTS 价值函数给上一步打分(−100~100)+ 文字评估 | 数值打分面向树搜索设计;Opera 的算子契约绑定证据与解决判据 |
| LLM-as-verifier(Kwok et al., 2026) | 给完成品按 1–20 细粒度打分 | 结果验证器;Opera 复用其「显式判据」思想但用于过程中 |
| Agentic Rubrics(Raghavendra et al., 2026) | 仓库接地 rubric 检查单给补丁打分(不执行测试) | 评的是完成品;Opera 在执行中介入,且每条笔记自带解决判据 |
| Reflexion(Shinn et al., 2023) | 跨尝试的言语反思记忆 | 反思在下一次尝试才生效;Opera 在当前轨迹内闭环 |
一句话定位:Opera = 过程评论家的时机感 + 结果验证器的判据感,再加上前两者都没有的「反馈后果跟踪」。 论文引用 Vasudev et al. (2026) 的发现作为动机——「准确的失败预测并不意味着有效的失败预防」,误导性干预会打断本会成功的轨迹,这正是 Opera 花大力气做审计的原因。
CER:奖励预测谱系的「提前量」
| 相关工作 | 做法 | 与 CER 的差异 |
|---|---|---|
| SWE-RM(Shum et al., 2026) | 训练执行无关的生成式 resolved/unresolved 分类器 | 需要完整轨迹;且在 Qwen 3 Coder 在策略数据上训练,对策略/脚手架漂移敏感(Nemotron 上落后 CER 最佳 6.0pp) |
| OpenHands Critic(2025) | 从终端单测结果传播 TD 目标训练 critic 模型 | 学得的 critic 同样对策略漂移敏感,且要求前缀可比 |
| OpenHands Rubrics(Wang et al., 2026b) | 从人类反馈学习的固定行为 rubric | 固定准则太粗,无法区分同组候选(top-tie 率极高) |
| Agentic Rubrics | 任务自适应 rubric 评完成品 | 同样需要完成轨迹,不能提前预测 |
| Monte Carlo PRM(AgentPRM 等) | 采样后缀估计状态价值 | 长程 agent 采后缀不可行(rollout 本身就是最大成本) |
| ARBOR(Liu et al., 2026) | 可复用 rubric 缓冲给多跳 QA 加过程分 | 短程轨迹完成后打分;CER 在长程编码 rollout 结束前预测 |
一句话定位:CER 是第一个把「终端奖励预测」明确为问题、并证明其足以支撑测试时搜索与 RL 训练两个下游的工作——比 PRM 更接近结果、比结果验证器更早、比两者都便宜。
三、问题定义
Opera:反馈即需要跟踪至解决的干预
长程编码 agent 需要及时纠正,但反馈在误判进行中的工作或没触及根因时可能无效甚至有害。把评论家反馈视为价值只在事后才显现的干预,引出三个挑战:
- 何时介入:周期性反馈可能来得太晚,而并非每个执行事件都需要纠正——agent 重复失败命令几次才等来下一次审查,或者被不必要的反馈打断本会成功的轨迹;
- 反馈是否有据:看似合理的诊断可能误读部分证据,把本会成功的工作引向歧途;LLM 评委即使在验证定义良好的准则时也充满噪声(论文引 RuVerBench 证据);
- 干预是否奏效:agent 可能遵从了建议(照做了)但底层失败依然原样——「遵从」(adherence)不等于「解决」(resolution)。
CER:从前缀预测终端奖励
给定未完成前缀 h_t(可见的工具输出与工作区 diff,不含未来动作、最终补丁或评测结果),估计其未来终端奖励 V(h_t) = P[y=1 | h_t]。与 PRM 的区别:PRM 评估局部动作的奖励,CER 评估当前交互对最终成功的蕴含。关键的理论放松是:下游任务(排名、组相对优势)只依赖组内成对顺序保持(论文 Eq. 2),不要求跨任务校准——这把「预测概率」的难题降为「组内排序」的难题,正是 CER 全部方法设计的支点。
四、解法
Opera:以持久化笔记为组织核心的三件套
① 混合审查调度。固定间隔审查反应太慢(agent 可能在下次审查前重复失败命令多次),纯事件触发又会漏掉安静型失败(自信地编辑错文件)。Opera 两者结合:每 k 轮周期性审查(默认 5 轮,DeepSWE 长任务 10 轮)+ 五类事件即时触发——Idle(无可见进展)、Repeat(重复动作)、Error(动作/工具失败)、Claim(宣称完成)、Submission(最终补丁提交)。同时信号合并为单次审查,事件触发会重置周期计时器。最重要的设计是:审查不等于干预——评论家可以选择沉默,让 agent 继续。
② 九个类型化算子 + 契约。自由形式的批评往往泛泛而谈(「考虑边界情况」)或混杂多个问题,agent 无从下手。Opera 要求每个诊断使用一个类型化算子,按代码修复阶段组织成五阶段九算子:
- Search:repo_localization_search(目标未定位)、implementation_target_shift(编辑错误目标);
- View:implementation_readiness_review(修复已明确却还在重读代码)、failure_signature_triage(误读工具输出);
- Edit:requirement_contract_review(违反需求契约)、diff_scope_review(改动缺失或无关)、state_transition_review(执行逻辑错误);
- Test:minimal_repro_or_focused_verifier(下一步决策缺证据);
- Submit:submission_readiness_review(证据不足却宣称完成)。
每个算子按 Design by Contract(Meyer, 1992)范式规定:适用条件(When)、所需证据(Evidence)、可请求的修正(Correction)、解决判据(Done when)、排除项(Excludes)。排除项防止算子重叠,解决判据提供后续关闭检查的依据。每次审查至多开一条笔记——避免指令互相竞争,让后续结果可归因到具体修正。每次输出要么是 continue,要么是「一个有据的问题 + 最小修正」。
③ 审计化笔记管理。笔记有 open/closed 两态,至多一条 open。因为评论家本身是 LLM、诊断可能「看似有理实则错误」,两个审计把控全生命周期:
- 准入审计(admission audit):创建与更新时核查证据是否支持诊断、修正是否必要、提议的检查能否确认解决;拒绝与任务无关的可选清理、无新证据的重复提醒。被拒提案不改变当前笔记。审计只接受或拒绝,从不改写提案——是验证者而非共同作者。
- 发布审计(release audit):关闭笔记须对照固定解决判据(而非最新指导)给出执行证据——行为要求须有执行结果,静态要求须有可见编辑。防止「最新建议看起来被照做了就关闭」。
- 更新可换算子换指导但保持笔记身份与判据不变——目标固定,建议改进。
依从性由规则检查(是否尝试了修正),解决性由 LLM + 审计判断,两者严格分离。实现上是 agent 模型端点前的代理:harness 无需改动、评论家从不执行命令/访问文件/跑测试,只在转发的请求中至多插入一条消息;评论家故障时请求原样转发——监督者永远不能阻塞被监督者。
CER:组条件 rubric 的两个场景实例化
公共核心:为当前任务与阶段合成自适应 rubric 集 R = {(准则 r_k, 权重 w_k)},judge 对组内每条前缀按每条准则给「证据 + 分数」,加权归一得分 s(h)。经验库的构造逻辑是:对历史任务中「rubric 判序与真实终局判序不一致」(pairwise 准确率 < 0.5)的组,让强教师模型生成一条结构化经验(适用情境/可观察触发/弃权条件/该奖什么该疑什么的教训/参考 rubric),只有回灌后判序确实改善的经验才被接受入库——经验本身就是被验证过的纠偏知识。
TTS 场景(Algorithm 1):束搜索式扩展 + 四个经验性组件——
- 回归停止:得分低于父前缀的续跑不再扩展,防止沿错误方向继续烧算力;
- 束父扩展:多个领先父节点并行扩展而非只留最优,保持多样性;
- tie-breaking:judge 初判常聚焦主要差异导致大量同分,对并列者生成只条件于并列续跑的额外区分 rubric 再打分;
- 检索经验库:BM25(四视图查询:任务描述/阶段/任务契约/状态摘要,加权倒数排名融合)取 top-6 经验注入 rubric 生成。
RL 场景:离线用教师模型从带验证奖励的历史 rollout 组蒸馏任务专属 rubric——教师先比较不同终局的续跑提出准则,权重经扰动鲁棒的坐标搜索优化(对打分加 ±1 扰动共 200 组,最大化扰动平均 pairwise 一致率,pairwise 准确率 66.41%→72.88%)。在线 rollout 在 40 步截断,组中心化 rubric 奖励替代终端验证器供 DPPO 更新,配弃权门控:judge 先做组级「实质不可区分」直判,加上组内加权分数极差 ΔR < 0.18 的组一并弃样重采——因为 judge 噪声会被组归一化放大,宁弃勿噪。
五、评估证据
Opera:三基准 × 四策略 × 三评委模型
主结果(策略 Qwen3.8-27B,评委 GPT-5.6-Sol):
| 方法 | TB-2.1 | SWE-Pro | DeepSWE |
|---|---|---|---|
| Non-critic | 65.9±1.7 | 75.3±1.2 | 32.4±1.0 |
| SWE-PRM | 68.9±3.2 | 77.7±2.5 | 36.6±3.1 |
| SWE-Search | 70.0±4.7 | 77.3±3.8 | 38.6±4.4 |
| LLM-as-verifier | 71.2±2.6 | 78.7±2.3 | 38.9±2.3 |
| Agentic Rubrics | 71.9±4.5 | 78.3±3.2 | 39.5±2.8 |
| Opera | 73.8±2.3 (+7.9) | 79.3±3.5 (+4.0) | 41.3±3.1 (+8.9) |
三基准均值全部第一(领先最强基线 1.9/0.6/1.8pp)。跨四策略模型最大增益 +12.4(Qwen3.5-9B, TB)/ +15.0(Qwen3.5-9B, SWE-Pro)/ +8.9(DeepSeek-V4-Flash, DeepSWE)pp——弱模型获益更大,但能力为零处评论家无效(Qwen3.5-9B 在 DeepSWE 上无论有无 critic 都是 0%)。
消融链条:
- 去双审计:TB +7.9→+2.6(损失约 2/3)、DeepSWE +8.9→+4.5(约半)——误导性干预的代价极高,审计是过滤有害干预的闸门;
- 算子消融:仅 Edit 算子保留大部分增益(+6.0/+3.7/+7.7);非 Edit 算子以约 1/5 的笔记量在 TB/SWE-Pro/DeepSWE 上恢复过半/四分之三/五分之四增益;
- 自评有效:33 个策略-基准-评委组合中 32 个有效;DeepSWE 上 Qwen3.8-27B 自评 +6.2pp,与 Claude 相当——收益大头来自框架(时机、类型化、跟踪)而非评论家的额外知识;
- 训练配方:Opera 引导的自反思轨迹 SFT Qwen3.5-9B,held-out SWE-Pro 仓库 +10.2pp(38.9% vs base 28.7%),追平教师蒸馏(39.5%);换 harness 后 TB-2.1 保持 25.8% 而教师蒸馏崩至 7.9%——近似在策略数据 + 专家诊断注入上下文,规避了蒸馏的分布漂移遗忘。
CER:TTS 与 RL 双下游(SWE-bench Verified 全 500 实例)
TTS(RM@8,token 含在线 rollout 与 judging):
| 方法 | Nemotron 3 Ultra RM@8 | Tok./Ins. | Qwen 3.6 27B RM@8 | Tok./Ins. |
|---|---|---|---|---|
| SWE-RM | 61.6 | 25.67M | 67.6 | 5.27M |
| OpenHands Critic@20–80 | 57.8–60.4 | 3.91–10.25M | 63.4–64.6 | 1.57–4.65M |
| Agentic Rubrics | 62.8 | 25.51M | 65.6 | 5.36M |
| Adaptive Rubrics(最强基线) | 63.4 | 25.95M | 69.4 | 5.38M |
| CER@20 | 64.8 | 3.96M | 68.6 | 1.89M |
| CER@60 | 67.6 | 9.14M | 71.4 | 5.01M |
- Nemotron:CER@20 即超最佳基线 1.4pp 且省 84.7% token;CER@60 达最高 67.6%(+4.2pp,省 64.8%);
- Qwen:CER@60 达 71.4%(+2.0pp);40 步预算即超基线 0.8pp 且省 25.8%;
- 区分度:Agentic Rubrics 的 top-tie 率(多轨迹同得最高分)57.2%/88.8% vs CER@20 仅 11.8%/3.0%——既有 rubric 粗到无法区分组内候选,组条件精修是关键;
- Random→Oracle 差距闭合率:Adaptive Rubrics 27%/35% vs CER 51%/49%;
- 消融:去兄弟比较(同父续跑联合评判)最伤,平均 RM@8 降 3.0/4.0pp——最关键组件;去经验库 −2.3/−1.3pp;去束父 −2.3pp;去 tie-breaking −0.5/−0.8pp。
RL(Qwen 3.5 9B 三折,SWE-bench Verified):
| 方法 | Fold 0 | Fold 1 | Fold 2 | 均值 |
|---|---|---|---|---|
| Qwen 3.5 9B(base) | 44.6 | 43.1 | 45.6 | 44.5 |
| TMax(全轨迹) | 49.7 | 49.1 | 50.3 | 49.7 |
| TMax-40(全轨迹奖励,40 步更新) | 49.6 | 49.1 | 50.7 | 49.8 |
| CER(40 步截断 rubric 奖励) | 52.7 | 49.8 | 52.4 | 51.6 |
- 超 TMax +1.9pp 的同时在线 token 省 52.7%(匹配检查点上 TMax 平均 60.2 轮/轨迹 vs CER 37.3 轮);
- 弃权率 9.9% vs TMax 零方差组过滤 34.3%——43.8% 的二元同终局组中 CER 仍能训练 83.3%(rubric 分数仍有差异),把「无效组」变成「有效组」是比省 token 更深的收益;
- 经验迁移有方向性:Qwen(强)经验给 Nemotron 每轮 +1
2pp,反向给 Qwen 掉 57pp——经验库会传递判断力,也会传递判断力上限。
合并速览
| Opera | CER | |
|---|---|---|
| 信号方向 | 向内诊断(哪里错了) | 向前预测(结局如何) |
| 作用时机 | 执行中任意轮(事件+周期触发) | 固定截断点(40 步前缀) |
| 核心机制 | 持久笔记+契约算子+双审计 | 组条件 rubric+经验库 |
| 主增益 | +7.9/+4.0/+8.9pp(resolve rate) | +4.2pp RM@8 / +1.9pp RL |
| 效率 | 每轮至多一条消息插入 | 省 84.7% token / 52.7% 在线 token |
| 关键消融 | 去审计损失 2/3 增益 | 去兄弟比较 −3.0/−4.0pp |
六、根源解释:为什么各自有效
Opera:为什么「评轨迹+发反馈」不够
三个失效源与三件套一一对应,消融给出量化证据:
- 误导性诊断的代价有多高:去双审计后 TB 增益从 +7.9 掉到 +2.6——放行全部提案意味着大量「看似合理」的干预涌入,其中误读中间证据者会把本会成功的轨迹带偏。TB-2.1 恰是中间证据最易误读的基准(终端任务的工具输出噪音大),审计的价值与之成正比。这不是假设:论文自评实验里 self-critic 的提案近半被预过滤(其中大头是「不断开新笔记而不跟进已有笔记」),过滤后弱评论家的干预频率被拉到与强评论家相当——框架的纪律性在替代评论家的判断力。
- 「一次一条笔记 + 固定判据」的归因收益:每条笔记有固定 ID 与解决判据,后续审查有历史可依——评论家在跟进自己的反馈而非每次从头开始。发布审计对照初始判据(而非最新指导)关闭,杜绝「指导漂移后自我满足」。「遵从≠解决」的分离则防止 agent 照做建议、测试仍挂时提前关闭(论文 Figure 3b 的例子:guard 加了但 test_empty 仍 FAIL——遵从了,没解决)。
- 为什么弱模型获益最大而零能力处无效:弱模型错误多且自身难以发现纠正,评论家供给的是「执行时忘记使用的知识」——自评有效的证据表明模型「知道」但执行时「没用上」,框架的时机与结构恰好把知识在正确的时刻注入上下文。但评论家不能替代能力:Qwen3.5-9B 在 DeepSWE 上连可行的起点都产生不了,反馈无处着力。评论家的价值上界是「策略可及但未达的空间」。
CER:为什么组内比较 + 检索校正比训练 RM 更稳
- 训练 RM 的漂移脆弱性有实证:SWE-RM 在 Qwen 系在策略数据上训练,落到 Nemotron 上落后 CER 最佳 6.0pp,落在 Qwen 3.6 27B 上只落后 3.8pp——缺口差与策略/脚手架距离成正比。CER 不训练参数化评分器,rubric 每次按当前组现场合成,「评分器」永远在分布内。
- 兄弟比较为什么是最关键组件:同父续跑只差「父前缀之后的分支决策」,共享前缀天然控制了任务难度与阶段——组内分数差异只反映行为差异。这正好满足 Eq. 2 的组内序保持条件:judge 只需在同准则下比较相对好坏,无需跨任务校准。去掉兄弟比较(每条续跑单独开 rubric 评)平均掉 3~4pp,且 @20 掉得最狠——早期候选假设最发散时,对比信息最值钱。
- 早期信号为什么存在:token 熵前 40 轮 0.399 nats > 后 40 轮 0.312——策略不确定性集中在前段,后段动作被累积的轨迹状态约束。这与「自纠偏多为局部而非假设级」的定性观察互证:agent 会从无产出的检查中恢复(多开几个相关文件),却极少放弃最初的错误根因假设——假设级错误在前 40 步已基本定型,所以前 40 步足够预测。但也别过早:10/20 步预算的训练分别只有 48.1%/48.3%(vs 40 步 52.7%),标注显示编辑与验证的中位进入轮次是 22/28——前缀必须含实现与验证证据,纯探索行为本身不是好指标(即便拿到金补丁目标文件,覆盖率预测终局的 AUROC 峰值也只有 0.608)。
- 弃权门控为什么必要:组归一化会放大 judge 噪声——同终局组硬打分等于给随机梯度加权。让 judge 先做「实质不可区分」直判 + 分数极差阈值过滤,把可教组(rubric 有差异的 83.3%)与噪声组分开。这是「知道何时不评分」的工程化。
- CER 不能当 PRM 用(论文诚实检查):对同一轨迹每 10 步单独打分,分数随步数单调升(0.431→0.852)而二元交叉熵恶化(0.755→3.514)——judge 越来越自信但并不更准,长度偏置明显。CER 只在固定截断点的组间比较中成立,跨时间点的分数不可比。
交叉验证:概念坐标的外部锚点
- Test-time compute 的系统化研究(Snell et al., 2024 起)确立了「推理算力作为可分配资源」的范式,两篇论文都是把这份资源投向「监督」而非「更多候选」的具体化;
- Process reward model 自 Math-PRM(Lightman et al., 2023)以来在数学推理成熟,但向 agent 场景迁移时遇到了轨迹更长、标注更贵、分布更漂移的三重摩擦——CER 的「不做 PRM 做组内排序」与 SWE-Shepherd 等坚持训练 PRM 的路线构成当下 agent 奖励建模的分岔口;
- 「LLM 评委有噪声需驯化」已成方法学共识(RuVerBench、JET 等同期工作):Opera 用审计 + 契约,CER 用经验库回灌验证 + 弃权门控——同一共识的两种工程回应。
七、知识反推:从两篇论文倒推领域公共知识
把论文当成领域现状的探针,可以反推出 2026 年长程编码 agent 监督的几条公共认知:
- 「评完就完」的评论家已被判定不够——Opera 的框架化(时机/判据/跟踪三件套)之所以成立,是因为领域已默认:无跟踪的反馈在长程任务里净值可以为负。这与 Vasudev et al.「准确预测失败≠有效预防失败」互为印证;
- 执行无关的奖励预测是真实需求——CER 不是省 token 的锦上添花:测试执行本身是 agent 训练的效率瓶颈,SWE 类评测还有假阳/假阴(官方验证器也不完全可信),「终端验证器不够用」已是公开事实;
- 组相对比较是 agent 场景的默认评价单元——GRPO 式组内归一化从 RL 奖励蔓延到 judge 打分(CER 的组条件 rubric),「绝对分数不可信、相对顺序可用」成为 LLM-as-judge 的操作性共识;
- 「评论家知识 ≈ 策略自身知识」的边界被摸清——Opera 自评有效说明框架结构贡献大于评委模型的知识增量;CER 经验迁移的方向性说明蒸馏来的判断力有上限且会反噬——监督信号的可迁移性比强度更稀缺;
- 40 步是个有内容的数字——CER 的截断点由行为学锚定(编辑中位 22 轮、验证 28 轮、熵前高后低),Opera 的周期 5 轮、事件三连失败触发——两套完全独立的方法在时间尺度上互相印证:长程轨迹的「命运窗口」在前 1/3。
八、通用灵感
- 反馈的价值在发出之后才确定——所以要有反馈的生命周期管理。Opera 的笔记(开启-投递-跟踪-关闭)可以迁移到一切「建议发出后世界会继续演化」的场景:code review 意见要跟踪到修复验证,运维告警要跟踪到根因消除,「遵从了建议」和「解决了问题」必须是两个独立的检查点。
- 把自由生成的输出塞进类型系统,是驯化 LLM 输出的通用手段。九算子 × 五字段契约让「诊断」这个模糊动作变得可审计、可拒绝、可关闭。任何 LLM 参与的流程都值得问:它的输出能不能被赋予 schema 和验收条款?
- 监督者只应有一条影响通道,且永远不能阻塞被监督者。Opera 作为代理「至多插一条消息、故障即透传」的设计是监督系统的好品味——fail-open 而非 fail-blocking,单一通道使归因干净。
- 当绝对校准不可得时,设计成组内相对比较。CER 的 Eq. 2 松弛(组内序保持即可)是可泛化的工程哲学:排名类任务不需要校准的分数,只需要一致的序——「把不可测的问题约化成可比较的问题」。
- 对照组要共享前缀。同父兄弟续跑是「控制变量」在 agent 评测里的自然形态:共享前缀控制了任务与阶段,差异只剩分支行为。凡是要评估「行为导致的结果差异」,先问能不能构造共同起点的对照组。
- 知道何时不判断。CER 的弃权门控与 Opera 的「审查可以沉默」是同一美德:噪声信号经过归一化/放大后会变成系统性伤害,克制是监督系统的正确组件而非缺席。
- 经验要被验证后才能入库。CER 的经验库只接受「回灌后判序确实改善」的条目——这把「教训」从叙事变成了可回归测试的资产。任何组织的经验库都值得配一套准入回归。
- 监督框架可以让弱监督者逼近强监督者。Opera 的过滤纪律把 self-critic 的干预质量拉到强评委水平——当判断力不足时,流程纪律是可替代的补丁,这个结论对人类组织同样成立。
一句话总结:Opera 证明「发反馈」只是监督的开始——持久笔记、固定判据与双审计让干预的后果被跟踪,误导性诊断被拦在投递之前;CER 证明终端奖励不必等终端——组条件 rubric 与检索经验让 40 步前缀的组内排序就足以指导搜索与训练。一个把监督做成有生命周期的干预,一个把预测做成有对照的排序,合起来是长程 agent 测试时监督的当下答案:信号要早、要有据、要跟踪、要知道自己什么时候该闭嘴。