论文链接:https://arxiv.org/abs/2608.21027
发表时间:2026 年 8 月(arXiv:2608.21027v1,2026-08-21 提交)
发表机构:新加坡国立大学(National University of Singapore, NUS)
作者:Yanze Jiang*、Mingxuan Li*(共同一作)、Yuhao Wang、Shengfang Zhai†、Jiaheng Zhang†(通讯作者)
领域分类:cs.AI / cs.CL —— LLM Agent 运行时干预(Runtime Intervention)
一、论文背景
1.1 什么是运行时干预
LLM Agent 正在被越来越多地用于长程(long-horizon)任务:多步网页购物、家庭操作、客服对话——这些任务需要模型连续做出几十个决策,每一步都可能改变环境状态、消耗有限的交互预算。问题在于,一次糟糕的局部决策可能让后续恢复变得极其困难:网页购物里点错了筛选条件,后面几十步都在错误的结果集里打转;客服对话里错误调用了退款工具,状态已经改变、无法回头。
运行时干预(Runtime Intervention) 提供了一条不改模型本身就能提升可靠性的路:在轨迹执行过程中实时监控,必要时扣住危险动作、改道执行。注意论文选的干预时机很讲究——执行前干预:actor 已经提出了动作 at,但还没发给环境,此时外部机制可以决定放行还是拦截。这对应强化学习安全领域经典的 human intervention 与 shielding 范式。
1.2 为什么只检测失败是不够的
直觉上,做一个「失败预测器」就够了——预测当前轨迹要失败就干预。但 2026 年的一项研究(Vasudev et al., 2026)给了一个反直觉的结论:准确的失败预测器也可能降低端到端性能,因为它会把那些「看起来要失败、但其实会自己走出来」的成功轨迹也打断。另一项工作(Zhang et al., 2026)进一步指出,有效的运行时控制应该取决于「可用的干预是否真的改善下游结果」,而不是「继续走下去风险有多大」。
换句话说,有用的干预必须同时回答两个问题:什么时候打断,以及打断之后往哪走。只喊「停」而不给恢复方向的干预,很可能帮倒忙。
1.3 现有方法的两难
要把「往哪走」也回答了,现有方法得在干预通道里塞进相当的任务求解能力,形成两条路线:
- 专家接管:轨迹看起来不对时,把控制权交给更强的求解器(expert handoff)。问题明显——你得再雇一个「另一个能干的求解器」,成本直接翻倍。
- Critic 纠错:actor 保留控制权,另设一个 critic 检查它的提议并生成任务相关的纠错反馈(如 Asym-AC)。但要让反馈有用,critic 自己必须足够理解任务——想要做轻量级非常困难。
这就形成一个「成本跷跷板」:actor 本来就是负责解任务的,干预组件却必须再具备一遍足够的任务理解能力才能给出有用的纠正。这种冗余在工程上很贵。于是论文提出核心研究问题:
能否用一个微型辅助模型实现建设性运行时干预——它既不独立解任务,也不生成纠正内容?
用一个比喻:主厨(actor)做菜时,你请一位顾问在旁边盯着。现有方法要么请另一位大厨来接管灶台,要么请一位懂行的美食评论家现场写改进意见——都很贵。这篇论文问:能不能只请一位不懂做菜、但尝得出哪盘更好吃的试吃员?
1.4 两个技术挑战
把问题压缩到「微型模型」上,有两个拦路虎:
- 建设性:干预不能只给二元警告,还得给出有用的重规划方向。但让微型模型自己去发现这个方向,等于把开放式任务求解塞回给它,违背初衷。
- 长期后果:干预应反映当前决策的长期后果,而非表面合理性。为任意状态-动作对学准确的绝对价值 Q(s,a) 在长程任务里出了名地难(信用分配问题);而直接比较不同轨迹里观察到的动作,又会把「动作本身的效应」和「历史与后续策略的差异」混在一起——不可比。
二、论文定位与关联工作
2.1 相关工作的三条谱系
运行时干预谱系:从 Saunders et al. (2018) 的人类干预监督式 blocker,到 Alshiekh et al. (2018) 的 shielding(反应式安全层拦截违反时序逻辑规范的动作),再到面向 LLM Agent 的 ShieldAgent、AgentSpec、ProbGuard(从事后规则到主动概率监控)。这条线的重点是「安全执行」,而 Vasudev et al. 和 Zhang et al. 揭示了「准确预测 ≠ 有效干预」。
弱助强谱系(Weak Critics for Strong Actors):Kirchner et al. 的 prover-verifier games、W4S(7B 元代理调度更强的 GPT-4o)、RAG-Critic(3B 误差 critic)、CGI(8B critic 生成可执行反馈)、Asym-AC(开源 critic 监控更强闭源 actor)、弱 critic 强监督(弱 critic 只需提供有用的修改方向)。这条线一直在问:辅助模型最小需要多强?
测试时计算分配谱系:AgentPRM 式的过程奖励模型——给采样的候选动作打绝对 Q 分,选最高分执行;Self-Reflection 式的自省——actor 自己检查自己一遍。
2.2 COTA 的定位:两处关键收窄
COTA 在这张图上的位置很清晰,它对上述谱系做了两处收窄:
- 能力原语的收窄:从「任务求解 / 完整 critique」收窄到「局部配对比较」——比 W4S、RAG-Critic、CGI 那些仍然要理解任务的 critic 更激进,0.5B 即可胜任;与 AgentPRM 的绝对 Q 评分相对(后者要求小模型输出有意义的绝对分数,在稀疏二元回报环境里尤其困难)。
- 干预方式的收窄:从「强制执行被选动作」(AgentPRM 的 forced top-1)改为「非绑定建议 + actor 重规划」。Self-Reflection 依赖模型逃出自身错误推理(实验证明九组全降),Asym-AC 依赖 critic 理解任务给出自由文本纠错——COTA 的比较器只输出「A 还是 B」,纠正后的规划完全留给更强的 actor。
一句话:COTA 不是又一个小 critic,而是把「干预」这个任务重新定义成「比较」。
三、问题定义
3.1 形式化
论文先把设定写干净:冻结的 LLM actor π 与环境交互,在第 t 步观察到 ot、产出推理 pt、提出动作 at。执行前轨迹前缀记为 τt,决策状态 st = (x, τt)。动作价值采用标准 RL 定义:
Q^π(st, a) = E[R(τ) | st, at = a, 之后仍由 π 控制]
即在当前状态下做 a、之后交还给同一个 actor,完整轨迹回报的期望。建设性干预的定义:扣住 at 时额外给同一 actor 一个建议动作 a_adv,且要求 Q^π(st, a_adv) > Q^π(st, at)——建议确实指向更好的局部方向;最终期望 actor 吸收信息重规划出 a’t,使 Q^π(st, a’t) > Q^π(st, at)。
3.2 核心抽象与关键洞察
把多余的形式剥掉,这篇论文研究的问题可以抽象成一句话:
当辅助模型的任务能力远弱于 actor 时,如何提供有效的运行时干预?
而它给出的关键洞察是:比较判断的认知负担远低于生成与绝对评估。
- 判断「这个动作的绝对价值是 0.7 还是 0.3」,需要理解任务全局、完成长程信用分配;
- 判断「A 和 B 两个动作哪个会导致更好的后续」,只需要一个序数判断——哪怕判得不完美,错一次的成本远低于估错绝对值。
就像考试:估分(绝对评估)要求你每道题都会做;判断两份答卷哪份更好(配对比较),你只需要识别出明显更好的那份——即使你自己未必做得出来。
3.3 候选相对支配率
方法建立在一个统计量上。设 μ(·|st) 是决策点上可执行候选动作的参考分布,定义候选相对支配率(candidate-relative domination rate):
ρ_μ(st, at) = Pr_{A~μ}[Q^π(st, A) > Q^π(st, at)]
直白解读:如果 ρ = 0.8,说明候选分布里 80% 的动作都比 actor 的提议更好——提议大概率是个糟糕的局部选择;ρ = 0.1 则说明提议已经优于绝大多数普通备选。妙处有三:
- μ 不需要是专家策略,也不需要包含最优动作——只看普通备选是否频繁打败提议;
- 1−ρ 就是提议在候选价值分布中的分位数,有清晰的秩解释;
- 打败提议的那些备选天然就是重规划的建议——「何时打断」和「往哪走」来自同一个统计量。
于是建设性运行时干预被归约为一个极窄的原语:给定同一状态,两个动作中哪个在同一个 actor 手里会导致更好的后续?
四、问题解法:COTA
COTA(Comparison-Only TinyAdvisor)的完整流程如下。
4.1 数据构造:同前缀反事实分支
训比较器需要「同一状态下两个动作谁更好」的监督信号。直接拿不同轨迹的回报来比是不行的——前文说过,这会把动作效应与历史、后续策略的差异混淆。
论文的做法借鉴经典 Monte-Carlo rollout 评估(Tesauro & Galperin, 1996;Bertsekas & Castanon, 1999),用同前缀反事实分支(same-prefix counterfactual branches):
- 先让冻结的源 actor(Qwen3-8B)跑完一条基础轨迹;
- 轨迹终止后,选取若干决策点(默认取 min(⌈0.5T⌉, 10) 个时间分层点),恢复环境到该精确前缀(环境不支持快照时重置任务并重放之前的动作);
- 在每个恢复点上,只改变分支点动作(保留基础动作 + 最多 5 个不同合法备选),分支之后交还给同一个冻结 actor 继续跑到终止,用下游环境结果作为分支回报 Y(st, a)。
关键性质:E[Y(st, a)] = Q^π(st, a),且所有兄弟分支共享相同前缀与相同续跑 actor,因此两个兄弟动作 aA、aB 的回报之差干净地隔离了「只改变分支点动作」的下游后果。分支只做一层(不递归),数据线性增长而非爆炸。任务级切分保证同一任务的兄弟分支绝不跨训练/验证/测试集。
对每个动作对,用 M 次独立续跑的均值估计 Q̂_M,标签 B̂ = I[Q̂_M(st,aA) > Q̂_M(st,aB)]。实现上实际是三分类 A/B/T:差距超过阈值 γ_e 才给方向性偏好,差距落在平局区内标 T(WebShop 有连续部分奖励用正 margin;ALFWorld 和 Retail 是二元结局,γ_e=0,1 对 0 有偏好、1 对 1 和 0 对 0 是平局)。平局对被降采样到约 20% 防止同结局兄弟淹没学习信号;每个物理动作对做两个方向的数据增强((A,B) 和 (B,A) 都进训练集)。最终得到 WebShop 55k、ALFWorld 23k、Retail 9k 条监督样本。
4.2 比较器训练
比较器就是全参微调(bf16)的 Qwen2.5-0.5B-Instruct。训练样本输入是 actor 可见状态 + 有序动作对 (aA, aB),目标输出是 A / B / T 三者之一。注意两条纪律:比较器看不到 actor 的私有思考、分支结局或未来状态——只依据「任务 + 可观测轨迹 + 当前状态 + 两个候选动作」做判断。
部署时把三分类映射回二元判断,且要求双向一致:只有 (st, aA, aB) 预测 A、且 (st, aB, aA) 预测 B(交换顺序后语义一致),才记 aA 击败 aB;T 预测、顺序不一致、格式错误一律 fail open(不算胜)。这让部署比单次分类更保守。附录消融显示 A/B/T 训练比纯 A/B 训练的偏好一致性从 39.51% 升到 57.70%,格式有效率从 86.16% 升到 99.53%。
4.3 干预触发与建设性干预流程
每个决策点上的完整流程:
- actor 提议 at ~ π(·|st);
- 从参考候选机制 μ 采样 K 个可执行备选 A1..AK(候选来源三种:环境合法动作、离线检索的接地动作、0.5B 小 LM 在线提议并经规范化与合法性过滤;WebShop 主要用环境动作,ALFWorld 用环境动作(强 actor 加小 LM),Retail 用小 LM + 离线回填);
- 微型比较器对每个 Ai 判 e_i = Cθ(st, Ai, at):Ai 是否击败提议;
- 若至少 R 个备选稳定击败提议(Σe_i ≥ R)则扣住提议;否则原样放行;
- 触发干预时,用同一比较器对胜者排序,排名最高的候选作为非绑定建议 a_adv 返还给 actor——反馈只是短结构化消息:「你的提议未必是最好的下一步,更优备选如下,请结合当前状态重新输出应执行的动作;建议不具约束力」;
- actor 在同一决策状态上条件于建议重规划出新提议 a’t,新提议再过一遍审查,然后执行。
K、R 是仅有的两个干预预算超参:WebShop/ALFWorld 用 K=4, R=1,Retail 用 K=4, R=2,均用留出验证任务的端到端性能选定后冻结(而非比较器精度)。
统计解读:胜者计数规则是支配率 ρ 的 Monte Carlo 估计——记 K 个备选的预测胜率为 ρ̂,则触发条件等价于检验「提议被至少 R/K 比例的候选分布支配」。命题 3.1 给出精度保证:|ρ̂ − ρ| ≤ ε_θ + √(log(2/δ)/2K),其中第一项是比较器误差,第二项是有限候选采样误差(Hoeffding 界,无放回抽样同样成立)。当真实支配率离阈值足够远时,学习到的门控与先验已知的理想门控以至少 1−δ 概率做出相同决策。同一个比较原语同时供出了「何时打断」(支配率过阈值)与「往哪走」(击败提议的备选即建议)。
4.4 成本分析
在线开销:九组设置平均 1.38× 原始 actor 的端到端回合时间,其中七组低于 1.5×;开销最大在 Retail(候选生成要额外调小 LM)。有趣的是时间倍数可以低于 1×——有用的干预减少了完成任务所需的交互步数,DeepSeek-V4-Flash 在 ALFWorld 上甚至是 0.873×,加了顾问反而更快。
离线开销(H200 GPU 小时):WebShop 81.36(分支续跑占 78.65)、ALFWorld 31.15、Retail 8.42,且一次训练、全部 actor 复用——比较器不是为某个 actor 定制的,0.5B 的它给 8B、35B、284B 的 actor 都用同一套。
五、评估指标与实验证据
5.1 实验设置
- 三 actor:Qwen3-8B、Qwen3.6-35B-A3B(MoE,激活 3B)、DeepSeek-V4-Flash(284B,闭源);
- 三环境:WebShop(500 留出任务,平均奖励)、ALFWorld(134 个 valid-unseen 游戏,成功率)、τ3-Retail(40 任务 × 3 种子 = 120 回合,成功率,策略约束客服对话);
- 共 九组 actor×环境设置;DeepSeek 用成本控制的固定子集(WebShop 50 任务、ALFWorld 20 任务);
- 基线按推理时计算的用法组织:选择式(AgentPRM 式绝对 Q 评分 + 强制 top-1 执行)、测试时深思(Self-Reflection,保守自检一次)、运行时干预(Asym-AC,自由文本 critic 反馈后 actor 修改)。
5.2 主结果:九组全胜
| Actor | 环境 | 原始 | COTA | 时间倍数 | Self-Ref | AgentPRM | Asym-AC |
|---|---|---|---|---|---|---|---|
| Qwen3-8B | WebShop | 0.3960 | 0.5630 | 1.413× | 0.2610 | 0.3153 | 0.1785 |
| Qwen3-8B | ALFWorld | 82.84% | 90.30% | 1.138× | 75.37% | 2.24% | 35.82% |
| Qwen3-8B | Retail | 37.50% | 45.00% | 2.024× | 32.50% | 4.17% | 43.33% |
| Qwen3.6-35B | WebShop | 0.5662 | 0.6813 | 1.451× | 0.5546 | 0.4189 | 0.3454 |
| Qwen3.6-35B | ALFWorld | 85.07% | 94.03% | 1.302× | 79.85% | 8.96% | 71.64% |
| Qwen3.6-35B | Retail | 62.50% | 65.00% | 1.779× | 55.00% | 5.00% | 61.67% |
| DS-V4-Flash | WebShop | 0.6085 | 0.6867 | 1.009× | 0.4333 | 0.5128 | 0.2786 |
| DS-V4-Flash | ALFWorld | 90.00% | 95.00% | 0.873× | 82.50% | 10.00% | 75.00% |
| DS-V4-Flash | Retail | 80.83% | 82.50% | 1.472× | 67.50% | 3.33% | 70.00% |
三个观察:
- 九组全部提升,且全部优于三个基线。最有说服力的是跨规模:同一个 0.5B 比较器对 8B actor 有效,对强得多的 35B 与 284B actor 依然有效——它不是在给弱 actor 补课,而是捕捉「即使强 actor 也会偶尔做出明显次优的局部决策」这一事实。
- Self-Reflection 九组全降(如 Qwen3-8B WebShop 0.3960→0.2610),与已有结论一致:没有外部反馈信号的内在自我纠错逃不出模型自身的错误推理,甚至会把本来更好的方案改坏。
- AgentPRM 在 ALFWorld/Retail 上灾难性崩溃(2.24%、3.33% 等)——稀疏二元回报下,0.5B 模型估绝对动作价值尤其困难。附录诊断显示其绝对 Q critic 验证集排序精度其实不差(64%-69%),但在线校准极差:在 ALFWorld 上频繁把「合法但与子目标无关」的动作打到提议之上,强制模式下替换了超过 80% 的 actor 动作,直接摧毁性能。
5.3 2×2 消融:两要素缺一不可
消融两个设计轴:学习目标(绝对 Q 估计 vs 同前缀配对比较)× 干预机制(强制执行胜者 vs 建设性干预),两个 actor、三环境:
| 目标 | 干预 | WebShop 8B | WebShop 35B | ALFWorld 8B | ALFWorld 35B | Retail 8B | Retail 35B |
|---|---|---|---|---|---|---|---|
| 绝对Q | 强制 | 0.3153 | 0.4189 | 2.24% | 8.96% | 4.17% | 5.00% |
| 绝对Q | 建设性 | 0.5491 | 0.6447 | 57.46% | 63.43% | 16.67% | 17.50% |
| 配对 | 强制 | 0.3782 | 0.6041 | 51.49% | 50.75% | 16.67% | 37.50% |
| 配对 | 建设性 | 0.5630 | 0.6813 | 90.30% | 94.03% | 45.00% | 65.00% |
这张表是全文最重要的证据,两个方向单独看都成立:
- 固定绝对 Q,把强制换成建设性:ALFWorld 8B 从 2.24% → 57.46%,Retail 8B 从 4.17% → 16.67%——把最终决定权还给 actor 能救回大量性能;
- 固定建设性,把绝对 Q 换成配对:ALFWorld 8B 从 57.46% → 90.30%,35B 从 63.43% → 94.03%;Retail 从 16.67%→45.00%、17.50%→65.00%——把学习目标换成序数判断再救一大截;
- 但只有两者同时到位才到达 90.30%-94.03% 的完整效果。配对+强制的 50.75%-51.49%(ALFWorld)说明:哪怕判断是好的,替 actor 做决定仍然把 90% 级别的性能拖到一半。
5.4 行为分析:多样性注入而非接管
论文还验证了候选机制的真实作用。高温重复采样 actor 8 次,平均只产生 2.28 个不同可执行动作(利用率 28.5%),300 个前缀里 150 个完全坍缩到同一动作;而候选机制 4 个候选产生 3.71 个不同动作(利用率 92.7%)——多采样 actor 本身提供不了多少额外多样性,候选机制才是多样性的来源。
干预后 actor 的重规划行为分为 Adopt(采纳建议)/ Keep(保留原提议)/ Novel(新动作)三类。强 actor 并不盲从:DeepSeek-V4-Flash 采纳建议的比例仅 29.2%-32.9%,49.6%-63.6% 保留原提议;Qwen3.6 在 WebShop 采纳 67.8% 但在 Retail 只采纳 19.0%(51.4% 保留、29.5% 产出新动作)。重规划没有向候选分布坍缩——actor 保留着接受、拒绝或修改建议的自由,这正是非绑定设计的意图。
六、效果优势的根源解释
为什么「0.5B 管 284B」能成立?把消融证据串成一条因果链:
第一环:绝对 Q 评分隐含要求小模型有能力解任务。 估计 Q^π(s,a) 意味着对任意状态-动作对预判长期回报——这本质上要求估值者具备完成任务的全局理解,才能区分「合法但无关」和「真正推进子目标」的动作。0.5B 模型做不到:附录显示它的绝对 Q critic 离线排序精度尚可(64%-69%),但在线使用时把大量无关动作排在提议之上(ALFWorld 上强制替换率超 80%)。
第二环:强制执行放大了这个错误。 绝对 Q + 强制控制组只剩 2.24%-8.96%——小模型的每一个误判都被无条件执行,且 actor 被剥夺了修正机会,性能被彻底摧毁。这是「错误的判断 + 不可逆的执行权」的最坏组合。
第三环:配对比较把任务降维到 0.5B 可胜任的区间。 序数判断只需要识别「备选是否明显更好」,不需要给动作定价。同一个 0.5B 模型,在配对目标下就从「灾难性干扰源」变成「可靠的局部质量信号」。注意反事实分支的监督设计功不可没:它把比较信号与运行时需要的判断完全对齐(同一状态、同一续跑 actor、只差一个分支动作),训练分布与部署分布匹配。
第四环:建设性干预把最终决定权还给 actor,错误干预可被纠正。 即使比较器偶有误判,非绑定建议下 actor 可以保留原提议(实测强 actor 有 49.6%-63.6% 的重规划选择了 Keep)或综合出更好的第三方案;而强制模式没有这层容错。配对+强制组(ALFWorld 约 50.75%-51.49%)与配对+建设性组(90.30%-94.03%)之间的巨大差距就是这层容错的价值。
反事实证据:绝对 Q + 强制控制组 2.24%-8.96% 的灾难性结果证明,干预方式比干预能力更关键——同样是这个 0.5B 模型,换成配对判断和建设性建议,就从「毁掉任务」变成「九组全胜」。决定成败的不是顾问多聪明,而是你让顾问做什么、以及听劝的方式。
七、必要知识反推
要在这篇论文的方向上做出工作,需要储备哪些知识?
领域层:
- 长程智能体的失败模式:局部次优决策如何通过环境状态改变被放大;交互预算约束下的恢复难度;
- 干预时机问题:为什么失败概率不是正确的触发信号,「干预的下游收益」才是(Vasudev 2026、Zhang 2026 两篇的结论是本文动机的直系来源);
- 三类基准环境(WebShop/ALFWorld/τ-bench 系)的接口特性与评价指标差异。
方法论层:
- 配对偏好学习:Bradley-Terry 式的序数监督思想、平局/弃权机制、双向一致性校验;
- 反事实分支构造:Monte-Carlo rollout 评估传统(Tesauro & Galperin 1996)、on-policy 分支的均值估计性质(E[Y]=Q^π)、Hoeffding 界下的标签可靠性分析;
- Monte Carlo 门控的统计解释:支配率估计、阈值检验、比较器误差与采样误差的分离。
工程层:
- 三环境适配:候选动作来源的选择(环境合法动作/离线检索/小 LM 生成)与合法性过滤、规范化;
- 成本控制:K/R 超参的验证集选择、离线分支数据的一次构造多 actor 复用、闭源 actor 的评测子集控制;
- 小模型全参微调与 A/B/T 三分类接口的工程细节(fail-open 策略、方向增强)。
八、通用性灵感
跳出 Agent 干预这个具体场景,这篇论文有三条可迁移的设计原则:
1. 比较代替求解——相对判断是弱模型可承担的最小认知任务。 评估绝对价值要求全局理解,判断相对优劣只需要局部信号。这条原则可以推广到任何「弱模型辅助强系统」的场景:代码评审助手不必会写这个模块,只需判断两份实现哪份更可能通过测试;内容审核辅助不必创作,只需比较两个版本哪个更可能违规。当你想用小模型又怕它能力不足时,先问:这个任务能不能改写成配对比较?
2. 建议不强制——非绑定建议保留系统自主性是安全干预设计的通则。 强制执行把辅助模型的每次错误都变成系统级错误;非绑定建议让更强的主系统充当最后一道过滤器。这与人机协作里的「人类拥有最终决定权」(human-in-the-loop veto)完全同构:自动化系统可以高度自信地提建议,但决定权留给责任主体。消融表里配对+强制与配对+建设性之间近 40 个百分点的差距,就是这条通则最硬的证据。
3. 反事实分支造监督——同前缀分叉是构造配对标签的系统方法。 机器学习里「想要什么信号就构造能干净隔离该信号的实验」:固定前缀、只变一个动作、续跑交给同一策略,回报之差就只剩这个动作的因果效应。这个思路对任何需要「A/B 哪个好」标签的场景都适用——对话系统的两个回复、规划器的两条路线——只要环境可恢复(快照或重放),就能批量生产无混淆的配对监督。
附录:一图总结
actor 提议 at ──→ 采样 K 个候选动作
│
0.5B 比较器逐个判断:候选 Ai 比 at 好吗?
│
≥ R 个候选稳定胜出?(Monte Carlo 估计支配率 ρ)
│否 │是
↓ ↓
原样执行 at 扣住提议,胜者排序后
作为非绑定建议返还 actor
│
actor 重规划 → 新提议 → 再审查 → 执行
比较器全程只做一件事:判断两个动作哪个更好。规划、生成、执行始终属于 actor——「不解题,只比较」,正是标题的含义。