Risa: Routing-Guided Test-Time Scaling for Software Agents 精读
论文链接:arXiv:2608.22191 项目主页:CckFdu.com/RISA(代码发表后以研究友好许可发布) 发表时间:2026年8月 机构:复旦大学(Kang Chen、Junjie Nian 共同一作,Yixin Cao 通讯)+ 上海创新研究院——纯高校/科研院所 领域标签:cs.SE / cs.AI(LLM Agent 推理时扩展/可解释性)
一、论文背景
测试时扩展(Test-Time Scaling)是什么? 推理时多花算力换准确率:采样多个候选答案、并行跑多条轨迹、最后挑最好的。核心难题是仲裁——怎么知道哪个最好?现有方案:外部 judge 模型(贵、且与被评模型不同源)、执行测试(SWE 场景要跑完整测试套件,慢且常不可用)、文本共识(比较表面措辞相似度,被"套话"欺骗)。
被忽视的免费信号:MoE(混合专家)模型每次前向传播时,router 会为每个 token 选择专家——这个路由轨迹是模型内部计算分配的完整记录,推理时天然产生、零额外成本。它编码了"这个 token 的计算被分配到了哪类处理单元"——相当于模型的"脑电图"。此前 MoE 路由研究集中在训练效率与可解释性,从未被用作 Agent 决策信号。
本文的问题:路由轨迹能否充当 Agent 行为的"坐标系",让测试时扩展的探索与仲裁都基于内部信号而非外部 judge?
二、论文定位和关联工作
- 测试时扩展线(self-consistency/best-of-N):文本级共识是主流——Risa 证明路由级共识信息量更大(决策 token 定位解决稀释问题)。
- MoE 可解释性线:专家分工分析(哪些专家负责哪些知识)——本文把静态分析转为动态行为信号。
- SWE Agent 线(SWE-agent/OpenHands):多尝试+最终选择普遍依赖外部信号——Risa 提供"零外部依赖"替代。
三、问题定义
抽象问题:给定同一 MoE 模型产生的多个候选动作/补丁,构造一个只依赖模型内部路由遥测的相似度空间,使得"计算上相似"(而非"文本上相似")的候选落入同一区域,从而用路由距离实现探索(选远离历史的)与承诺(选同伴收敛的)。 难点:长补丁的路由指纹会被 diff 语法等高频 token 稀释——需要定位"承载决策"的 token 子集。
四、问题解法
4.1 路由指纹
每层每 token 的专家路由权重积分成 layer×expert 直方图,加权 Jaccard 距离比较。类比:把一次前向传播的"计算资源分配"拍成一张 CT 片。
4.2 角色门控
3 个角色质心(inspect/test/write)对动作分类——78,535 动作三分类留出准确率 0.940(多数类 0.746),write 类召回 0.93/精度 1.00。作用:不同角色不可比(探索一个测试方案与写一个补丁的路由没有可比性)。
4.3 三级决策
- 探索阶段"离异":候选与最近 64 步执行历史的路由最不相似者优先——新异性最大化(避免原地打转);
- 写补丁阶段"承诺":角色匹配的 write 候选组内,用带护栏的同伴收敛打分 z(H)+1.5z(M)+z(S̄)−z(P)(收敛加分、过度相似惩罚);
- 跨尝试终局仲裁:K=4 个独立尝试的最终 diff 各经一次 teacher-forced 重编码,取**概率最低 25% 的 token(“决策 token”,承载中位 72% 的 surprisal)**处的路由指纹与其他尝试的平均一致性最高者提交。
决策 token 的直觉:补丁里大量 token 是语法性的(括号、缩进、高频关键字),它们的路由毫无区分度;真正承载"这里为什么这样改"的是模型拿不准的那 25%——就像看一个人的决策要看他犹豫的地方。
五、评估指标与实验证据
主实验(SWE-bench Verified,gpt-oss-20b/120b × low/medium/high 六条件宏平均):
| 控制器 | resolved rate |
|---|---|
| Uniform(均匀采样) | 44.9% |
| Text(文本共识) | 48.0% |
| Risa | 48.2%(各条件 +2.3~+5.7) |
| Risa-H(高努力变体) | 48.3% |
| Oracle(事后最优) | 60.9% |
跨家族迁移(决定性证据):Qwen3.6-35B-A3B 全 500 题,Uniform 41.7%→Risa 45.2%(+3.5,p<0.001)——指纹方法不绑定 gpt-oss 家族,任何暴露路由权重的 MoE 都适用。
端到端:200 题完整流水线 50.5% vs 无控制器 45.4%(+5.1);困难 80 题集上可提交补丁产率 79%→94%。
消融:跨尝试一致性比"单候选路由集中度"高 2.64 点——信号来自跨尝试收敛而非指纹本身;决策 token 排序 AUC 0.657(全 span 0.639)。
六、效果优势的根源解释
为什么路由信号优于文本共识:文本相似度被"套话"污染——两个措辞雷同但逻辑不同的方案文本相似度高,反之亦然。路由指纹度量计算分配:两个方案若激活相似的专家组合,说明模型在用同类的知识/技能处理它们——这个同构性比表面文字更接近"思路相同"。
决策 token 定位为何关键:不做定位的长 diff 指纹被语法 token 主导(信息稀释),AUC 0.639→0.657 的提升虽小,但概念上解决了"补丁越长信号越稀"的结构问题。
比较集匹配为何必要:同前缀的兄弟候选共享全部证据,比较"新异性"只能对历史;独立尝试经不同代码路径到达答案,比较"收敛"才有正确性含义——同一把尺子在不同比较集上量的是不同的东西,这是全文最精妙的方法论自觉。
因果链:路由遥测 → 计算同构空间 → 探索避开已探索区域(disagree)+ 承诺选择同伴收敛点(agree)→ 无外部 judge/测试的 +3~5.7 点提升,且机制可跨 MoE 家族迁移。
七、必要知识反推
- 领域知识层:SWE-bench 的 agent 执行协议与步级动作结构;MoE 路由机制(router logits→top-k 专家)。
- 方法论知识层:直方图核与 Jaccard 相似度;surprisal/信息量分析(决策 token 的定位标准);对照设计的比较集意识。
- 工程知识层:路由权重的低成本提取(hook 掉 router 输出);teacher-forced 重编码(给 diff 重新打分不需重新生成)。
知识融合的关键节点:把可解释性研究的"内部信号"(通常只用于事后分析)前移到在线决策——内部遥测从"显微镜"变成"仪表盘"。这个视角转换是全文的原创性核心。
八、论文中可以提取的通用性灵感
系统已有的内部遥测往往优于外挂评测器(机制类)
- 证据:路由指纹(免费副产物)胜过文本共识,逼近 Oracle 的近半差距。
- 推广:任何复杂系统(微服务的调用链数据 vs 外部拨测、员工的行为数据 vs 年度述职、学生的作答过程 vs 模拟考)——决策前先盘点"系统已经在记录什么",外部评测是最后手段。
在"犹豫点"上比较,不在"熟练点"上比较(机制类)
- 证据:决策 token(最低概率 25%,72% surprisal)处的指纹一致性才是正确性信号。
- 推广:面试评估(候选人的犹豫与追问比背熟的自我介绍更有区分度)、代码评审(关注作者写注释解释"为什么"的地方)、市场调研(消费者犹豫的选项比首选更能预测真实偏好)。
相似度度量必须与比较集匹配(方法论类)
- 证据:兄弟候选比历史(新异性)、独立尝试互比(收敛)——同一指纹两种用法。
- 推广:推荐系统(同好比较 vs 同期比较语义不同)、组织对标(同部门历史 vs 跨部门现状不可混用)——先问"这两个对象凭什么可比"再算相似度。
零成本信号 + 精心设计 = 可迁移的通用机制(范式类)
- 证据:跨家族(gpt-oss→Qwen)+3.5pp,无需任何外部依赖。
- 推广:好的机制设计应尽量建立在"平台必然提供的免费信号"上(而非私有 API/昂贵评测),这类方案的落地阻力与迁移性都最优。