论文链接:
- HERO: Doing More with Less Tokens — Hierarchical RL for Efficient Coding Agents
- SCVD: Can Terminal Agents Trust Their Own Verification?
- SecureVibe: SecureVibe: Making Vibe Coding More Secure 发表时间:2026 年 9 月(均为 arXiv 2609.xxxxx,9 月 29–30 日上传) 机构:
- HERO:四川大学 + 独立研究者(高校)
- SCVD:东北大学 + 蚂蚁集团 Inclusion AI + 马里兰大学(产学合作,一作为蚂蚁实习期间工作)
- SecureVibe:CMU + Microsoft Research + UVA + UCSD(重磅产学,核心工作于 MSR 实习完成) 领域标签:cs.SE / cs.CL / cs.CR(软件工程·智能体·安全)
TL;DR
如果只记住三句话:
- 效率(HERO):训练 token 高效 agent 的正确姿势不是惩罚长轨迹,而是「分辨率优先 + 按分辨率校准 + 轮级低熵惩罚」——成功轨迹的 token 用量差异巨大(效率变异),且无产出行为集中在低熵轮(熵相关),这两个实证观察支撑了整套分层设计。
- 可信(SCVD):终端 agent 几乎总会验证(VTR 99.53%),但通过信号基本等于抛硬币(VPR 51.52%)、检出的错误只有一半能修好(RSR 49.36%);学生条件化蒸馏让教师站在学生的候选解上演示验证与修复,比全轨迹蒸馏多赚 4.5~8.6pp 且 OOD 不掉点。
- 安全(SecureVibe):不安全 agent 的病根不是不会写代码,而是对隐性安全需求做有效规划与测试的频率不足安全 agent 的一半;行为归因驱动的数据配方(显式教规划+测试 > 只加安全编码轨迹)加上按奖励密度选择 rl/hg 后训练,能把 unseen CWE 的 SecPass 从 7.69 拉到 19.23。
一、论文背景
1.1 编码 Agent 与多轮交互的代价
LLM 编码 Agent(coding agent)已经成为真实软件工程(SWE)场景的主流范式:给定一个仓库级的 issue 或功能请求,Agent 通过搜索、编辑、命令行执行等工具与环境多轮交互,逐步积累任务相关信息并产出修复补丁。Claude Code、OpenHands、mini-swe-agent 等脚手架(scaffold)把这套交互流程标准化,而 SWE-bench 系列、Terminal-Bench 等基准则把「解题率」(resolution rate / PASS@1)变成了衡量 Agent 能力的通用货币。
但这枚货币有暗面。多轮交互意味着每轮都要重新处理不断累积的上下文——HERO 论文附录 B.5 的统计显示,输入 token 占总消耗的 99% 以上,平均一个任务要交互 60–100 轮。GRPO 这类主流强化学习方法在提升解题率的同时会把 token 消耗推得更高(HERO 实测 GRPO 让 4B 模型从 4.5M 涨到 6.8M)。对工业部署而言,成本与延迟是比榜单名次更硬的约束。
1.2 自验证:Agent 的最后一道防线可靠吗
终端 Agent(terminal agent)完成任务的方式是发 shell 命令、观察输出。写完候选解之后,Agent 会跑测试、查产物、查系统状态来判断「我这个解对不对」——这个过程叫自验证(self-verification)。它是 Agent 发现自身错误并修正的关键反馈回路:验证失灵,Agent 要么带着错误停机,要么检出了错误也修不好。
此前的研究要么考察 Agent 生成的测试有没有用,要么单独做补丁验证器,但没有人同时在「验证发生的那个时刻」同时建立两件事:Agent 自己的检查得出了什么结论、被检查的候选解客观上对不对。缺了后者,「验证通过」既可能对应正确的解,也可能对应没被发现的错误——自验证的可信度就成了一个没法量化的问题。
1.3 Vibe Coding 的安全裂缝
「Vibe coding」——开发者用自然语言描述需求、Agent 负责实现——正变得越来越实用。但功能正确不等于安全:一个实现可以通过全部功能测试,同时引入不安全的输入处理、缺失的权限校验、有漏洞的 API 用法。这在 vibe coding 场景尤其危险,因为用户往往会不加审计地接受 Agent 的改动。安全代码基准(BaxBench、SusVibes 等)能测出生成代码含不含漏洞,但测不出「Agent 到底缺什么能力」——于是「为什么功能很强的 Agent 会写出不安全的代码」以及「怎么训练才能同时提升安全与通用编码能力」始终悬而未决。
1.4 三篇论文为什么值得合读
这三篇论文分别瞄准编码 Agent 后训练的三个正交目标——效率、可信、安全,但共享同一条方法论主线:
先归因行为缺口(哪些行为在拖后腿),再设计监督信号(奖励/蒸馏/数据配方精确打击这些行为),而不是笼统地「更多数据、更大奖励」。
- HERO 归因的对象是「无产出轮次」(重复调用、过度探索、错误命令),信号是轮级熵;
- SCVD 归因的对象是「检出与修复能力」(而非验证发起),信号是教师站在学生候选态上的续写示范;
- SecureVibe 归因的对象是「安全规划与测试行为的缺失」,信号是四任务数据配方 + rl/hg 两种后训练。
三条线合起来,回答的是同一个问题:编码 Agent 的后训练该优化什么、以及怎么把「优化什么」变成可训练的信号。
二、论文定位和关联工作
2.1 Token 效率线:从推理时压缩到训练时内化
降低 Agent token 开销的工作分两族:
| 谱系 | 代表工作 | 核心思路 | 与 HERO 的关键区别 |
|---|---|---|---|
| 推理时上下文操纵 | SWE-Pruner、Pruning+Summarization、Observation Masking | 剪枝/压缩/掩蔽输入上下文 | 静态丢弃信息,有丢失任务相关信息的风险;且会破坏前缀缓存(HERO 附录 B.3:剪枝类方法缓存命中率从 92.4% 掉到 71.9–86.3%,相对推理成本反升) |
| 推理时交互限制 | Turn Limit(Gao & Peng, 2025) | 硬限制交互轮数 | 以分辨率换效率:4B 模型 32.8→29.0% |
| token 高效 RL(推理向) | Training Efficient(Arora & Zanette)、LASER | 长度约束、基于长度的 rollout 过滤 | 为非交互推理设计;LASER 在 SWE 上省 token 但分辨率掉到 33.2% |
| token 高效 RL(agent 向) | OTC-GRPO、SlimSearcher | 惩罚累计 token 用量 | 为简单 agent 任务(网页搜索、多跳 QA)设计,对长程 SWE 任务粒度太粗 |
| HERO | 本文 | 训练时内化高效推理模式:分层策略优化 + 轨迹/轮双层信用分配 | 首个面向长程 SWE 任务的 token-efficient RL 训练框架;轮级熵信用分配是全新机制 |
HERO 的定位突破在于:推理时方法改的是环境反馈,训练时方法改的是策略本身。前者省 token 的代价是信息丢失,后者让模型学会「走更短的成功路径」——前提是确实存在这样的路径(这正是论文的效率变异观察)。
2.2 自验证线:从自我修正到客观诊断
| 谱系 | 代表工作 | 核心思路 | 与 SCVD 的关键区别 |
|---|---|---|---|
| 模型自反馈修正 | Self-Refine、Reflexion | 用自我批评/语言反思迭代改写 | 无客观真值,无法区分「验证通过=正确」与「验证通过=漏检」 |
| 工具反馈修正 | CRITIC、Self-Debugging | 用外部工具/执行反馈驱动修正 | 关注修正机制,不量化验证本身的可信度 |
| RL 训练验证行为 | SCoRe、S2R | 直接优化多轮验证与修正 | 训练方法,不做系统性诊断 |
| Agent 轨迹分析 | What Resolve Rate Hides、Failure as a Process | 分析轨迹结构与失败演化 | 分析失败过程,不建立「自检结论 vs 客观对错」的比对 |
| SCVD(诊断侧) | 本文 | 候选态重放 + 官方评估器获得客观真值,七指标量化三阶段 | 首次让 agent 自检结论与客观正确性可比对 |
| 全轨迹蒸馏 | AgentTuning、FireAct 等 FTD 族 | 教师生成完整轨迹,学生模仿 | 教师候选 ≠ 学生推理时的候选,状态分布漂移 |
| 学生中心蒸馏 | Lyu et al. 2025(student-centered)、Zhao et al. 2026a(on-policy 自蒸馏) | 专家监督条件化在学生诱导的状态上 | SCVD 把该原则专门用在「解级验证与恢复」这一段,loss 只算教师续写段 |
SCVD 的定位突破是双重的:诊断侧的 replay-based 客观真值是全新范式;训练侧的学生条件化精确化解了 FTD 的分布漂移——不是「蒸馏什么」,而是「在谁的状态上蒸馏」。
2.3 安全线:从安全基准到能力归因
| 谱系 | 代表工作 | 核心思路 | 与 SecureVibe 的关键区别 |
|---|---|---|---|
| 安全基准 | BaxBench、SusVibes、SecureAgentBench、CVEval 等 | 评测生成代码含不含漏洞 | 只测结果,不解释缺什么能力、怎么补 |
| 模型级安全生成 | SecCoderX(漏洞奖励模型+在线 RL)、SRCode(token 级奖励)、GoodVibe(安全神经元微调) | 单轮/模型级代码生成的安全训练 | 面向模型级生成,不是可执行、仓库级、带工具交互的 agent |
| Agent 后训练 | SWE-Gym、SWE-RL、SWE-master 等 | SFT/RL 提升功能完成率 | 优化功能,不优化安全 |
| RL 优化器 | GRPO、DAPO、GSPO | 群组相对优势等 RL 技巧 | SecureVibe 直接采用,不是其贡献点 |
| SecureVibe | 本文 | 行为归因 → Security Suite 四任务 SFT → rl/hg 双路后训练 | 首个「能力归因驱动」的 agent 安全训练配方;rl/hg 按奖励密度选择的实用判据 |
SecureVibe 的组件单看都不新(GRPO、OPSD、安全基准均为现成),新颖性在于整合逻辑:三行为标注框架(区分「目标对齐」与泛泛安全动作)把「不安全」从结果标签变成了可训练的行为缺口。
2.4 三篇合读的定位结论
| 维度 | HERO | SCVD | SecureVibe |
|---|---|---|---|
| 优化目标 | token 效率 × 解题率 | 自验证可信度 | 安全通过率 |
| 归因工具 | 轨迹 token 分布 + 轮级熵 | 候选态重放 + 七指标 | 三行为标注(planning/coding/testing) |
| 监督信号 | 分层 RL 奖励(门控+裁剪+双粒度) | 教师条件化续写蒸馏 | 四任务 SFT + GRPO/OPSD |
| 共同方法论 | 先归因行为缺口,再设计监督信号 | 同左 | 同左 |
三、问题定义
三篇论文把各自的具体场景抽象成了三个「本质问题」,且都遵循同一抽象模式:把一个不可直接优化的行为学目标,分解为「可测的归因量 + 可训练的监督信号」。
3.1 HERO:把「效率」从约束变成校准的目标
具体问题:怎么让编码 Agent 少用 token 但不牺牲解题率?
核心洞察:效率与成功率不是单调权衡——同一任务的成功轨迹之间 token 用量差异巨大(效率变异),说明存在更省的成功路径;问题只是策略没学会走。同时,无产出行为(重复调用/过度探索/错误命令)集中在低熵轮(熵相关),说明浪费是可以被定位的。
形式化:给定任务集,最大化 TRS(Token-efficient Resolution Score):
$$TRS = \frac{R}{\sqrt{1+C}}$$其中 R 为平均解题率(%),C 为平均累计 token 用量(百万为单位)。这个指标精妙在于:R 的提升可以容忍 C 的适度增长(分母只开根号),惩罚的是「token 涨得比解题率快」。约束是优化过程必须分辨率优先——论文把这个约束做进了优化器本身(见下节),而不是当成后验筛选。
3.2 SCVD:把「自验证可信」拆成三个可测阶段
具体问题:终端 Agent 的自验证到底能不能信?
核心洞察:「验证」不是一个原子行为,而是三个阶段——发起(验证了吗)、可靠(验证结论与客观对错一致吗)、恢复(检出错误后修得好吗)。此前的评测只有一个最终分数,把三个阶段的信息全部坍缩掉了。
形式化:对任务 T=(x, E, R★)(指令、环境、官方评估器),在轨迹中定位最早完整候选解边界 t_c,用官方评估器重放候选态得客观真值 y_c∈{0,1};Agent 自身验证产出 z∈{error, no-error, unresolved};最终结局 y_f。三元组 (y_c, z, y_f) 支撑七指标:VTR(发起率)、VOR(有结果率)、EDR(错误检出率)、ESP(报错精确率)、CPR(正确通过率)、VPR(通过可靠性)、RSR(修复成功率)。
这个抽象的精妙之处在于候选态重放:它把「Agent 认为自己的解怎么样」与「这个解客观上怎么样」放在同一时刻可比对——这是全部诊断力量的来源。改进方法 SCVD 则基于第二个洞察:蒸馏的监督应当条件化在学生自己会到达的状态上(学生生成的候选解),而非教师的状态。
3.3 SecureVibe:把「不安全」从结果标签变成行为缺口
具体问题:为什么功能正确的 Agent 解会不安全?怎么训练才能补上?
核心洞察:安全失败不是「写代码能力差」,而是行为缺失——不安全 Agent 对隐性安全需求做有效规划与测试的频率不足安全 Agent 的一半。行为缺口是可以被标注、被蒸馏、被强化的。
形式化:三个研究问题闭环:RQ1(什么能力使 agent 安全——行为归因)、RQ2(怎么习得——训练配方)、RQ3(能否泛化到未见安全设置——unseen CWE 迁移)。行为定义三元组:安全规划(识别安全风险并提出应对)、安全编码(实现防护控制)、安全测试(构造/执行安全属性检查),且区分「目标对齐」(针对基准参考证据指向的那个漏洞)与泛泛的安全动作——这个区分后来被证明至关重要(泛泛测试与安全通过甚至是负相关,见第六部分)。
3.4 共同的抽象结构
| 论文 | 归因量(测量) | 监督信号(训练) |
|---|---|---|
| HERO | 成功轨迹 token 分布变异;低熵轮×无产出行为相关 | 分层 RL 优势:门控 + resolution-first 裁剪 + 轨迹/轮双粒度 |
| SCVD | (y_c, z, y_f) 三元组七指标 | 教师在学生候选态上的续写段 SFT loss |
| SecureVibe | 三行为目标对齐频率 × 安全结果相关 | 四任务 SFT + GRPO 细粒度奖励 / OPSD hint 蒸馏 |
三者的抽象都是:不可优化的目标 → 可测的归因量 → 可训练的信号。这是后训练时代「 curriculum 化」的通用范式。
四、问题解法
4.1 HERO:分层策略优化 + 多粒度信用分配
HERO(HiErarchical ReinfOrcement learning)的整体结构像「先学会解题,再学会省着解」,可以用两个机制理解。
机制一:分层策略优化(HPO)——保证分辨率永远优先
类比课程学习里的「先乘除后加减」:效率优化是加减项,不能压过解题这个主目标。具体做法有两层保险:
- 效率门控(efficiency gating):rollout 组内解题率 p 未过阈值 τ(默认 0.6)时,效率优势项权重 w=0;过了阈值才按 w=λ·clip((p−τ)/(1−τ), 0, 1) 线性爬升。直觉:组内一半以上轨迹都解不出来时,谈效率没有意义——先把能力练出来。
- resolution-first 裁剪:无论效率优势怎么算,已解轨迹的优势强制非负、未解轨迹强制非正(Γ(A)=max(A,0) 若 y=1;min(A,0) 若 y=0)。这堵死了「效率信号压过分辨率信号、让未解轨迹拿到更高优势」的通路。
机制二:多粒度信用分配——从「罚整条轨迹」到「罚具体轮次」
类比监督信号的「分辨率」:轨迹级是模糊的照片,轮级是高清照片。
- 粗粒度(轨迹级):按 token 用量给效率奖励,但按结局校准——resolved 与 unresolved 轨迹各自在自己子集内按 token 中位数归一。原因:未解轨迹天然耗 token 更多,不校准的话模型会把「省 token」学成「放弃难题」。这一步是把「效率」与「难度」解耦的关键。
- 细粒度(轮级):对组内熵最低 20% 的轮次施加 −tanh(1−h/q) 的惩罚(q 为组内 20 分位熵阈值),其余轮次不罚。这里的类比是「低熵轮 ≈ 模型在自动驾驶」:轮级熵由该轮所有生成 token 的 top-10 概率熵平均而来,低熵意味着模型非常「确定」地在重复机械动作——实证上这正是重复工具调用、连续 15 轮只读不写(过度探索)、工具报错的高发区。
训练配置:Qwen3.5 三尺寸(4B/9B/35B-A3B),Claude Code 脚手架,仅 640 个多语言 SWE 训练任务(来自 SWE-Gym / Multi-SWE-bench / SWE-rebench),每批 8 任务×16 轨迹。λ=0.3、τ=0.6(35B 因底子更好改为 λ=0.1、τ=0.8)。
一个值得注意的细节:附录 B.10 设置了「随机选 20% 轮罚」与「罚最高熵 20% 轮」两个对照——默认的低熵惩罚显著优于两者,证明「罚低熵」不是任意的正则化,而是精确命中了无产出行为。
4.2 SCVD:诊断框架 + 学生条件化验证蒸馏
诊断侧:三件套流水线
- 轨迹标注:三个 LLM judge(DeepSeek-V4-Pro、GLM-5.2、Kimi-K3)按统一协议标注:是否存在完整候选(I_c)、最早边界 t_c(精确到工具调用粒度,一个 agent step 内可能含多个工具调用)、是否发起验证(I_v)、验证结果 z。多数投票 + 最强 judge 仲裁;用 20 条人工校准集验证 judge 可靠性(76.7–86.7% 联合准确率)。
- 候选态重放:起一个全新环境,把录制好的终端动作重放到 t_c,然后跑官方评估器 R★ 得 y_c。这是「客观真值」的来源——98% 的重放产出有效标签。
- 七指标计算:从 (I_v, z, y_c, y_f) 算出 VTR/VOR/EDR/ESP/CPR/VPR/RSR。
标注协议里有大量防污染设计值得细读(论文附录完整给出了 prompt):例如「task complete 声明本身不算验证」「只数主动获取外部证据的检查」「负向证据不需要非零退出码——cat 输出与需求可见矛盾也算 exposes error」。这些细节决定了诊断的可信度。
训练侧:SCVD 三步
- 学生条件化轨迹收集:学生 π_stu 跑到形成完整候选(边界 t_c),把交互上下文与环境状态原样交给教师 π_tea(GLM-5.2),并注入一个只在收集时存在的验证指令 g_ver(要求教师:先对照原始需求审计现有证据、设计可靠检查、执行、诊断反馈、修复、复查、证据充分才停)。教师续写 τ_post 完成验证与可能的修复。
- 示范后处理:用官方评估器筛最终成功的轨迹(R★(x, s_T)=1),然后删掉 g_ver,使训练上下文与推理时上下文一致。
- 只对续写段算 loss:学生前缀作为上下文保留但 mask 掉,SFT 损失只作用于教师续写段(公式 3 求和从 t=t_c 开始)。
三个设计选择的理由:候选不必是错的——正确候选教会「怎么验证然后停」,错误候选额外教会「怎么恢复」;删 g_ver 是为了消除训练/推理上下文分布差;只算续写段是不干扰学生自己的问题求解策略,专攻验证行为。
一个有趣的副作用(论文 Discussion 节自述):虽然 loss 只算验证段,SCVD 连学生的初始候选质量也提升了(平均 +5.5pp)——学好验证似乎反向塑造了更早的解题决策。
4.3 SecureVibe:行为归因 → 数据配方 → 双路后训练
第一步:归因(什么能力缺失)
对比 GPT-5.6 Sol(更安全)与 Qwen3.5-35B(较不安全)在 SusVibes 上同为功能正确的轨迹:不安全 agent 的目标对齐安全规划 21.1% vs 55.3%、安全编码 31.6% vs 68.4%、安全测试 26.3% vs 52.6%——不足一半。且跨任务配对差分相关:规划 r=0.497、编码 r=0.652,与安全差距强相关。
第二步:Security Suite SFT(四任务混合,教能力而非塞轨迹)
| 任务 | 输入 | 教什么 | 筛选标准 |
|---|---|---|---|
| 功能聚焦编码 | 原始功能描述(仅通用安全提醒) | 常规 vibe coding 场景 | 功能+安全双通过 |
| 安全聚焦编码 | + 实例级 CWE/CVE 提示 | 把隐性安全需求显性化后的安全实现 | 双通过 |
| 安全规划 | 功能描述 + 候选 CWE 列表 | 自主识别隐含安全需求(真实场景没有 oracle) | 识别出正确 CWE |
| 安全测试 | 功能描述 + oracle 漏洞信息 | 合成能区分「漏洞版 vs 安全版」的安全测试 | 生成的测试能被执行且区分两版代码 |
SFT 数据由 MiniMax M2.7 在 100 PatchEval-Gen + 140 AutoBaxBench 实例上每实例采样 20 次筛出,共 1,648 条(505 功能 + 938 安全编码 + 110 安全测试 + 95 安全规划)。
第三步:双路后训练
- SECUREVIBE_rl(结果导向):GRPO + 五档细粒度奖励(双通过 +1 / 仅功能 +0.5 / 双挂 −0.5 / 补丁不可用 −0.75 / 无补丁 −1)+ 动态采样(只留有奖励方差且至少一个正样本的组)。细粒度的意义:把「接近成功」和「完全失败」区分开,二值安全奖励做不到这一点。
- SECUREVIBE_hg(hint 导向):OPSD 式自蒸馏——学生收标准任务上下文,教师(同一模型)额外收实例级安全 hint(四级递进,L1 只给 CWE 类别 → L4 给到具体触发输入与预期安全行为),对学生自采样轨迹做 token 级蒸馏。L1 几乎无效、L4 最有效——瓶颈不是知道漏洞类别,而是把类别变成对正在写的代码的具体威胁。主实验用 L4。
选择判据(论文最重要的实践洞察之一):当 SFT 后的 checkpoint 在某类任务上已有足够的正奖励密度(如 AutoBaxBench 上约 30% 的 rollout 双通过),用 rl 从真实结果信号里学;当正样本稀疏(如 PatchEval-Gen 上仅 15%)、RL 学不动时,用 hg 的密集教师监督兜底。
五、评估指标与实验证据
5.1 HERO:效率-解题率权衡的全面验证
指标体系:主指标 TRS(同时看解题率与 token 用量的权衡);辅助指标为单独的解题率(%)、token 用量(M);分析指标包括缓存命中率、相对推理成本、无产出行为发生率。
主实验(SWE-bench Verified,Qwen3.5 三尺寸 + Claude Code 脚手架):
| 模型 | 方法 | 解题率 | token | TRS |
|---|---|---|---|---|
| Qwen3.5-4B | base | 32.8 | 4.5M | 14.0 |
| + GRPO | 37.4 | 6.8M | 13.4 | |
| + HERO | 40.0 | 4.5M | 17.1 | |
| Qwen3.5-9B | + GRPO | 47.0 | 5.9M | 17.9 |
| + HERO | 49.2 | 3.5M | 23.2 | |
| Qwen3.5-35B-A3B | + GRPO | 59.2 | 5.2M | 23.8 |
| + HERO | 60.6 | 2.7M | 31.5 |
证据链的各个缓解层都覆盖到了:
- vs token-efficient RL(附录 B.1):LASER、OTC-GRPO 更省 token 但解题率掉(LASER 33.2%、OTC 32.4%);Training Efficient、SlimSearcher 两头都不占优。HERO TRS 17.1 全面领先。
- vs 推理时方法(附录 B.2):剪枝/掩蔽/限轮省 token 不涨分;且 HERO 训练后的模型还能叠加这些方法继续受益——训练时与推理时效率设计正交。
- 消融:去 HPO → 解题率崩到 29.2%(效率优化没有分辨率保护就是灾难);去粗粒度 → 39.0/6.0M;去细粒度 → 37.8/4.9M(两层信用各有贡献)。HPO 内部再拆:去门控 36.0%、去裁剪 37.8%(各自必要);去校准(轨迹子集共享阈值)38.2/5.9M(校准是防止「省 token=弃难题」的关键)。
- 训练动态:token 用量先升后降(约 40 步后),解题率先到位——分层机制确实按设计顺序工作。
- 成本分析:HERO 不破坏前缀缓存(命中率 91.9% vs 基线 92.4%),相对推理成本 1.0;而剪枝类方法缓存掉到 71.9–86.3%。这个实验把「token 数」与「真实美元成本」区分开了——多轮 agent 场景下缓存复用是成本大头。
这些数字证明了什么:HERO 不是「牺牲一点解题率换省 token」,而是解题率与 token 同时优于 GRPO(相对 GRPO 平均解题率更高且 token 省 39.8%)——这只有当「浪费确实可定位、成功路径确实可缩短」两个前提都成立时才可能,恰好对应两条核心观察。
5.2 SCVD:诊断 + 训练的双层证据
诊断层(10 个终端 agent × TerminalBench2.1 × 3 次运行,Terminus-2 脚手架):
| 指标 | 含义 | 均值 | 范围 |
|---|---|---|---|
| VTR 99.53% | 几乎总发起验证 | 98.05–100% | 不缺发起 |
| EDR 61.43% | 错误候选检出率 | 48.92–71.52% | 近四成漏检 |
| ESP 92.65% | 报错时候选真错 | 85.47–98.69% | 报错可信 |
| VPR 51.52% | 通过时候选真对 | — | 通过≈抛硬币 |
| RSR 49.36% | 检出后修复成功率 | 23.65–75.68% | 一半修不好 |
两个关键交叉验证:候选后交互平均贡献 +25.4pp 精度提升(验证回路整体有价值);但 RSR 与最终精度的跨模型 Pearson r=0.98——修不好错误是最终精度的最强预测器。诊断结论一句话:弱点不在「验不验」,在「检出」与「修复」。反直觉细节:GPT-5.5 等最强模型的 EDR 反而最低(48.9–57.8%)——越强的模型初始候选越好,越容易自信漏检。
训练层(三个 Qwen3.5 骨干,任务与数据量严格配对的 FTD 对照):
| 骨干 | vs base | vs FTD | OOD SWE-bench Verified |
|---|---|---|---|
| 9B | +9.74pp | +8.61pp | SCVD −2.2 vs FTD −25.9 |
| 27B | +16.85pp | +8.24pp | SCVD +2.2 vs FTD −6.4 |
| 35B-A3B | +11.61pp | +4.49pp | SCVD +4.3 vs FTD −12.3 |
三组消融尤其有说服力:
- 前缀生成器消融(9B 上四组任务配对数据只换前缀来源):学生自产前缀 33.33% > 其他 Qwen 前缀 31.46/31.83% > 教师前缀 29.21%——监督条件化在谁的状态上,直接决定蒸馏价值(+4.12pp)。
- 增益分解(W2R−R2W:错→对 减 对→错):SCVD 的 W2R 比 base 高 5.62–9.74pp 而 R2W 全程 <2%——增益主要来自「把错的救活」而非「碰巧初始候选变好」;且候选后净增益(+7.24pp)大于初始质量提升(+5.50pp)。
- 推理成本:交互轮次降 12.0–35.6%、总 token 成本持平或降——生成 token 涨 2.6–4.1×(单轮内更长的推理)但轮次变少、重复处理累积上下文的输入省得更多。这与 HERO 的发现(输入 token 占 99%+)互相印证。
OOD 不掉点是本论文最硬的证据:FTD 在 SWE-bench Verified 上灾难性退化(9B 掉 25.87pp),SCVD 反而保住甚至小涨——学生条件化不仅提升域内表现,还消除了模仿教师的分布漂移副作用。
5.3 SecureVibe:归因 → 配方 → 泛化的闭环证据
指标体系:FuncPass(功能测试通过率)、SecPass(功能+安全双通过率)、安全差距(FuncPass−SecPass,理想为 0);行为学指标为三行为的目标对齐轨迹占比。
数据配方消融(同等数据量对照,证明「教什么」>「加什么」):
| 配方 | PatchEval-Gen SecPass | AutoBaxBench SecPass |
|---|---|---|
| Security Only(只加安全编码轨迹) | −4.0 | +9.5 |
| Simple Mixture(功能+安全编码) | −3.3 | +5.6 |
| Security Suite(+规划+测试) | −0.7 | +13.7 |
关键发现:Security Only 甚至会降低安全性——只用通过双测试的轨迹做 SFT,模型只学会了模仿功能实现行为,安全意识并没有被激发。显式的规划与测试任务才是激活安全行为的关键。行为频率验证(图 4):Security Suite 在两基准上三行为出现率全面最高(如 AutoBax 规划 9.5→21.4%、测试 31.0→45.2%)。
后训练与泛化(Qwen3.5-35B,mini-swe-agent,4 安全基准 + 1 通用基准):
| 评估 | 指标 | base | 最佳变体 | 增益 |
|---|---|---|---|---|
| BaxBench(跨基准) | SecPass | 19.71 | 26.62(rl) | +6.9 |
| SusVibes unseen CWE | SecPass | 7.69 | 19.23(hg) | +11.5 |
| SusVibes unseen CWE | FuncPass | 20.51 | 38.46(hg) | +17.95 |
| SWE-bench Verified | PASS@1 | 60.90 | 65.00(base) | +4.1 |
最后一行是跨维度反哺证据:安全训练不仅不伤通用编码,还涨 4.1 分。论文做了归因分析:训练后成功解更倾向「只改实现代码不动测试/文档」(37/38)、单文件收束(42/45)、编辑后定向验证(11/12)——恰好是通用 SWE 需要的聚焦编辑行为。
rl vs hg 分工的机理解析:per-CWE 分析显示 rl 在异常处理/代码注入/XSS/SQL 注入/访问控制上增益大(这些类别的正 rollout 更多),hg 在文件上传(CWE-434)与路径穿越(CWE-22)上强(这两类的 hint 可以写得非常具体:规范路径包含、父目录穿越、symlink、扩展名、文件系统操作限制在允许根内;且 CWE-434 在 rl 训练中零成功 rollout)。奖励密度统计:AutoBaxBench 上约 30% rollout 双通过(rl 学得动),PatchEval-Gen 上仅 15%(rl 学不动,hg 兜底)。
六、效果优势的根源解释
6.1 HERO:为什么分层校准优于朴素 token 惩罚
因果链(标注:[论文实验已支持] / [阅读者推测]):
- 朴素惩罚 token 密集轨迹会同时打击必要推理与无产出轮次——已解轨迹天然比未解短(轨迹级混杂)[论文实验:GRPO token 反升]。
- 按结局校准(同结局子集内归一)切断了「省 token ↔ 弃难题」的混淆通道,效率信号只在「同样成功的轨迹之间」比较 [论文实验:去校准消融 38.2/5.9M vs 默认 40.0/4.5M]。
- 轮级低熵惩罚把惩罚精度从轨迹(几十轮)提升到轮(单轮),只打击与无产出行为强相关的那 20% 低熵轮 [论文实验:低熵 vs 随机 vs 高熵对照,40.0 vs 36.8 vs 36.0]。
- 门控 + resolution-first 裁剪保证效率优化只在「能力已达标」的组内激活,且已解/未解的优势序永不逆转 [论文实验:训练动态显示 token 先升后降;去 HPO 消融崩到 29.2%]。
- 训练后的策略内化了「先探索后执行」的更短成功路径 [论文实验:工具使用分析显示 HERO 后期从检查转向执行;输入 token 占 99%+,轮次减少直接省在缓存重复处理上]。
外部交叉验证:
- 低熵 token 与 RL 的关系:HERO 的轮级熵设计引用了 Wang et al.(NeurIPS 2026,Beyond the 80/20 Rule)——高熵少数 token 驱动有效 RL;HERO 把这个 token 级观察反转为「轮级低熵=机械重复」的惩罚对象,两者共同支持「熵是 token/轮重要性的可训练代理」这一机制。相似尝试方向一致的还有 LASER(自适应长度奖励)——但 LASER 证明的是「全局惩罚有效果但有上下限」,HERO 的校准+分层恰好补上了它在 SWE 上掉分的那一段(33.2% vs HERO 40.0%)。
- 效率变异假设的外部支持:Majgaonkar et al. 2025(成功/失败轨迹实证研究)证实未解轨迹耗 token 更多——这正是 HERO 必须做结局校准的原因;同任务多解间 token 差异大也在 Fan et al. 2025(SWE-effi,资源约束下的 agent 有效性再评估)中有独立报道。方法相似且结论相近:这两项工作从实证侧、HERO 从训练侧共同支撑「浪费可定位」假设。
- 推理时 vs 训练时的互补:HERO 附录 B.2 显示两者可叠加,这与上下文管理文献(Lodha et al. 2026「Less Context, Better Agents」)的「压缩有信息代价」结论一致——限定条件:HERO 的收益依赖「存在更短成功路径」,若任务本质上不可压缩(如需要穷举式探索的任务),轮级惩罚可能误伤必要探索,论文对熵百分位的敏感性实验(罚太多轮会降分辨率)已给出该边界的初步刻画。
综合判断:结局校准与分辨率优先是被消融+对照+训练动态三重支持的机制;「低熵轮≈无产出」在本文数据内被相关+对照实验支持,但是否跨模型/跨脚手架稳定(论文只测了 Qwen 系 + 两个脚手架)仍属开放问题。
6.2 SCVD:为什么学生条件化优于全轨迹蒸馏
因果链:
- FTD 的根本局限是状态分布漂移(模仿学习的经典 compounding errors 问题,Ross et al. 2011 DAgger 已从理论上刻画):教师在教师诱导的状态上演示验证,学生在推理时面对的是自己策略诱导的、错误模式不同的候选 [领域共识 + 论文引用]。
- SCVD 让教师站到学生的 t_c 状态上续写——监督分布与部署分布对齐 [论文实验:前缀生成器消融,学生前缀最优 +4.12pp]。
- loss 只算续写段 → 学生的问题求解策略不被教师行为覆盖 → 通用能力不退化 [论文实验:OOD SWE-bench 上 SCVD +2.2~+4.3 vs FTD −6.4~−25.9]。
- 增益主要落在检出与修复(诊断定位的缺口)[论文实验:W2R +5.6~9.7pp、R2W<2%]。
外部交叉验证:
- 方法相似+结论相近:Lyu et al. 2025(student-centered distillation)与 Zhao et al. 2026a(on-policy 自蒸馏)在通用 agent 能力蒸馏上独立得出「监督条件化在学生状态上优于教师全轨迹」的结论——SCVD 把它特化到「验证与恢复」段并给出更强证据(任务/数据量配对的 FTD 对照)。Yang et al. 2026(What Makes Interaction Trajectories Effective)发现交互结构比教师强度更重要,同向支持。
- 诊断侧相近结论:Zhao et al. 2026b(Failure as a Process,CLI agent 轨迹解剖)从失败过程演化角度也发现「后期阶段的处理决定成败」;Shu et al. 2026(What Resolve Rate Hides)用轨迹结构诊断得出「最终分数掩盖过程差异」——与 SCVD 的「候选后交互贡献 +25.4pp、RSR 与最终精度 r=0.98」互相印证。Chen et al. 2026b(agent 生成测试的价值反思)发现 agent 自生成测试证据力弱,与 VPR 51.52% 的「通过≈抛硬币」结论一致。
- 相反/限定证据:SCVD 自己报告了代价——生成 token 涨 2.6–4.1×;且诊断依赖 Terminus-2 这个不主动强制验证的脚手架,若换用内置验证模块的脚手架,VTR 的「近普遍」结论可能变化(论文附录 B.3 自行讨论了此边界)。教师只用了 GLM-5.2 一个,「更强教师是否单调更好」未验证。
- 值得注意的反直觉发现:EDR 与模型能力负相关(最强模型检出率最低)——这与「能力越强自校验越好」的直觉相悖,外部呼应了「强模型更少自我怀疑」的自我校准文献线索,但 SCVD 数据内这仍是相关而非因果(强模型的错误更隐蔽或许是混淆因素)[阅读者推测,论文未做定论]。
综合判断:学生条件化消除分布漂移是被配对消融+OOD 双证据钉死的机制(多项独立研究共同支持);「学验证反哺初始候选质量」只有本文一个数据点,属于待验证的有趣假设。
6.3 SecureVibe:为什么显式教「规划+测试」优于加安全轨迹
因果链:
- Security Only 失败的根源:通过双测试的轨迹里,「安全意识」是教师的隐性行为,SFT 只模仿了显性的代码产出——功能学会了、意识没学会 [论文实验:SecPass −4.0;行为频率分析]。
- Security Suite 把意识显性化为独立任务(规划=把隐性需求说出来、测试=把验证做出来),SFT 有直接的模仿目标 [论文实验:三行为频率全面最高;SecPass +13.7]。
- 泛泛安全动作无效甚至有害(泛泛 testing 与安全通过负相关 φ=−0.194,目标对齐 testing 才正相关 +0.199)——「安全地做」必须锚定到这个任务的这个漏洞 [论文实验:附录 B 对照]。
- rl/hg 分工由奖励密度决定:正样本 ≥30% 时 GRPO 的组相对优势有信息量;稀疏时 OPSD 的 token 级教师监督不依赖正样本存在 [论文实验:AutoBax 30% vs PatchEval 15%;CWE-434 零成功 rollout 时 hg 仍有效]。
- 安全训练反哺通用编码的通路:安全规划≈更好的需求理解、安全测试≈定向验证习惯,两者正是 SWE-bench 需要的 [论文实验:+4.1pp;行为分析 37/38、42/45、11/12]——但这条通路目前是相关性证据,因果解释属[阅读者推测]。
外部交叉验证:
- 方法相似+结论相近:SecCoderX(在线 RL + 漏洞奖励模型)在模型级安全生成上同样发现「可验证安全信号能驱动学习」;SRCode 的 token 级奖励与 hg 的 token 级蒸馏同向支持「安全监督需要比轨迹级更细的粒度」。GoodVibe(安全神经元选择性微调)从机制侧发现「安全能力是可定位的子网络」——与「安全是可归因的行为缺口」互补。
- hint 分级结论的外部印证:SusVibes 原文(Zhao et al. 2026b)发现「仅在 prompt 里加安全提醒不可靠甚至伤功能」,SecureVibe 的 L1(只给 CWE 类别)几乎无效复现了同一结论,而 L4(具体攻击细节)才有效——两个独立工作共同把瓶颈定位在「类别知识→具体威胁的转化」这一步。
- 限定条件:SecureVibe 的 hint 教师依赖 GPT-5.6 Sol 生成 L4 攻击级提示——这本质上把「安全知识」外包给了更强模型,若目标漏洞类别连强模型也不擅长(如新型漏洞类别),hg 路线会失效;论文的 unseen CWE 泛化(48 个未见 ID)缓解了但未消除该担忧 [阅读者推断]。另外所有训练基于 Qwen3.5-35B 单一骨干,配方跨模型稳定性未验证。
综合判断:三行为归因、显式任务化、奖励密度判据三项均有论文内部实验直接支持;其中「显式教规划/测试 > 加轨迹」与外部方法相似+结论相近的双重印证最扎实;「反哺通用编码」是有数据无机制解释的开放项。
6.4 三篇合读的根源共性
把三条因果链并排看,优势的根源收敛到同一个结构性改变:
后训练的有效性取决于监督信号的「条件化精度」——HERO 把效率信号条件化在「同结局的轨迹、低熵的轮」上;SCVD 把验证示范条件化在「学生自己的候选态」上;SecureVibe 把安全监督条件化在「目标对齐的行为」上。三者的 baseline 失败都源于信号条件化太粗(全轨迹惩罚/教师状态/泛泛安全),改进都来自把信号对准归因出的具体缺口。
七、必要知识反推
假设让一个没有背景的人从零完成这三篇工作,最少需要哪些知识?
7.1 领域知识层(研究对象怎么运作)
- 编码 Agent 脚手架机制:工具调用循环、上下文累积、轮次结构——不理解「输入 token 占 99%、缓存复用决定成本」就无法设计 HERO 的效率度量(TRS 用 token 总量、附录做缓存分析);不理解「一个 agent step 可含多个工具调用」就无法把 SCVD 的候选边界定义到工具调用粒度。
- SWE 任务族谱:SWE-bench(Python 修 bug)/ Multilingual(九语言)/ Terminal-Bench(终端交互)/ BaxBench 类(从零建后端)的评测协议差异——三篇各自的基准选择直接由任务抽象决定。
- 漏洞分类学(CWE 体系):SecureVibe 的全部数据组织围绕 CWE 展开;理解「同一功能描述下隐藏着 CWE-94 代码注入」这类需求-漏洞映射,是构造 Security Suite 四任务的前提。
- SWE 任务的「完成」判定:fail-to-pass 测试、官方评估器可重放性——SCVD 的候选态重放完全建立在「官方评估器可在任意状态调用」这个性质上。
7.2 方法论知识层(研究脉络与优化技术)
- GRPO 与群组相对优势:三篇全部以 GRPO 为起点或对照。HERO 需要懂它才能改造优势计算;SecureVibe 需要懂它才能加动态采样与细粒度奖励。
- 模仿学习的分布漂移理论:Ross et al. 2011 的 compounding errors——SCVD 的核心动机直接由此而来,不懂它就看不出 FTD 的病根。
- 蒸馏与 on-policy 蒸馏:FTD/OPSD/学生中心蒸馏的谱系(SCVD 与 SecureVibe 的 hg 各取一支)。
- LLM 熵的估计与含义:top-10 概率熵(Holtzman 2019 起的标准做法)+ 高/低熵 token 与学习的关系(80/20 规则)——HERO 轮级熵惩罚的两个理论支点。
- LLM-as-judge 标注方法学:多 judge 投票、校准集、防污染协议(SCVD 的标注 prompt 是极好的工程范本;SecureVibe 的目标对齐标注同理)。
- 因果归因的统计工具:配对差分相关、Pearson φ、bootstrap 置信区间、McNemar/显著性检验——三篇的归因环节全部依赖这些「行为×结果」的关联分析技术。
7.3 工程知识层(实现与评估设计)
- RL 训练基础设施:rollout 组采样、clip 目标、动态采样过滤(HERO 与 SecureVibe_rl 共用;8×B200/H200 级算力配置)。
- 终端环境的容器化重放:fresh 环境初始化、动作重放、状态快照——SCVD 诊断流水线的地基。
- 基准防污染:SecureVibe 从 PatchEval-Gen 里剔除与 SusVibes 重叠 CVE、评估时禁 git 在线检索——防止「网上抄补丁」污染安全评测。
- 实验配对设计:SCVD 的 FTD 对照取「两法都产出通过轨迹的任务交集」做任务与数据量配对;SecureVibe 的 Simple Mixture 与 Security Suite 数据量对齐(1,670 vs 1,648)——不配对就无法隔离「配方」与「数据量」两个变量。
7.4 知识融合的关键节点
三篇论文各自都有一个「化学反应」节点,其中知识不是叠加而是重组:
- HERO:把「高熵 token 驱动 RL」的 token 级结论反转应用到轮级惩罚上(高熵=值得学,低熵=该罚),并与「按结局校准」的因果推断思想融合——两个独立知识线在「轮级熵×结局子集」处交汇。
- SCVD:把 DAgger 的「状态分布对齐」理论从「学生自己滚动」改造为「学生滚到 t_c、教师接管」的半程交接——既保分布对齐又利用教师能力,还把 loss 限制在续写段避免覆盖学生策略。
- SecureVibe:把「能力归因」(行为标注×结果相关)与「课程设计」(四任务混合)与「优化器选择」(按奖励密度选 rl/hg)串成一条决策流水线——单点知识都不新,串联成闭环是新的。
八、论文中可以提取的通用性灵感
灵感一:惩罚对象要「可定位」才能既省又好
核心思想:粗粒度惩罚(罚整条轨迹/整个输出)必然误伤必要行为;先用实证归因找到「浪费/错误」的可识别代理特征,再只惩罚命中该特征的单元。
论文证据:HERO 罚低熵轮 vs 随机轮 vs 高熵轮 = 40.0 vs 36.8 vs 36.0(SWE-bench Verified);去结局校准后效率信号与弃难题混淆(38.2/5.9M)。
推广场景:
- 长文档生成的冗余段落压缩(按段落「信息熵」定位套话);
- 多轮对话系统的无效澄清轮识别与抑制;
- 具身 Agent 的重复动作序列检测(低熵=机械重复的代理同样适用);
- 代码评审中「机械性 comment」vs「实质性 comment」的区分;
- 数据管线中按「对下游任务的边际贡献」定位可剪枝的数据分片。
灵感二:监督必须条件化在「部署时会到达的状态」上
核心思想:示范的价值取决于示范发生的上下文与学习者未来面对的上下文是否同分布——教师能力再强,站在自己诱导的状态上示范,学生也学不到「在我会犯的错误上怎么办」。
论文证据:SCVD 前缀消融:学生前缀 33.33% > 教师前缀 29.21%;OOD 上 SCVD +2.2~+4.3 vs FTD −6.4~−25.9;RSR 与最终精度 r=0.98(恢复行为才是缺口)。
推广场景:
- 医疗 AI:让专家在住院医师的真实诊断状态下示范鉴别推理,而非展示专家自己的完美病例;
- 机器人技能学习:教师在学生抓偏的姿态上示范纠正(DAgger 精神的一切场景);
- 教育/辅导系统:诊断学生具体卡点后再给针对性讲解;
- 推理模型的错误恢复训练:在模型自产的错误推理链上注入纠正示范;
- 自动驾驶的接管数据:用人类司机在「车已处于次优状态」时的纠正行为训练。
灵感三:教「意识」(规划/验证)比教「产物」(代码/答案)更可迁移
核心思想:只喂「好结果」的示范,学习者模仿的是表面产出;把「发现问题、验证答案」的元行为独立成训练任务,能力才会真正习得并迁移到未见类别。
论文证据:SecureVibe:Security Only(只加好轨迹)SecPass −4.0,加规划+测试任务后 +13.7,unseen CWE 7.69→19.23;泛泛安全动作与通过负相关而目标对齐动作正相关。
推广场景:
- 数学推理模型:单独训练「构造反例检验自己答案」的任务;
- 法律/合同 AI:显式训练「识别隐性法律风险条款」再训练撰写;
- 深度研究 agent:把「设计验证性检索查询」独立成 SFT 任务;
- 医疗诊断:训练「主动列出鉴别诊断并设计排除性检查」;
- 任何「产物好但过程不透明」的领域:把审查/测试行为从产出流程中拆出来显式监督。
灵感四:按「奖励密度」选择后训练路线
核心思想:可验证结果奖励(RL)只在正样本足够频繁时有效;信号稀疏时,带有特权信息(hint/演示)的教师密集监督是兜底路线——先估正奖励密度,再选优化器。
论文证据:SecureVibe:AutoBax 正样本 30%→rl 最优;PatchEval 15%→hg 最优;CWE-434 零正 rollout 时 rl 完全失效而 hg 仍可学。
推广场景:
- 稀疏成功率的科研自动化 agent(实验多数失败→蒸馏路线);
- 冷启动的新任务域(初期成功率低→先用 hint 蒸馏攒正样本再切 RL);
- 对话系统的长程用户满意度优化(信号稀疏且延迟);
- 自动定理证明(证明率极低的分支用 hint 引导);
- 强化学习课程设计:按当前策略成功率动态切换「教师引导/自主探索」。
灵感五:先建「客观真值重放」,行为可信度才能被度量
核心思想:要评估「自我判断是否可信」,必须有一个能在任意中间状态调用客观评估器的机制——把主观判断与客观真值放到同一时刻比对,可信度才从不可测变成七个可计算指标。
论文证据:SCVD:候选态重放覆盖 95.99% 轨迹、98% 重放有效;由此得出 VPR 51.52%(通过≈抛硬币)这类此前不可知的结论。
推广场景:
- 评估 LLM 自我评估校准度(在生成中途重放打分 vs 最终真值);
- RAG 系统的中间检索质量审计(重放到检索步、用金标集判定);
- 多智能体系统的信任校准(各 agent 自报置信 vs 重放验证);
- 自动驾驶的接管决策审计(在任意轨迹点重放仿真评估安全裕度);
- 人类专家决策质量评估(对同一病例的中间诊断状态做金标回判)。
灵感六:安全/可信训练可以与通用能力「双赢」而非权衡
核心思想:定向补齐元行为(验证、规划、测试)不挤占主任务能力,反而因为改善了需求理解与自查习惯而反哺主任务——「额外目标伤通用性」并非必然。
论文证据:SecureVibe:安全训练后 SWE-bench Verified 60.90→65.00(+4.1);SCVD:只训验证段,初始候选质量也 +5.5pp;HERO:效率训练后解题率反而更高(40.0 vs GRPO 37.4)。
推广场景:
- 多语言训练反哺单语言能力的既有现象在新目标(安全/效率)上的复现检验;
- 代码 Agent 加「成本意识」训练是否反哺规划质量;
- 对齐训练与能力训练的兼容性设计;
- 人类组织类比:流程规范(code review/测试文化)是否提升而非降低产出速度。
附录:三篇论文的速查对照表
| 维度 | HERO | SCVD | SecureVibe |
|---|---|---|---|
| arXiv | 2609.38885 | 2609.38812 | 2609.38606 |
| 目标 | token 效率×解题率 | 自验证可信度 | 安全通过率 |
| 归因发现 | 效率变异 + 熵相关 | EDR 61.43%/VPR 51.52%/RSR 49.36% | 目标对齐规划+测试频率不足一半 |
| 核心方法 | 分层 RL(门控+裁剪+双粒度信用) | 学生条件化验证蒸馏 | 四任务 SFT + GRPO/OPSD |
| 基座 | Qwen3.5 4B/9B/35B-A3B | Qwen3.5 9B/27B/35B-A3B(教师 GLM-5.2) | Qwen3.5-35B |
| 主基准 | SWE-bench Verified/Multilingual | TerminalBench2.1 + SWE-bench Verified(OOD) | PatchEval-Gen/AutoBaxBench + BaxBench/SusVibes + SWE-bench Verified |
| 头条数字 | 4B 32.8→40.0%,token 与基线持平;vs GRPO 省 39.8% | PASS@1 +9.7~16.9pp;OOD 不掉点(FTD −25.9) | unseen CWE SecPass 7.69→19.23;SWE-bench +4.1 |
| 开源 | GitHub + Hugging Face(论文页链接) | 未标注(Teacher 为 GLM-5.2) | MSR-Orchard/SecureVibe + dqwang122/SafeVibe |