One to More, More to One:面向软件工程 Agent 的类别感知迭代专家训练(类别感知 SWE 专家训练精读)
阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架:SWE Labeler 用 47 个语义族 227 个标签做多轴标注,Agentic-miniRL 在可执行奖励下做长程 RL,RRE 循环(Refresh-Repair-Expand)让专家自蒸馏成功轨迹,Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%(较基座 +5.39),多语言 59.00%(+2.78),且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。