论文链接:arxiv.org/abs/2608.13120 发表时间:2026年8月 机构:腾讯云 Andon × 浙江大学(企业+高校合作:腾讯云 Andon 提供生产技术支持场景、2000 张真实升级工单数据与生产环境部署验证,浙江大学参与方法研究)


一、论文背景:Skill 维护之痛与被浪费的失败数据

在云服务技术支持这类真实生产场景中,Agent 的能力载体是 Skill——封装领域知识与处理流程的可移植模块(一个 SKILL.md 路由入口加上一组参考文件,构成 RAG 知识库)。论文开篇点出的行业现状是:Skill 要么纯手工编写,要么由 LLM 一次性生成,没有一个闭环能让它们从自己实际造成的交互失败中改进。

手工维护的代价显而易见:RCACopilot、RCAgent、D-Bot 这些云上诊断 Agent 都聚焦单轮交互能力,没人解决客服场景的长期瓶颈——Skill 的持续维护。而已有的持续改进研究又依赖人工标注反馈,成本高、覆盖窄。与此同时,生产系统里每天都在产生"升级工单"(escalated tickets)——AI 处理不了、最终转给人工的对话。每一张工单都对应一个真实用户已经暴露、而当前 Skill 覆盖不了的知识缺口。这些失败数据是最诚实的进化素材,却长期被白白丢弃。

SkillEvo 要回答的问题就是:如何把真实工单中的失败交互,自动转化为驱动 Skill 持续改进的反馈闭环。

二、论文定位与关联工作

这篇论文处在两条研究线的交汇处,且对两条线都提出了结构性批评。

用户模拟线:τ-bench 把评估从"能否完成任务"推进到"能否可靠完成";ECom-Bench、VoiceAgentEval 用真实用户画像提升模拟保真度;SAGE 向模拟器注入业务档案,能比通用用户多暴露 33% 的 Agent 错误。但论文指出它们的共同局限——全部把模拟当作评估终点:一条轨迹判完成败就被丢弃,失败案例既不区分"可修补缺口"与"非 Skill 局限",也不会回流到 Skill。评估与进化是脱节的。

技能进化线:按反馈源可分三层。Self-Refine 无评估反思,无法区分真实缺口与模型盲区,不构成进化序列;SkillForge 及一众单轮 QA 评估方法只能捕捉单轮可见缺口,梯度第一轮后衰减,且反馈未经归因筛选就驱动修订,不可修复信号被误编码为知识,产生文档膨胀与事实冲突;多轮评估(τ-bench、SAGE)虽暴露交互层缺陷,但止步于评估终点。同期工作 SEAD 同样基于多轮对话驱动服务 Agent 进化,但走的是强化学习改模型参数的路线,而非进化文本技能知识库——这也意味着 SkillEvo 的路线无需重训模型即可部署。

治理层面,现有做法是"单文本文件 + 标量分数"的门控:分数下降只能推断"退化发生了",既定位不了原因也修复不了结构。SkillForge 的 append-only 策略更是放任 Skill 无限膨胀。而当 Skill 是路由表加引用文件构成的有向图时,悬空引用、孤儿文件、事实过度泛化这些退化在标量分数空间里根本无法表达。

三、核心论点:瓶颈不在编辑能力,而在反馈梯度与治理

论文的中心论断非常锐利:技能自进化质量的约束变量,既不是编辑能力,也不是迭代次数,而是评估反馈能否持续提供可信的进化梯度,以及治理是否可控。

一个直观的类比:单轮 QA 反馈像一位只看初诊的医生——病人说完第一句话就开药,第一剂药见效之后,医生手里就再也没有新信息了,因为该暴露的病情在初诊时已全部暴露。多轮交互则是复诊:病情每展开一层,才暴露出下一层的病灶。SkillEvo 的图 1 给出了定量印证:单轮 QA 的 TSR 曲线在第 2 轮后就饱和(58.9→64.5→65.7→66.4,边际收益急剧递减),而多轮交互的 TSR 逐轮持续攀升(59.4→71.3→77.9→81.8)——每一轮修订既消费梯度,又生成新梯度,像剥洋葱一样层层深入。

框架因此由两根支柱构成:可信反馈生成(把多轮用户模拟从评估终点反转为反馈生成器)与可控治理(用独立治理层主动修复事实退化与结构膨胀,防止梯度随退化累积而漂移)。如果把编辑器比作作家,标量门控只是个只打分不改稿的审稿人——拒稿却说不出哪里该改;SkillEvo 的治理层则像文章编辑,直接在稿子上动手修复。

四、机制拆解一:可信反馈的三条件

整个闭环是:场景合成器 → 用户 Agent → Verifier → 集体归因 → Skill 优化器 → Skill 治理器。可信反馈由三个必要条件同时保障。

4.1 Coverage:意图状态机

从真实工单的完整对话中提取三类信息重建受约束用户:意图议程(标注 key/minor 的核心请求与追问)、行为事实(用户已持有的信息、已做过的操作)、情绪轨迹(合作度波动与转折点)。目标是任务级受限真实感——防意图遗漏、防事实捏造、防答案泄漏,而非复刻真实用户的语言分布。

关键的意图状态机追踪每个意图是否"已被提出"(has been raised)且"已被实质性回应"(substantively addressed),两个条件全部满足才允许正常终止;Agent 无法解决或反复原地打转时触发弃置型终止。这一设计同时杜绝了早停(该问的没问完就结束)与冗余轮次(同一件事反复纠缠)。

4.2 Accuracy:双侧正交评估

模拟器侧与 Agent 侧分开打分,责任可分离——一个意图从未被提出的失败,归因于模拟失真而非 Agent 的 Skill。具体地:模拟器侧算意图覆盖度 cU = |K_asked|/|K|,cU<1 的样本被剔除出 Agent 侧分母、归为评估噪声;Agent 侧以 Skill 命中为门控(未命中直接 sC=0 判负),再对每个已暴露意图对照人工"意图-解法"对逐条判分、按优先级加权(关键意图 α=0.7)。要强调 sC 是意图级量,度量的是"已暴露意图的响应可靠性",不是端到端解决率——低 sC 正是进化梯度的直接来源。

4.3 Attributability:集体归因三分

低分不等于缺知识——失败可能源于权限/工具限制,也可能源于评估本身不可靠。归因器对照人工处理过程、模拟对话与 Verifier 证据,把失败分为三类:Knowledge Gap(人工参考中存在的稳定事实被遗漏或答错)、Capability Limit(权限与工具限制、表达笨拙、基础设施故障)、Evaluation Noise(误判与场景失真)。只有 Knowledge Gap 投影为修订信号 Lt;且同轮多个失败常指向同一缺口,系统按语义相似度合并成单一信号,让修订聚焦跨样本共性而非单例噪声。附录 D 的案例极具说服力:COS 流量包续费场景中,Agent 第一轮就把规则说反了(称续费立即叠加流量,实际是延长有效期),但错误答案自洽得让用户基于错误前提继续追问——错误知识比缺失知识更有欺骗性,只有持续追问才能暴露,这正是单轮 QA 触发不了的失败模式。

五、机制拆解二:可控治理

5.1 有界修订:双边界

Skill 优化器的修订受两层边界约束:证据边界——只修补 Lt 中已验证的缺口,不引入无依据内容;参考边界——修订锚定生产基线 S0,新知识永不覆盖既有稳定事实。三种编辑模式(evolve/fix/refine)各有硬约束,例如数值、版本号、链接必须逐字保留,禁止泛化成"参见官方文档"。

5.2 事实一致性:硬约束 + 双锚点

修订后的 Skill 必须保留生产基线的稳定事实。检查用双锚点完成:S0 检测跨轮累积的事实丢失,St-1 检测本轮新引入的事实错误——单锚点无法区分两者,修复方向就会模糊。检测三类违规(知识丢失、过程错误、自相矛盾),任一违规直接拒绝候选并触发本轮修复:恢复 S0→St 中被删的丢失事实,同时禁止把 St-1→St 的合法改动整体回滚。

5.3 结构一致性:软约束 + 图结构诊断

Skill 治理器把 Skill 当作有向图(路由节点指向知识节点、知识节点互相引用),独立诊断三类标量分数感知不到的结构退化:knowledge bloat(节点内冗余增长、稀释路由精度)、reference breakage(引用断裂、悬空引用与孤儿文件)、factual over-generalization(具体数值/版本/规则退化为模糊表述)。与事实一致性的一票否决不同,结构一致性是软约束:修复建议(章节合并、尾部整合、文件拆分,附优先级标签)与归因信号合并注入下一轮,逐轮消解退化。治理从"标量门被动拒绝"升级为"诊断驱动的主动修复"。另有工程细节值得注意:Generator 与 Evaluator 必须来自不同模型家族(编辑用 deepseek-v4-pro,验证/模拟/归因/治理用 minimax-m3),杜绝自己审稿的循环依赖;且任何修订须经人工确认才能进入生产——人工检查点被视为自进化知识部署的必要条件而非可选保障。

六、因果链:为什么多轮反馈让 TSR 持续上升

这篇论文最有解释力的部分,是它把三种方法的差异还原为一个问题:每一轮修订之后,还能否剩下指导下一轮的新失败信号? 因果链如下:

  1. 反馈模态决定进化上限。编辑器可以完全不变——能进化出什么,取决于评估器能暴露哪些失败。这是论文图 1 的标题级论断。
  2. 单轮梯度一轮耗尽。单问单答只能暴露用户开场白中可见的缺口,第一轮修补完即饱和(TSR 58.9→66.4 后停滞)。Self-Reflection 更糟:没有评估就没有梯度,四轮盲改只在首轮水平附近震荡(59.2→58.8);它连评估门也没有,曲线是震荡而非平台。
  3. 多轮让修复本身创造新的可观测面。追问把对话推进到更深缺陷层——本轮补上的知识让对话走得更远,抵达此前被浅层失败遮蔽的下一层缺陷。失败面随 Skill 能力提升而不断展开,梯度自刷新,TSR 从 59.4 一路升至 81.8。
  4. 消融设计是因果隔离的证据。消融变体(a)只把多轮交互换成单轮 QA 评估,归因、修订、治理全部不动——结果 TSR 恰好落回 66.4,与单轮基线完全一致。15.4 分的差距被干净地归因于反馈源本身,而非框架的其他组件。
  5. 治理层的贡献不体现在分数而在防退化。去掉治理 TSR 只降 3.2(78.6),看似价值不大;但真正的账在 RegR 与 Bloat 上:跨轮回归率三轮从 28.2% 降到 21.1%(-7.1),知识膨胀在治理下仅 +2.8% 而无治理时 +16.2%(近 6 倍)。治理的价值是阻止退化逐轮累积、防止梯度方向漂移——是"保住已赚到的"而非"多赚"。

七、实验与数据

数据:腾讯云生产技术支持场景,6 大类云服务(营销、开发协作、存储、AI 与 LLM 平台、网络边缘、计算)、9 个生产 Skill、98 个技能参考文件、共 2000 张工单。所有工单都是升级到人工的失败集——约 40% 开场即升级、60% 多轮未决后升级,每张都对应真实用户已暴露而现有 Skill 覆盖不了的缺口。工单按时间序四等分:前 3 份为开发集驱动进化循环,第 4 份完全held-out作纯评估,所有报告的 TSR 均测于评估集,版本选择只用开发集——杜绝了数据泄漏性质疑。

指标:Overall TSR(Verifier 知识分 [0,100] 过 60 且任务关键条件不缺)、暴露意图响应精度 sC、意图覆盖 cU、跨轮回归率 RegR、知识膨胀率 Bloat。Verifier 与领域专家独立标注的一致性超过 90%。

主结果(评估集 TSR):SkillEvo 四轮 30.0→59.4→71.3→77.9→81.8,超原始 Skill +51.8、超 Self-Reflection +23.0、超单轮 QA +15.4。可信度侧:cU 达 98.9%,200 组模拟对话的专家盲评三维度一致性 95.3%(证明高覆盖不是状态机机械走清单刷出来的),sC 为 71.1%——这个不高的数字恰是进化梯度的直接来源。最动人的一个数字组合是:TSR 提升 51.8 点的同时文本量几乎不变(Bloat 仅 +2.8%)——能力增长来自正确修订既有知识,而非堆料扩容。框架已部署于腾讯云生产环境。

八、可迁移的灵感

灵感 1:评估反馈的质量是自进化系统的真正瓶颈

自进化系统优化的上限不由执行者(编辑器/模型)决定,而由反馈信号的质量决定。诊断任何自改进系统失效时,先别问"改得够不够多",先问"反馈还能不能提供新梯度"。这也解释了为什么自我反思式改进长期无效:没有独立评估的反思,只是在盲区里打转。

灵感 2:模拟从评估终点变成反馈生成器,是一次范式反转

τ-bench、SAGE 们把模拟对话当一次性裁判,用完即弃;SkillEvo 把同一条轨迹变成进化燃料。凡是存在"模拟/测试/评估"基础设施的系统,都值得追问一句:这些只为判定成败而产生的数据,是否还有第二生命?评估基建与进化基建本可以是同一套。

灵感 3:主动修复优于被动拒绝的治理观

标量门控只能拒稿,说不清哪里坏了;诊断驱动才能定位结构病因并开出修复建议。更精妙的是硬软约束的分工——事实一致性一票否决(保住底线),结构一致性逐轮消解(给进化留弹性)。任何长期迭代的资产(代码库、文档、知识库)都需要这样的分层治理,而不是一个 CI 红灯。

灵感 4:生产失败集是最诚实的进化训练集

2000 张全部升级到人工的工单,是被真实用户验证过的"现有能力边界图"。相比人工构造的评测集,失败集天然标注了缺口所在,且每张都自带人工参考解。把最痛的数据变成最好的教材——这个思路对任何有"兜底人工"环节的业务都成立。

灵感 5:错误知识比缺失知识更危险

附录 D 案例里,Agent 给出的是自洽但相反的规则,用户基于错误前提继续追问而不弃置——这类缺陷单轮评估几乎不可能触发。系统设计者应把"自信地错"列为比"诚实地不知道"优先级更高的检测对象,而暴露它的唯一手段是持续追问。

九、总结

SkillEvo 用生产级证据重述了自进化系统的第一性原理:持续进化的瓶颈不在编辑能力或迭代次数,而在评估反馈能否持续供应可信梯度,以及治理能否守住方向。 多轮模拟反转为反馈生成器解决了前者(意图状态机保覆盖、双侧正交保准确、集体归因保可修复);独立治理层解决了后者(双锚点事实一致性 + 图结构诊断的主动修复)。在腾讯云 9 个生产 Skill 上 +51.8 点、落地生产环境的结果,让这套"评估观 + 治理观"的范式有了超出论文本身的分量——自进化系统的下一步竞争,不在谁的编辑器更强,而在谁的反馈更可信、谁的治理更可控。