SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback 精读
深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文。核心论断:技能自进化的瓶颈不在编辑能力也不在迭代次数,而在评估反馈能否持续供给可信的进化梯度。框架用两根支柱支撑这一命题——把多轮用户模拟从评估终点反转为反馈生成器(意图状态机、双侧正交评估、集体归因),再用独立治理层主动修复事实退化与结构膨胀(双锚点硬约束、图结构诊断软约束)。在腾讯云 6 类云服务、9 个生产 Skill、2000 张升级工单上,TSR 从 30.0 提升到 81.8,较单轮 QA 进化高 15.4 个点,膨胀率仅 2.8%,并已部署于生产环境。