Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 精读
harness 进化后,让弱模型模仿更强专家的轨迹——这个’显然正确’的配方在七个企业任务上全部翻车(平均 -14.9 分),而同样的做法在未进化 harness 下却有增益。论文定位出根源:模仿让弱模型学会了专家的知识,却也继承了专家的规划风格,破坏了它与’围绕自身原生风格进化出来的 harness’的拟合。解法是 on-policy 专家修正:meta-MLE agent 定位失败 turn、专家只重写那一轮,平均 +1.7 分且规划失败桶保持地板水平。本文精读拆解’模型-harness 拟合’这一新概念与其共进化配方。