Sycophancy Suppression Can Impair Rational Updating 精读:抗谄媚不应牺牲理性纠错
伊利诺伊大学芝加哥分校与新加坡国立大学提出:LLM 的答案翻转分为无依据屈服与理性更新两类,主流抗谄媚方法在压制前者的同时往往连带损伤后者。两轮诊断实验显示 DPO 抗压训练让 Llama-3.1 屈服率降 32.9 个点却让理性更新率掉 48.9 到 53.7 个点,联合优化也难以幸免。机制分析进一步发现两种行为共享大量 MLP 神经元与注意力头、steering 方向余弦相似度全 16 组为正,说明纠缠是结构性的。论文主张抗谄媚是选择性问题而非压制问题,正交化 steering 的初步探索把选择性设置从 5/36 提到 10/36。