Adaptive Triggering for Bias Correction in LLM Reasoning 精读
亚利桑那州立大学团队把「推理过程中何时注入反偏见干预」形式化为在线变点检测问题:每步计算一个偏见风险信号,喂入 CUSUM 统计量,仅当累积证据越过校准阈值时才注入定向反思提示。黑盒版(LLM 裁判打分)在 gpt-4o-mini 上以 0.33 次/题的干预频率恢复了固定周期干预损失的大部分消歧准确率(90.1% vs 82.9%),独立裁判下仍成立。白盒版(next-token 概率信号)在全部六个开源模型上提升歧义项准确率、却在五个模型上损害消歧项——它无法区分「依赖刻板印象」与「恰好与刻板印象一致的正当证据」,证明再好的触发时机也救不了错位的信号。论文还修复了 BBQ 基准四处未记录的标签匹配不一致,并指出「未完成率」是被误当准确率损失的一种独立干预代价。