GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents 精读
Amazon 的评测效度清算之作:persona 驱动 LLM 用户模拟器 + LLM-as-judge 这道廉价’离线发布门禁’被 GAUGE 协议全面体检——盲评面板判’满意’的会话 57.5% 实际任务失败(ρ=−0.147);能力相近的强 agent 对比中门禁 31% 选出奖励更低的一方;满意度阈值放行失败率 48-60% 的 agent。结论:门禁’human-validated yet mis-anchored’(人觉得准但锚错了构念),并给出 calibrate-then-trust 补救节奏。附同日 TraceJudgeBench 对照:去偏 prompt 在压偏差的同时损坏分辨率。