Skill Issue: Are Skills Language-Invariant in LLMs? 精读
深度精读 A*STAR、Weizmann、MIT-IBM Watson AI Lab、Cambridge 与 EleutherAI 合作的跨语言技能不一致性测量论文——同一模型的两个实例在规则/状态/动作空间完全固定、仅语言界面不同的文字博弈中对战,共 51.84 万局自博弈,首次把「技能的语言条件化」从知识获取问题中正交分离出来。发现英语界面一致最强、希伯来语最弱;语言敏感度因博弈而异(Colonel Blotto 平均 1.07 最大、Kuhn Poker 0.13 最小);Nim 博弈的最优策略在阿/希界面下「存在但不可达」,且多数策略提及来自中途自发切换拉丁字母推理的对局;把推理语言换成英语可恢复 Gemma 德语界面 TTT 损失的 89.4%。语言影响的是决策的多个阶段,不只是输入理解。