论文链接:arxiv.org/abs/2608.25832 代码仓库:github.com/TextArena/TextArena(65 博弈 × 193 语言的多语言扩展已并入主库) 发表时间:2026年8月 机构:A*STAR(新加坡)、Weizmann Institute of Science、MIT-IBM Watson AI Lab、University of Cambridge、EleutherAI——非典型产学联合:MIT-IBM 为产学联合实验室,其余为科研机构与开源社区(EleutherAI) 领域标签:cs.CL / 多语言评估 / Agent 评测 / 博弈环境
一、论文背景
1.1 多语言 LLM 的「不平等」问题
LLM 号称多语言,但早已知道它们跨语言表现不均:同一问题翻译成不同语言,模型的回答质量参差。这带来了公平性与可靠性问题——用希伯来语或马来语与模型交互的用户,得到的服务质量系统性低于英语用户。
1.2 已知的问题:知识获取不一致
已有大量研究关注跨语言知识不一致:模型在英语里知道的事实,换个语言就取不出来(factual compartmentalization,事实隔舱化)。研究发现知识常被「存了两份」而非共享,跨语言迁移失败是根源。
1.3 未知的空位:技能是否语言不变?
一个同样重要却远未理解的问题:同一个模型,用不同语言交互时,展现的「技能集」是否相同? 换句话说——不谈检索知识,模型能否在某些语言里更有效地推理、规划、决策?
这个问题难回答,因为要把语言的影响从知识储备和整体基准表现中剥离出来。静态多语言基准(Global-MMLU、Belebele)测的是固定输入的准确率,看不出模型在持续交互中是否表达出「等价的策略」。
二、论文定位和关联工作
2.1 研究谱系一:多语言评测
从理解任务(NLI、QA、常识推理)到能力覆盖(数学推理、阅读理解、代码生成、指令遵循),再到近期从本地来源取题的文化情境知识基准。共同局限:固定输入+预定义答案——能发现「准确率随语言变化」,不能发现「模型在演化的交互中是否执行等价策略」。本文把 Belebele 与 Global-MMLU 用作参照(相关性分析),用 Multilingual TextArena 检验交互技能的语言一致性。
2.2 研究谱系二:跨语言知识/技能迁移
- 事实隔舱化(Goldman et al. 2025; Ifergan et al. 2024 等):一种语言获得的信息在另一种语言里可能取不出;看似一致的知识常是双份存储;多语言推理的后处理方案;
- 技能迁移(Hu et al. 2020; Malkin et al. 2022 等):研究在一种/几种语言监督习得的任务能力能否泛化到其他语言(source fine-tuning 范式)。
本文的正交性:不研究「通过某语言学到的技能如何迁移」,而研究语言条件化的技能访问与表达——技能已在模型里,问题是每种语言界面能取出多少。
2.3 研究谱系三:交互式与博弈评测
工具使用环境、博弈基准测规划/空间推理/协调/目标导向决策;博弈论环境(含 LLM 直接对战)测策略与社交推理。已有工作都在共享或固定语言界面下比较模型/提示/架构;本文反其道——固定模型,用竞争环境研究模型内部的语言条件化变异。
定位结论:首个用受控自博弈隔离「技能的语言条件化」问题的测量研究,与跨语言知识不一致研究正交,且机制定位(推理语言干预)超出单纯基准报告。
三、问题定义
3.1 从具体场景出发
具体问题:让同一个模型分别用德语和英语界面下同一盘井字棋,它表现出的棋力相同吗?如果技能是「语言不变」的,两个实例的胜负应该像「自己跟自己下同语言棋」一样随机对半分布。
3.2 核心洞察:自博弈是天然的完美对照
论文的抽象设计:同一模型的两个实例,在同一个环境里通过不同语言界面对战。因为模型、对手、规则、状态空间、合法动作全部固定,唯一的变量是语言界面——测出来的任何行为差异只能来自模型内部的语言条件化处理。
关键细节:语言无关字符串有意保留不译——棋盘符号、坐标、牌面花色点数、数字、固定动作语法(如 [bet]、井字棋的 [1])。这保证共享的游戏机制与动作格式不变,语言只改变「界面表述」而非任务本体。
3.3 形式化定义
每个博弈 $g$ 实现为马尔可夫环境 $E_g$:状态 $s_t$、玩家可见观察 $o_t$、动作 $a_t$、终局 $s_H$(胜/负/平)。语言指派为有序对 $(\ell_0, \ell_1)$,$\ell_i \in L = \{$en, ar, de, es, fr, he, ms, zh$\}$(8 种 Tier-A 语言)。
角色池化胜负差(核心指标):
$$\Delta_{m,g}(A,B) = \frac{W_{m,g}(A,B) - L_{m,g}(A,B)}{N_{m,g}(A,B)} \in [-1, 1]$$把 $(A,B)$ 与 $(B,A)$ 两种角色指派的结果从语言 A 的视角合并计数——池化两种指派控制了结构性角色优势(如井字棋先手优势),且构造上 $\Delta(A,B) = -\Delta(B,A)$。
语言均值 $\mu_{m,g}(A)$:语言 A 对其余七种语言的平均 margin;模型级宏平均 $\bar{\mu}_m(A)$:跨六博弈平均。
实验规模:每模型-博弈-语言对(含同语言对)双角色各 400 局 → 每模型-博弈 28,800 局 → 三模型 × 六博弈共 518,400 局。
3.4 抽象的精妙之处
「技能语言不变性」这个不可直接观测的命题,被转译为可检验的统计零假设:同语言对局的胜负随机分布。拒绝它只需一个受控环境——自博弈同时消灭了「对手强弱」「任务差异」「知识差异」三个混淆。
四、问题解法
4.1 基础设施:Multilingual TextArena
TextArena 是开源的 100+ 竞争性文字博弈集。本文做了大规模多语言扩展——65 个博弈 × 193 种语言,按翻译质量分级:
| 层级 | 语言数 | 翻译与验证方式 |
|---|---|---|
| Tier A | 8 | Claude Opus 4.8 / GPT-5.2 翻译 + 母语者人工校验(本文实验用) |
| Tier B | 42 | Llama-3.1-405B / Qwen2.5-72B 翻译 + 回译 + Claude 判忠实(4 种子失败则降级) |
| Tier C / E | 124 / 18 | NLLB-200 翻译 + 双模型独立评忠实(85% 阈值分层) |
Tier-A 八语按「类型学、文字系统、文化、使用人数」的多样性选取,保证每个维度至少两语共享——英语、阿拉伯语、德语、西班牙语、法语、希伯来语、马来语、中文。
4.2 六个博弈环境与被测技能
| 博弈 | 类型 | 探测技能 |
|---|---|---|
| TicTacToe | 完全信息·已解 | 行列对角的空间推理 |
| Nim | 完全信息·已解 | 已知最优策略的检索执行 |
| Simple Tak | 完全信息 | 空间规划:路径搭建与阻断 |
| Colonel Blotto | 同时行动 | 资源分配与对手建模 |
| Kuhn Poker | 不完全信息 | 风险决策与诈唬 |
| Iterated Prisoner’s Dilemma | 重复社交 | 合作与意图推断 |
六个博弈合起来覆盖空间/数值推理、规划、分配、诈唬、合作、适应。无效动作给一次纠正机会,再犯即判负。采样参数 temperature=1.0、top_p=0.95、top_k=64 鼓励多样化自博弈轨迹。
4.3 推理语言干预实验(界面与推理解耦)
前人发现把非英语输入译成英语再推理能提升性能(self-translation、question-alignment)。本文把两个变量拆开:界面语言固定为某弱语言,只换中间推理语言——观察恢复多少性能。这能定位语言敏感发生的阶段(状态解读 vs 中间推理 vs 动作选择)。
五、评估指标与实验证据
5.1 指标体系
- 主指标:角色池化胜负差 $\Delta$ 与语言均值 $\mu$、模型级 $\bar{\mu}$——衡量「该语言界面的实测强度」;
- 语言敏感度:$\max_\ell \mu_\ell - \min_\ell \mu_\ell$(语言层级最陡落差)——衡量「技能表达随语言波动的幅度」;
- 行为指标:失败分布(行/列/对角)、卡牌条件化动作率、无效动作率、Nim 最优策略提及率——定位「怎么输的」;
- 外部参照:Global-MMLU / Belebele 静态多语言能力、FineWeb-2 语料量代理——解释「为什么强」。
5.2 主发现一:能力确实随语言变化
三个模型的整体语言层级热图(Fig. 2)显示:
- 英语在三个模型上平均一致最强,希伯来语一致垫底;
- 幅度模型依赖:Gemma 相对平稳(各语言均值 −0.14 到 +0.14 附近),Qwen 层级最陡(en 对 he 达 +0.38,zh/en 强、ar/he 弱的分化明显);
- 语言敏感度因博弈而异:Colonel Blotto 平均 1.07 最大,Kuhn Poker 0.13 最小(Tab. 2)。Blotto 需要用语言组织资源分配的抽象规划,对语言界面最敏感;Kuhn Poker 动作空间极小(check/bet/call/fold 四选一),语言影响被压缩。
关键读数:博弈基本是抽象的——棋盘、牌、数字、动作都没变,连「核心任务信息是非语言的」时,语言界面仍能决定模型表达出哪些能力。
5.3 主发现二:语言条件化的技能差异(怎么输的)
- 空间推理:英语界面的失败均衡分布在行/列/对角;阿拉伯语、希伯来语等非拉丁字母界面系统性偏向「列与对角线」失守,轨迹显示模型频繁把格子序列误标成线——空间关系的语言表述影响了坐标到几何的映射;
- 策略行为:Kuhn Poker 里同一模型随界面语言采取不同风险画像——Qwen 拿最弱牌诈唬的比率跨语言相差两倍以上;Gemma 最大变异出现在中间牌 Q 的打法上;
- 已知知识的不等访问(最鲜明的效应):Nim 有完全算法解(把 Nim-sum 归零)。在阿拉伯语和希伯来语界面下,Qwen 与 Ministral 的最优策略提及率、首步最优执行率、胜率全部骤降;且这些语言里剩余的策略提及多数来自那一小部分对局——模型在推理中途自发切换成了拉丁字母。结论:策略在模型里存在,但并非每个语言界面都可靠可达——只换处理语言就能找回本会丢失的知识。
5.4 主发现三:更强的推理语言可恢复性能
| 博弈 | 弱界面基准 | 换推理语言后 | 恢复率 | 界面上限 |
|---|---|---|---|---|
| TicTacToe (Gemma) | de/de μ=−0.22 | de/en μ=+0.20 | 89.4% | en/en +0.25 |
| Simple Tak (Gemma) | de/de μ=−0.21 | de/en μ=+0.05 | 60.5% | en/en +0.22 |
| Kuhn Poker (Gemma) | zh/zh μ=−0.01 | zh/es μ=−0.01 | 37.6% | es/es +0.02 |
德语界面下棋力 −0.22 的 Gemma,仅把中间推理语言换成英语(环境观察原样不动)就升到 +0.20——恢复到英语界面上限差距的 89.4%。这说明这些博弈里的语言效应相当一部分发生在中间推理阶段。但 Kuhn Poker 恢复有限且非单调——语言敏感可能出现在交互的不同阶段(状态解读、推理、知识检索、动作选择),不能总靠换推理语言解决。
5.5 主发现四:外部参照解释一部分
- 与静态基准相关:语言均值与 Global-MMLU 的 Pearson r 在 0.73-0.92 之间(与 Belebele 0.71-0.79)——静态基准上强的语言平均也是自博弈里赢的语言。但基准水平预测不了跨语言稳定性:Gemma 的 Global-MMLU 均值三模型最低、跨语言落差却最小;Qwen 均值最高、落差最大。「平均更好」与「跨语言更均匀」是两个独立维度;
- 与语料量相关:语言均值与 FineWeb-2 词数(log10)的拟合 r 平均 0.79——网络文本越多的语言界面越强;
- 两个偏离点暴露机制: 马来语在三个模型上都高于拟合线、且语料比希伯来语少却更强——与 ECLeKTic 的「共享文字系统的语言间迁移更强」一致:拉丁字母的马来语吃到高资源拉丁语言(英/法/西/德)的迁移红利,希伯来语吃不到; 中文可用语料约为英语 1/20,Qwen 和 Ministral 却接近英语强度(Gemma 则接近零)——同样数据可用性在不同模型上实现出完全不同的实测强度,且中文不靠共享文字系统——数据量与文字系统各解释一部分,剩下的变异是模型特有的。
5.6 为什么实验设计能证明论点
三层递进:(1) 受控性——自博弈固定一切只留语言变量,同语言对角线提供「无差异时的期望分布」作为零假设参照;(2) 机制性——失败分布/卡牌条件化动作/Nim 策略提及给出「怎么输」的行为学证据,推理语言干预定位「在哪个阶段输」;(3) 解释性——静态基准与语料量的相关性分析把「为什么」拆成可归因的成分并诚实报告残差。
六、效果优势的根源解释
本文是测量型论文,「效果」指测量设计的效度。根源解释:为什么语言界面能改变抽象博弈中的技能表达?
机制因果链:
- 博弈环境的完美受控:规则、状态、动作空间、连坐标/牌面/数字都不翻译——任务本体是非语言的。测得的行为差异无法归因于任务差异或知识差异(对手是同一个模型);
- 差异只能来自模型内部的语言条件化处理:同一组权重,接收德语观察 vs 英语观察时激活的内部通路不同。空间推理失败模式(非拉丁字母界面偏列/对角失守、格子序列误标成线)暗示:空间关系的语言表述参与了模型对坐标-几何映射的构建——用不熟悉的语言表述坐标时,映射精度下降;
- 知识「存在但不可达」的机制:Nim 的 Nim-sum 策略显然以英语语料为主习得;阿/希界面下策略提及骤降、且剩余提及多来自中途切拉丁字母的对局——策略的存储与「用语言 X 检索」之间隔着一层访问接口,这层接口的语言条件化决定了知识可达性。这与事实隔舱化文献「知识存两份而非共享」的发现同构,但推广到了程序性技能;
- 推理语言干预的定位力:界面固定、只换推理语言能恢复 89.4%——说明 TicTacToe 里语言伤害主要发生在中间推理阶段(模型用自己的语言组织「我要堵哪条线」的思考);Kuhn Poker 恢复有限——伤害在状态解读或决策直觉层面,换推理语言无济于事。语言影响交互的多个阶段,位置因任务而异;
- 层级来源的三元分解:数据量(r≈0.79 的主效应)+ 文字系统(马来语 vs 希伯来语的对照:共享拉丁字母获得跨语言迁移)+ 模型特有实现(中文在 Qwen/Ministral 强、Gemma 弱,同样语料实现不同强度)——三个成分各自必要、合不拢的残差留给模型训练配方。
反事实验证:同语言对局(对角线)的 margin 接近零——若语言真无影响,所有格子应长得像对角线;实际非对角格子系统性偏离——语言效应存在的直接证据。
如实说明:仅 3B-4B 尺度(不应解读为尺度不变的语言效应);模型训练数据不公开,语料量只能用 FineWeb-2 代理;结果不应外推到更大模型。
七、必要知识反推
7.1 领域知识层
- 跨语言知识不一致的研究现状(事实隔舱化、双份存储、迁移失败):不知道这条线的边界,就无法定义「技能不一致」这个正交空位;
- 博弈论与每个博弈的技能结构:Nim 的 Nim-sum 完全解是「已知知识可达性」测试的支点;Kuhn Poker 的小动作空间解释其低敏感度——不懂博弈就选不出敏感度梯度设计;
- 语言的类型学多样性维度(文字系统、语系、资源量):Tier-A 选语的「每维度至少两语共享」设计需要这个知识。
7.2 方法论知识层
- 受控实验的变量分离思想:自博弈消对手、固定规则消任务、保留非语言符号消机制差异——层层剥离后语言成为唯一变量;
- 角色池化设计:先手优势等结构性偏差必须从两种角色指派合并中消除,否则语言效应与角色效应混淆;
- 静态基准与动态行为的相关性分析:r=0.73-0.92 的相关 + 「稳定性不可预测」的残差发现——相关分析的规范用法;
- 翻译质量分级管线:人工校验(Tier A)/回译+裁判(Tier B)/NLLB+双模型评(Tier C/E)——按预算与质量需求分层。
7.3 工程知识层
- 大规模自博弈基础设施:51.84 万局的调度、
\boxed{}动作抽取、无效动作的纠正-判负协议、采样参数(temp 1.0/top_p 0.95/top_k 64)选择; - 多语言环境渲染:观察按语言渲染而规则/转移/奖励不变——环境代码与文案模板分离的工程设计;
- 语料量代理估计:英语不在 FineWeb-2 里,用 FineWeb + 1.3 的 token-词生育率折算。
7.4 知识融合的关键节点
- 节点一:自博弈 × 语言指派——把「自我对弈保证势均力敌」的博弈论常识翻转为测量工具:同语言对局是零假设参照,跨语言对局的偏离即信号。需要博弈评测与实验设计的交叉视野。
- 节点二:界面语言与推理语言的解耦——前人 self-translation 把翻译与推理混在一起;拆开后才能说「语言影响发生在哪个阶段」。这是干预实验设计的经典手法在 LLM 评测的应用。
- 节点三:文字系统作为迁移通道的验证——马来语/希伯来语对照与中文反例的三点布局,把「数据量」「文字系统」「模型实现」三个假设放进同一张散点图互相校验。
八、论文中可以提取的通用性灵感
灵感一:自博弈是测量「内部条件化变异」的万能对照
核心思想:让同一系统的两个副本在固定环境中通过不同条件(语言/温度/提示/ persona)对战,可以把「条件对行为的影响」从一切能力差异中干净剥离——同条件对局提供零假设参照。 论文证据:同语言对角线 margin≈0;跨语言格子系统性偏离;51.84 万局的规模使每个格子的偏差都可统计检验。 推广场景:(1) 提示词 A/B 的行为级比较(非准确级);(2) Agent 配置参数的影响测量;(3) 模型量化/蒸馏前后的行为一致性审计;(4) 任何「同一智能体、两种条件」的受控行为比较。
灵感二:能力「存在」与「可达」是两回事——访问接口可能屏蔽存量能力
核心思想:系统已具备的能力可能因接口条件(语言、模态、格式)而不可达;评估存量能力要设计「绕过接口」的探针(如观察中途自发切换行为)。 论文证据:Nim 最优策略在阿/希界面提及率骤降,但剩余提及多数来自中途切拉丁字母的对局——策略在模型里,接口挡住了检索。 推广场景:(1) RAG 系统的知识「在库里但检索不到」审计;(2) 多模态模型的跨模态知识可达性测试;(3) 组织知识管理中「文档存在但没人找得到」;(4) 模型 long-context 里的 lost-in-the-middle。
灵感三:干预定位——把「影响」拆到处理阶段
核心思想:当一个因素(如语言)可能影响多个处理阶段时,固定输入端、只换中间处理语言(或反之)的干预设计能定位伤害发生的位置,并为修复指路。 论文证据:de 界面 + en 推理恢复 TTT 89.4% 损失(推理阶段主导);同设计在 Kuhn Poker 只恢复 37.6% 且非单调(状态解读/决策阶段主导)。 推广场景:(1) 多模态管线中「感知 vs 推理」的误差归因;(2) Agent 系统中「工具调用 vs 规划」的阶段消融;(3) 人机交互中「理解 vs 表达」的瓶颈定位;(4) 编译器优化的 pass 级 profiling。
灵感四:「平均更好」与「更均匀」是独立维度
核心思想:评价系统在多条件下的表现时,均值与跨条件方差是两个正交维度——平均分最高的系统可能恰恰是最不均匀的,公平性评估必须单独报告离散度。 论文证据:Gemma 的 Global-MMLU 均值最低但跨语言落差最小;Qwen 均值最高、落差最大。 推广场景:(1) 模型评测报告加「分组方差」指标;(2) 产品质量的多地域公平性审计;(3) 算法交易的「收益高但波动大」风险刻画;(4) 教育评价中的均衡性指标。
灵感五:共享表示(文字系统)是跨条件迁移的隐形通道
核心思想:表面条件(资源量)相近的两个群体,可能因与强势群体的底层表示共享(文字系统)而获得完全不同的实际能力——评估与资源配置都要看「迁移通道」而非只看自身体量。 论文证据:马来语语料最少却强于希伯来语(吃拉丁字母迁移红利);中文语料 1/20 于英语却在 Qwen/Ministral 接近英语(模型特有实现),Gemma 则否。 推广场景:(1) 小语种模型的「借力」路线评估(借文字系统 vs 借语系);(2) 编程语言间的迁移学习(共享语法族);(3) 新技术生态的「兼容层」价值评估;(4) 多品牌产品共享底层组件的能力外溢分析。
一句话总结:同一个模型用不同语言下棋,棋力真的不一样——策略明明在脑子里,换个语言界面就取不出来;好在把「思考语言」切回英语能找回近九成功力,但语言对模型的伤害远不止「读不懂」,它渗透在决策的每个阶段。