题目信息
论文:VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 代码:https://github.com/sustech-nlp/VFA 时间:2026 年 7 月 4 日提交 arXiv 机构:南方科技大学、微软亚洲研究院、上海财经大学、北京大学(企业+高校合作,一作在 MSRA 实习期间完成)
一、论文背景
多模态大语言模型(MLLM)这几年突飞猛进,但绝大多数开源 MLLM 是英语中心的:一旦提示、输出或基准超出英语,性能就明显下滑。这限制了模型在全球用户和跨文化场景(不仅要看懂图,还要理解文化特定的视觉概念)中的可用性。
为什么多语言能力上不去?主流做法是用大规模多语言多模态指令微调——比如 Pangea 用 39 种语言的 PangeaInstruct 数据做全量训练,Aya Vision 用高质量合成数据补非英语指令缺口。但这条路有两个硬约束:数据稀缺(高质量非英文图文对既少又贵,语言和文化覆盖极不均匀)和计算昂贵(视觉 token 拉长序列,注意力和显存开销大)。
另一边,多语言纯文本数据却丰富、便宜、可扩展。直觉的方案是直接在 MLLM 上用文本微调——但这有个著名的坑:灾难性遗忘。语言-only 的梯度更新会扰动多模态训练阶段学好的视觉-语言对齐,论文里最惨烈的例子是 Qwen2.5-VL-7B 直接文本微调后,文化视觉推理基准 MaRVL 从 53.50 直接归零。
于是问题变成:如何用丰富的纯文本数据增强 MLLM 的多语言能力,同时不破坏已有的视觉-语言对齐?
二、论文定位和关联工作
论文相关工作三条线:
多模态 LLM。闭源的 GPT-5、Gemini 2.5 Pro 展示了强大能力;开源侧 LLaVA 系列确立了"视觉编码器 + 投影层 + LLM 骨干"的主流范式,LLaVA-OneVision-1.5、Qwen3-VL 等持续优化训练策略。但这些模型重度依赖大规模图文对做指令微调,语言骨干虽有多语言潜力,非英语任务上仍因视觉对齐的多语言数据稀缺而退化或幻觉。
多语言 MLLM。Pangea 通过扩充数据规模证明更广语言覆盖是跨文化能力的关键;Aya Vision 用大规模文本合成 tackling 非英语指令差距。这些资源密集型的数据驱动方法受限于非英语图文对的稀缺性。本文的差异化立场:用纯文本数据解决问题。
模型合并。合并在 MLLM 上的应用尚处早期:已有工作用合并注入数学(Bring Reason to Vision)或编程(VisCoDex)能力,但多语言适配方向基本空白。本文填补这个空白,把微调与合并组合成不依赖大规模图文数据的构建路径。
三、问题定义
形式化地,问题可以这样陈述:给定一个视觉对齐的 MLLM(参数 θ_MLLM,其语言骨干来自基座 LLM θ_base),以及丰富的多语言纯文本数据 D_multi,如何得到一个模型 θ_merged,使得:
- 多语言多模态能力提升(看图用非英语问答、描述、推理更好);
- 通用多模态能力不掉(英语问答、OCR、数学推理等保持);
- 纯文本多语言能力不掉或提升;
- 不使用任何图文对数据,成本远低于端到端多模态微调。
对照组是两条既有路线:常规多模态适配 θ_tuned = Tune(θ_MLLM, D_visual)(受制于数据稀缺与高成本),以及直接文本微调(引发模态干扰与灾难性遗忘)。
问题的本质是解耦:多语言知识注入和视觉对齐保持是两个目标,直接微调让它们在同一组参数上互相踩踏,需要一种机制让它们各走各的通道。
四、问题解法
VFA(Vision-Free Adaptation,无视觉适配)的两阶段设计非常简洁,核心是把微调重构成"任务向量"的语言。
阶段一:纯文本微调。在共享的基座 LLM θ_base 上,用 10 万条多语言纯文本数据微调得到 θ_FT = Tune(θ_base, D_multi)。这里 Tune 可以是全参微调或 LoRA 等参数高效方法。参数差 Δ_FT = θ_FT − θ_base 被解释为多语言任务向量——它编码了纯语言层面的多语言能力增量,全程不碰任何视觉信号。数据来自 Multilingual-SFT 数据集的确定性 10 万子集(聚合 xP3mt、Bactrian-X、Aya 文本子集与 LLM 生成指令数据,26 个子集来源、覆盖约 26 种语言,过滤掉含 image/video/audio 标签的样本)。
阶段二:权重合并。把多语言任务向量注入 MLLM 的语言骨干:θ_merged = θ_MLLM + α(θ_FT − θ_base)。论文比较了三种合并算子:
- WA(权重平均):θ_merged = θ_base + α·Δ_MLLM + (1−α)·Δ_FT,在 MLLM 的视觉对齐向量和多语言向量之间线性插值;
- TA(任务算术):θ_merged = θ_base + α·(Δ_FT + Δ_MLLM),两个任务向量相加后缩放注入;
- TIES:先按幅值修剪保留 top-k% 参数、按选举确定主导符号、再做符号一致的合并,缓解参数干扰。
混合系数 α ∈ {0.5, 0.7, 0.9, 1.0},用 CVQA(文化多样多语言 VQA)验证集为每个骨干挑选最优的算子+系数组合——因为实验发现没有放之四海皆准的合并策略:Qwen2.5-VL-7B 用 WA(0.9)、Idefics3-8B 用 TIES(0.9)、LLaVA-Next-8B 用 TA(0.5)、LLaVA-OV-1.5-8B 用 TIES(1.0)。
关键工程细节:视觉输入/输出 embedding 排除在合并之外(沿用 Bring Reason to Vision 的标准做法),避免破坏 token 表示一致性;视觉编码器和投影层完全冻结。最终模型 = 冻结视觉骨干 + 合并后的语言骨干,单一统一模型,零额外推理延迟、零额外显存——这点比 MoE 或外挂适配器方案干净得多。
附加福利:当多个 MLLM 共享同一 LLM 底座时,多语言任务向量训练一次即可跨模型复用,只需轻量合并;而端到端微调必须每个 MLLM 各来一遍。训练配置:4×A100(80GB)、LlamaFactory、批次 128、学习率 1e-5、1 个 epoch,8B 模型约 10 A100 小时,吞吐约 1 万样本/GPU 时(多模态 SFT 约 2400,差距 4 倍多)。
五、评估指标与实验证据
评估沿三个轴:多语言多模态(MaXM、xGQA、xMMMU、XM100、MaRVL、M3Exam 六基准)、通用多模态(OCRBench、MMBench、MMU、MathVista)、纯文本多语言(TyDiQA、MMMLU、XNLI、HellaSwag、MLogiQA、M-IFEval、FLORES)。五个 MLLM:Qwen2.5-VL-7B、Idefics3-8B、LLaVA-Next-8B、LLaVA-OV-1.5-8B/4B(4B-8B,覆盖 Qwen、Llama 两大家族)。
主结果 1:多语言多模态基准(Δ 为相对基座 MLLM 的变化):
| 模型 | 方法 | MaXM | xGQA | xMMMU | XM100 | MaRVL | M3Exam | 平均 | Δ平均 |
|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B | Base | 50.37 | 47.81 | 48.34 | 15.74 | 53.50 | 61.97 | 46.29 | — |
| Direct Text SFT | 49.68 | 31.20 | 49.69 | 13.80 | 0.00 | 61.86 | 34.37 | -11.92 | |
| VFA | 51.69 | 48.45 | 48.15 | 15.43 | 65.83 | 62.55 | 48.68 | +2.39 | |
| Idefics3-8B | Base | 46.40 | 48.73 | 42.83 | 13.80 | 26.50 | 27.93 | 34.37 | — |
| Direct Text SFT | 46.56 | 44.95 | 36.45 | 14.06 | 38.00 | 44.79 | 37.47 | +3.10 | |
| VFA | 50.11 | 48.10 | 43.27 | 16.20 | 62.67 | 49.73 | 45.01 | +10.64 | |
| LLaVA-Next-8B | Base | 30.26 | 43.60 | 37.73 | 1.63 | 46.33 | 45.48 | 34.17 | — |
| Direct Text SFT | 42.43 | 44.01 | 35.50 | 13.92 | 6.50 | 42.24 | 30.77 | -3.40 | |
| VFA | 42.80 | 45.39 | 38.62 | 14.43 | 55.33 | 46.57 | 40.52 | +6.35 | |
| LLaVA-OV-1.5-8B | VFA | 56.14 | 43.97 | 53.67 | 16.02 | 65.50 | 63.75 | 49.84 | +2.99 |
| LLaVA-OV-1.5-4B | VFA | 51.64 | 37.71 | 53.42 | 14.34 | 60.67 | 60.26 | 46.34 | +0.57 |
三个亮点:(1) 五个模型全部正增益,最大 +10.64;(2) 文化视觉推理 MaRVL 增益最猛(Qwen2.5-VL +12.33、Idefics3 +36.17、Idefics3 的 M3Exam +21.80)——这类任务语言密集,最能吃到语言骨干增强的红利;(3) Direct Text SFT 在 Qwen2.5-VL 上平均崩 11.92 分、MaRVL 归零,在 LLaVA-Next 上 MaRVL 掉 39.83,直接微调的破坏性肉眼可见。
主结果 2:通用多模态基准。VFA 平均持平或略升:Qwen2.5-VL +1.00、Idefics3 +1.36、LLaVA-Next +0.69、LLaVA-OV-8B -0.19、LLaVA-OV-4B +0.55。增益集中在推理型基准(MMMU、MathVista),感知型(OCR)变化小——符合"增强语言骨干主要利好语言密集推理"的预期。
主结果 3:纯文本多语言基准。LLaVA-Next 平均 +6.27(TyDiQA +20.08)、Qwen2.5-VL +1.68、Idefics3 +1.55。唯一显著的异常是 Idefics3 在 FLORES 翻译上 -13.94,但论文的诊断很细致:检查输出发现模型首句翻译正确却不停吐 EOS,幻觉续写直到长度上限,BLEU 被精度稀释重罚——是生成行为(EOS 控制)问题而非翻译能力损失,且 LLaVA-Next 无此现象,说明不同指令微调 LLM 的 EOS 控制机制对合并的反应不同。
主结果 4:与全量多模态训练对比(Qwen2-VL-7B 骨干):
| 模型 | 训练数据 | 平均分 |
|---|---|---|
| Pangea-7B | 600 万多模态样本 | 50.34 |
| Qwen2-VL-7B Base | — | 42.16 |
| Qwen2-VL-7B + VFA | 10 万纯文本(约 2% 数据量) | 47.84(Δ+5.68) |
VFA 用 2% 的数据把差距缩到 2.50 分;训练成本约 10 A100 时 vs 多模态 SFT 约 320 A100 时(32 倍)。
主结果 5:框架通用性。应用到视觉编程任务(HumanEval-V + CodeVision):InternVL3-8B +4.59、Idefics3-8B +6.62、Llama3-LLaVA-8B +0.32;单语言定向适配(印地语、罗马尼亚语单独微调注入)同样有效。
六、效果优势的根源解释
VFA 与 Direct Text SFT 用的是完全相同的数据,结果却一个 +2.39 一个 -11.92。分岔点在哪?因果链如下。
方法差异:加法注入 vs 同参数竞争。Direct Text SFT 直接在 θ_MLLM 上跑多语言文本的梯度——此时"学多语言"和"保视觉对齐"两个目标共享同一组参数、走同一条梯度通路,多语言的梯度更新会直接覆盖多模态训练写好的视觉-语言对齐权重。VFA 则把两个目标物理隔离:多语言知识在基座 LLM 上独立学到(θ_base → θ_FT,全程不碰视觉对齐参数),然后以任务向量的形式线性叠加到 MLLM 上(θ_MLLM + α·Δ_FT)——视觉对齐向量 Δ_MLLM = θ_MLLM − θ_base 从头到尾没有被任何多语言梯度触碰。
机制变化:视觉对齐子空间保持完好。任务算术的基本假设是不同能力的更新落在参数空间的不同方向上,线性合成时互不覆盖(或干扰有限)。VFA 的实验证实了这一点:MaRVL 这种需要精细视觉-语言接地的文化推理任务,VFA 后不降反大涨(Qwen2.5-VL +12.33),而 Direct Text SFT 后直接归零——归零说明视觉接地通路被梯度破坏,模型丧失了把非英语陈述与图像内容对齐的能力;VFA 的叠加注入保住了这条通路,语言增强才能"搭在"完好的视觉能力上兑现。
机制变化 → 指标提升的三条通路:
- 多语言多模态提升:语言骨干的多语言能力增强后,模型对非英语提示的指令理解、选项判读、文化概念解释都更强,视觉侧完好则语言增益可以完整传导到多模态任务——这就是为什么语言密集型基准(MaRVL、M3Exam、xGQA)增益最大,而感知密集型(OCR)几乎不动。
- 通用多模态持平:α 由 CVQA 验证集挑选,在多语言注入强度和对齐保持之间取得平衡;WA 算子还显式做了 Δ_MLLM 与 Δ_FT 的凸组合,天然限制对齐向量被稀释的程度。
- 灾难性遗忘消失:视觉编码器、投影层冻结 + 对齐向量不被覆盖,直接微调的遗忘机制被结构性切断。
数据效率的根源:端到端多模态训练要同时学"语言+对齐+任务",10 万文本只需学"语言"这一项,且文本序列短(无视觉 token,吞吐 1 万 vs 2400 样本/GPU 时),所以 2% 数据 + 1/30 成本能逼近全量训练;剩余 2.5 分差距论文归因于需要成对监督的能力(更广的视觉-语言对齐覆盖),这是纯文本路线的固有边界而非缺陷。
合并策略无通用最优的启示:Qwen 系偏好 WA/TA、Idefics3 偏好 TIES,说明不同家族模型的任务向量干扰结构不同(参数分布、训练配方差异导致),按骨干做验证集选择是必要的工程步骤,也暗示"自适应合并算法"是值得继续做的方向。
七、必要知识反比
要真正消化这篇论文,需要补齐以下知识:
- MLLM 标准架构:视觉编码器(如 SigLIP)→ 投影层(MLP 或 Q-Former)→ LLM 骨干的三段式流水线,理解"视觉对齐"具体指投影层与 LLM 之间学到的接口。
- 任务向量与任务算术(Ilharco et al.):微调 = 基座 + 任务向量的参数视角,任务向量可加减(编辑模型能力)——这是 VFA 的理论地基。
- 模型合并三件套:Model Soups 的权重平均(WA)、任务算术(TA)、TIES 的修剪-选举-符号合并,以及它们各自处理的干扰模式。
- 灾难性遗忘:持续学习核心概念,微调新任务时旧能力损失的现象与度量——理解为什么直接文本微调是"模态干扰"。
- LoRA 等参数高效微调:VFA 阶段一支持的高效选项,低秩分解的基本原理。
- 多语言基准地图:MaXM(多语言 VQA)、xGQA(跨语言 VQA)、MaRVL(文化视觉推理,NLVR2 多语言版)、XM100(36 语言看图描述)、M3Exam(多语言多级考试)、CVQA(文化 VQA)各自考察什么。
- BLEU 与生成评估:FLORES 翻译基准的工作原理,以及为什么 EOS 失控会通过精度稀释摧毁 BLEU 分数——一个"指标 ≠ 能力"的精彩案例。
- 训练效率计量:A100 时、样本吞吐等成本指标的读法,10 vs 320 A100-h 意味着什么。
八、通用性灵感
1. 参数空间是能力操作的通用接口。“训练一次、合并多处"的任务向量范式,把能力变成了可组合、可搬运的资产。任何"底座 + 多个下游模型"的生态(这几乎是所有大模型部署的现状)都可以用这套思路低成本扩展能力:数学、编程、领域知识、多语言——论文自己就用视觉编程任务验证了通用性。
2. 当两个目标互相干扰时,先试着把它们放到不同的优化路径上。VFA 的核心智慧不是发明新合并算法,而是识别出"学语言"和"保对齐"的冲突根源在于共享梯度通路,然后用"独立训练 + 向量合成"把冲突降为线性叠加的有限干扰。这个解耦思想适用于一切多目标学习场景:推荐系统的个性化和公平性、代码模型的正确性和安全性、Agent 的探索与利用。
3. 最大的资源约束往往可以用另一种模态绕过。“缺多语言图文对"这个约束,被"多语言文本管够"这个事实破解了。跨模态迁移的本质洞察:语言骨干学好的东西,视觉对齐完好时能自动受益。遇到数据瓶颈时先问:这个能力是否必须用目标模态的数据学?也许别的模态已经学会了。
4. 指标异常是理解模型的窗口,不是需要抹平的噪声。FLORES -13.94 的反常没有被打补丁掩盖,而是被诊断到 EOS 生为层面——首句翻译正确说明能力在,问题出在停止信号。这种"分数 → 行为 → 机制"的排查习惯,比盲目调参宝贵得多。也提醒 BLEU 这类基于参考的指标会把生成长度问题误报成能力问题。
5. 简单方法的上限与边界同样重要。VFA 到 Pangea 还差 2.5 分,论文诚实地指出这需要成对监督才能补——知道一个方法的边界(感知密集任务、更大规模、更严数据清洗)与知道它的优势一样有价值。方法论文的局限章节就该这么写。
6. 冻结也是一种设计。视觉编码器和投影层的"完全不动作”,是这个框架能工作的前提之一。在到处都是"全部端到端联合训练"的时代,明确哪些组件应当被保护、以什么粒度保护(这里细到排除视觉 embedding 参与合并),是工程成熟度的体现。
总而言之,VFA 是一篇"小而美"的工作:方法只用了一个(任务向量合成),却精准命中了多语言 MLLM 的数据瓶颈与遗忘痛点,用 2% 的数据和 1/30 的成本拿到了大部分收益。对资源有限又想给自有 MLLM 加多语言能力的团队,这是目前性价比最高的路线图;对研究者,它再次证明了参数空间操作这个"模型urgery"方向的实用潜力——值得与同期的数学合并、编程合并工作放在一起,看成同一个趋势的多个切面。