题目信息

论文:VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 代码:https://github.com/sustech-nlp/VFA 时间:2026 年 7 月 4 日提交 arXiv 机构:南方科技大学、微软亚洲研究院、上海财经大学、北京大学(企业+高校合作,一作在 MSRA 实习期间完成)

一、论文背景

多模态大语言模型(MLLM)这几年突飞猛进,但绝大多数开源 MLLM 是英语中心的:一旦提示、输出或基准超出英语,性能就明显下滑。这限制了模型在全球用户和跨文化场景(不仅要看懂图,还要理解文化特定的视觉概念)中的可用性。

为什么多语言能力上不去?主流做法是用大规模多语言多模态指令微调——比如 Pangea 用 39 种语言的 PangeaInstruct 数据做全量训练,Aya Vision 用高质量合成数据补非英语指令缺口。但这条路有两个硬约束:数据稀缺(高质量非英文图文对既少又贵,语言和文化覆盖极不均匀)和计算昂贵(视觉 token 拉长序列,注意力和显存开销大)。

另一边,多语言纯文本数据却丰富、便宜、可扩展。直觉的方案是直接在 MLLM 上用文本微调——但这有个著名的坑:灾难性遗忘。语言-only 的梯度更新会扰动多模态训练阶段学好的视觉-语言对齐,论文里最惨烈的例子是 Qwen2.5-VL-7B 直接文本微调后,文化视觉推理基准 MaRVL 从 53.50 直接归零。

于是问题变成:如何用丰富的纯文本数据增强 MLLM 的多语言能力,同时不破坏已有的视觉-语言对齐?

二、论文定位和关联工作

论文相关工作三条线:

多模态 LLM。闭源的 GPT-5、Gemini 2.5 Pro 展示了强大能力;开源侧 LLaVA 系列确立了"视觉编码器 + 投影层 + LLM 骨干"的主流范式,LLaVA-OneVision-1.5、Qwen3-VL 等持续优化训练策略。但这些模型重度依赖大规模图文对做指令微调,语言骨干虽有多语言潜力,非英语任务上仍因视觉对齐的多语言数据稀缺而退化或幻觉。

多语言 MLLM。Pangea 通过扩充数据规模证明更广语言覆盖是跨文化能力的关键;Aya Vision 用大规模文本合成 tackling 非英语指令差距。这些资源密集型的数据驱动方法受限于非英语图文对的稀缺性。本文的差异化立场:用纯文本数据解决问题。

模型合并。合并在 MLLM 上的应用尚处早期:已有工作用合并注入数学(Bring Reason to Vision)或编程(VisCoDex)能力,但多语言适配方向基本空白。本文填补这个空白,把微调与合并组合成不依赖大规模图文数据的构建路径。

三、问题定义

形式化地,问题可以这样陈述:给定一个视觉对齐的 MLLM(参数 θ_MLLM,其语言骨干来自基座 LLM θ_base),以及丰富的多语言纯文本数据 D_multi,如何得到一个模型 θ_merged,使得:

  1. 多语言多模态能力提升(看图用非英语问答、描述、推理更好);
  2. 通用多模态能力不掉(英语问答、OCR、数学推理等保持);
  3. 纯文本多语言能力不掉或提升;
  4. 不使用任何图文对数据,成本远低于端到端多模态微调。

对照组是两条既有路线:常规多模态适配 θ_tuned = Tune(θ_MLLM, D_visual)(受制于数据稀缺与高成本),以及直接文本微调(引发模态干扰与灾难性遗忘)。

问题的本质是解耦:多语言知识注入和视觉对齐保持是两个目标,直接微调让它们在同一组参数上互相踩踏,需要一种机制让它们各走各的通道。

四、问题解法

VFA(Vision-Free Adaptation,无视觉适配)的两阶段设计非常简洁,核心是把微调重构成"任务向量"的语言。

阶段一:纯文本微调。在共享的基座 LLM θ_base 上,用 10 万条多语言纯文本数据微调得到 θ_FT = Tune(θ_base, D_multi)。这里 Tune 可以是全参微调或 LoRA 等参数高效方法。参数差 Δ_FT = θ_FT − θ_base 被解释为多语言任务向量——它编码了纯语言层面的多语言能力增量,全程不碰任何视觉信号。数据来自 Multilingual-SFT 数据集的确定性 10 万子集(聚合 xP3mt、Bactrian-X、Aya 文本子集与 LLM 生成指令数据,26 个子集来源、覆盖约 26 种语言,过滤掉含 image/video/audio 标签的样本)。

阶段二:权重合并。把多语言任务向量注入 MLLM 的语言骨干:θ_merged = θ_MLLM + α(θ_FT − θ_base)。论文比较了三种合并算子:

  • WA(权重平均):θ_merged = θ_base + α·Δ_MLLM + (1−α)·Δ_FT,在 MLLM 的视觉对齐向量和多语言向量之间线性插值;
  • TA(任务算术):θ_merged = θ_base + α·(Δ_FT + Δ_MLLM),两个任务向量相加后缩放注入;
  • TIES:先按幅值修剪保留 top-k% 参数、按选举确定主导符号、再做符号一致的合并,缓解参数干扰。

混合系数 α ∈ {0.5, 0.7, 0.9, 1.0},用 CVQA(文化多样多语言 VQA)验证集为每个骨干挑选最优的算子+系数组合——因为实验发现没有放之四海皆准的合并策略:Qwen2.5-VL-7B 用 WA(0.9)、Idefics3-8B 用 TIES(0.9)、LLaVA-Next-8B 用 TA(0.5)、LLaVA-OV-1.5-8B 用 TIES(1.0)。

关键工程细节:视觉输入/输出 embedding 排除在合并之外(沿用 Bring Reason to Vision 的标准做法),避免破坏 token 表示一致性;视觉编码器和投影层完全冻结。最终模型 = 冻结视觉骨干 + 合并后的语言骨干,单一统一模型,零额外推理延迟、零额外显存——这点比 MoE 或外挂适配器方案干净得多。

附加福利:当多个 MLLM 共享同一 LLM 底座时,多语言任务向量训练一次即可跨模型复用,只需轻量合并;而端到端微调必须每个 MLLM 各来一遍。训练配置:4×A100(80GB)、LlamaFactory、批次 128、学习率 1e-5、1 个 epoch,8B 模型约 10 A100 小时,吞吐约 1 万样本/GPU 时(多模态 SFT 约 2400,差距 4 倍多)。

五、评估指标与实验证据

评估沿三个轴:多语言多模态(MaXM、xGQA、xMMMU、XM100、MaRVL、M3Exam 六基准)、通用多模态(OCRBench、MMBench、MMU、MathVista)、纯文本多语言(TyDiQA、MMMLU、XNLI、HellaSwag、MLogiQA、M-IFEval、FLORES)。五个 MLLM:Qwen2.5-VL-7B、Idefics3-8B、LLaVA-Next-8B、LLaVA-OV-1.5-8B/4B(4B-8B,覆盖 Qwen、Llama 两大家族)。

主结果 1:多语言多模态基准(Δ 为相对基座 MLLM 的变化):

模型方法MaXMxGQAxMMMUXM100MaRVLM3Exam平均Δ平均
Qwen2.5-VL-7BBase50.3747.8148.3415.7453.5061.9746.29—
Direct Text SFT49.6831.2049.6913.800.0061.8634.37-11.92
VFA51.6948.4548.1515.4365.8362.5548.68+2.39
Idefics3-8BBase46.4048.7342.8313.8026.5027.9334.37—
Direct Text SFT46.5644.9536.4514.0638.0044.7937.47+3.10
VFA50.1148.1043.2716.2062.6749.7345.01+10.64
LLaVA-Next-8BBase30.2643.6037.731.6346.3345.4834.17—
Direct Text SFT42.4344.0135.5013.926.5042.2430.77-3.40
VFA42.8045.3938.6214.4355.3346.5740.52+6.35
LLaVA-OV-1.5-8BVFA56.1443.9753.6716.0265.5063.7549.84+2.99
LLaVA-OV-1.5-4BVFA51.6437.7153.4214.3460.6760.2646.34+0.57

三个亮点:(1) 五个模型全部正增益,最大 +10.64;(2) 文化视觉推理 MaRVL 增益最猛(Qwen2.5-VL +12.33、Idefics3 +36.17、Idefics3 的 M3Exam +21.80)——这类任务语言密集,最能吃到语言骨干增强的红利;(3) Direct Text SFT 在 Qwen2.5-VL 上平均崩 11.92 分、MaRVL 归零,在 LLaVA-Next 上 MaRVL 掉 39.83,直接微调的破坏性肉眼可见。

主结果 2:通用多模态基准。VFA 平均持平或略升:Qwen2.5-VL +1.00、Idefics3 +1.36、LLaVA-Next +0.69、LLaVA-OV-8B -0.19、LLaVA-OV-4B +0.55。增益集中在推理型基准(MMMU、MathVista),感知型(OCR)变化小——符合"增强语言骨干主要利好语言密集推理"的预期。

主结果 3:纯文本多语言基准。LLaVA-Next 平均 +6.27(TyDiQA +20.08)、Qwen2.5-VL +1.68、Idefics3 +1.55。唯一显著的异常是 Idefics3 在 FLORES 翻译上 -13.94,但论文的诊断很细致:检查输出发现模型首句翻译正确却不停吐 EOS,幻觉续写直到长度上限,BLEU 被精度稀释重罚——是生成行为(EOS 控制)问题而非翻译能力损失,且 LLaVA-Next 无此现象,说明不同指令微调 LLM 的 EOS 控制机制对合并的反应不同。

主结果 4:与全量多模态训练对比(Qwen2-VL-7B 骨干):

模型训练数据平均分
Pangea-7B600 万多模态样本50.34
Qwen2-VL-7B Base—42.16
Qwen2-VL-7B + VFA10 万纯文本(约 2% 数据量)47.84(Δ+5.68)

VFA 用 2% 的数据把差距缩到 2.50 分;训练成本约 10 A100 时 vs 多模态 SFT 约 320 A100 时(32 倍)。

主结果 5:框架通用性。应用到视觉编程任务(HumanEval-V + CodeVision):InternVL3-8B +4.59、Idefics3-8B +6.62、Llama3-LLaVA-8B +0.32;单语言定向适配(印地语、罗马尼亚语单独微调注入)同样有效。

六、效果优势的根源解释

VFA 与 Direct Text SFT 用的是完全相同的数据,结果却一个 +2.39 一个 -11.92。分岔点在哪?因果链如下。

方法差异:加法注入 vs 同参数竞争。Direct Text SFT 直接在 θ_MLLM 上跑多语言文本的梯度——此时"学多语言"和"保视觉对齐"两个目标共享同一组参数、走同一条梯度通路,多语言的梯度更新会直接覆盖多模态训练写好的视觉-语言对齐权重。VFA 则把两个目标物理隔离:多语言知识在基座 LLM 上独立学到(θ_base → θ_FT,全程不碰视觉对齐参数),然后以任务向量的形式线性叠加到 MLLM 上(θ_MLLM + α·Δ_FT)——视觉对齐向量 Δ_MLLM = θ_MLLM − θ_base 从头到尾没有被任何多语言梯度触碰。

机制变化:视觉对齐子空间保持完好。任务算术的基本假设是不同能力的更新落在参数空间的不同方向上,线性合成时互不覆盖(或干扰有限)。VFA 的实验证实了这一点:MaRVL 这种需要精细视觉-语言接地的文化推理任务,VFA 后不降反大涨(Qwen2.5-VL +12.33),而 Direct Text SFT 后直接归零——归零说明视觉接地通路被梯度破坏,模型丧失了把非英语陈述与图像内容对齐的能力;VFA 的叠加注入保住了这条通路,语言增强才能"搭在"完好的视觉能力上兑现。

机制变化 → 指标提升的三条通路:

  1. 多语言多模态提升:语言骨干的多语言能力增强后,模型对非英语提示的指令理解、选项判读、文化概念解释都更强,视觉侧完好则语言增益可以完整传导到多模态任务——这就是为什么语言密集型基准(MaRVL、M3Exam、xGQA)增益最大,而感知密集型(OCR)几乎不动。
  2. 通用多模态持平:α 由 CVQA 验证集挑选,在多语言注入强度和对齐保持之间取得平衡;WA 算子还显式做了 Δ_MLLM 与 Δ_FT 的凸组合,天然限制对齐向量被稀释的程度。
  3. 灾难性遗忘消失:视觉编码器、投影层冻结 + 对齐向量不被覆盖,直接微调的遗忘机制被结构性切断。

数据效率的根源:端到端多模态训练要同时学"语言+对齐+任务",10 万文本只需学"语言"这一项,且文本序列短(无视觉 token,吞吐 1 万 vs 2400 样本/GPU 时),所以 2% 数据 + 1/30 成本能逼近全量训练;剩余 2.5 分差距论文归因于需要成对监督的能力(更广的视觉-语言对齐覆盖),这是纯文本路线的固有边界而非缺陷。

合并策略无通用最优的启示:Qwen 系偏好 WA/TA、Idefics3 偏好 TIES,说明不同家族模型的任务向量干扰结构不同(参数分布、训练配方差异导致),按骨干做验证集选择是必要的工程步骤,也暗示"自适应合并算法"是值得继续做的方向。

七、必要知识反比

要真正消化这篇论文,需要补齐以下知识:

  1. MLLM 标准架构:视觉编码器(如 SigLIP)→ 投影层(MLP 或 Q-Former)→ LLM 骨干的三段式流水线,理解"视觉对齐"具体指投影层与 LLM 之间学到的接口。
  2. 任务向量与任务算术(Ilharco et al.):微调 = 基座 + 任务向量的参数视角,任务向量可加减(编辑模型能力)——这是 VFA 的理论地基。
  3. 模型合并三件套:Model Soups 的权重平均(WA)、任务算术(TA)、TIES 的修剪-选举-符号合并,以及它们各自处理的干扰模式。
  4. 灾难性遗忘:持续学习核心概念,微调新任务时旧能力损失的现象与度量——理解为什么直接文本微调是"模态干扰"。
  5. LoRA 等参数高效微调:VFA 阶段一支持的高效选项,低秩分解的基本原理。
  6. 多语言基准地图:MaXM(多语言 VQA)、xGQA(跨语言 VQA)、MaRVL(文化视觉推理,NLVR2 多语言版)、XM100(36 语言看图描述)、M3Exam(多语言多级考试)、CVQA(文化 VQA)各自考察什么。
  7. BLEU 与生成评估:FLORES 翻译基准的工作原理,以及为什么 EOS 失控会通过精度稀释摧毁 BLEU 分数——一个"指标 ≠ 能力"的精彩案例。
  8. 训练效率计量:A100 时、样本吞吐等成本指标的读法,10 vs 320 A100-h 意味着什么。

八、通用性灵感

1. 参数空间是能力操作的通用接口。“训练一次、合并多处"的任务向量范式,把能力变成了可组合、可搬运的资产。任何"底座 + 多个下游模型"的生态(这几乎是所有大模型部署的现状)都可以用这套思路低成本扩展能力:数学、编程、领域知识、多语言——论文自己就用视觉编程任务验证了通用性。

2. 当两个目标互相干扰时,先试着把它们放到不同的优化路径上。VFA 的核心智慧不是发明新合并算法,而是识别出"学语言"和"保对齐"的冲突根源在于共享梯度通路,然后用"独立训练 + 向量合成"把冲突降为线性叠加的有限干扰。这个解耦思想适用于一切多目标学习场景:推荐系统的个性化和公平性、代码模型的正确性和安全性、Agent 的探索与利用。

3. 最大的资源约束往往可以用另一种模态绕过。“缺多语言图文对"这个约束,被"多语言文本管够"这个事实破解了。跨模态迁移的本质洞察:语言骨干学好的东西,视觉对齐完好时能自动受益。遇到数据瓶颈时先问:这个能力是否必须用目标模态的数据学?也许别的模态已经学会了。

4. 指标异常是理解模型的窗口,不是需要抹平的噪声。FLORES -13.94 的反常没有被打补丁掩盖,而是被诊断到 EOS 生为层面——首句翻译正确说明能力在,问题出在停止信号。这种"分数 → 行为 → 机制"的排查习惯,比盲目调参宝贵得多。也提醒 BLEU 这类基于参考的指标会把生成长度问题误报成能力问题。

5. 简单方法的上限与边界同样重要。VFA 到 Pangea 还差 2.5 分,论文诚实地指出这需要成对监督才能补——知道一个方法的边界(感知密集任务、更大规模、更严数据清洗)与知道它的优势一样有价值。方法论文的局限章节就该这么写。

6. 冻结也是一种设计。视觉编码器和投影层的"完全不动作”,是这个框架能工作的前提之一。在到处都是"全部端到端联合训练"的时代,明确哪些组件应当被保护、以什么粒度保护(这里细到排除视觉 embedding 参与合并),是工程成熟度的体现。

总而言之,VFA 是一篇"小而美"的工作:方法只用了一个(任务向量合成),却精准命中了多语言 MLLM 的数据瓶颈与遗忘痛点,用 2% 的数据和 1/30 的成本拿到了大部分收益。对资源有限又想给自有 MLLM 加多语言能力的团队,这是目前性价比最高的路线图;对研究者,它再次证明了参数空间操作这个"模型urgery"方向的实用潜力——值得与同期的数学合并、编程合并工作放在一起,看成同一个趋势的多个切面。