论文链接:SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 代码仓库:GitHub - IANNXANG/SpatialCLI 模型权重:HuggingFace - ZYT-MFM/SpatialCLI-8B 发表时间:2026年7月 机构:多机构联合团队(浙江大学 Yang Zhou/Yuxiang Cai 等) 领域标签:cs.AI / 空间推理 / 工具增强VLM / 能力内化
一、论文背景
1.1 什么是"空间感知"问题?
想象一个具身智能机器人在客厅里执行一个看似简单的任务:“找到离你最远的那个泰迪熊,然后告诉我它朝哪个方向。”
这个任务对人类来说毫不费力,但拆解开来,它需要四种截然不同的感知能力按特定顺序组合:
- 定位(Locate):先用语义理解找到所有候选泰迪熊在画面中的位置
- 分割(Segment):获取每个泰迪熊的精确轮廓边界
- 度量深度(Depth):比较每个泰迪熊到相机的距离(注意,不是相对远近,而是以米为单位的绝对距离)
- 姿态估计(Pose):判断选中泰迪熊的朝向(前/后/左/右)
这四种能力——定位、分割、深度、姿态——构成了空间感知的核心。它们是物理AI(Physical AI)从实验室走向真实世界的基石能力。
1.2 当前的能力错配困境
当前的AI世界存在一个令人沮丧的"能力错配":
| 模型类型 | 擅长什么 | 不擅长什么 |
|---|---|---|
| 通用VLM(如GPT-5.6、Qwen3-VL) | 语义理解、任务分解、多步推理 | 精确定位(物体边界框偏差大)、度量深度(无法说出"0.5米"这样的绝对值)、姿态感知(无法判断物体朝向) |
| 专家视觉模型(如SAM 3、Depth Anything 3) | 精确的局部感知输出 | 缺乏任务级理解,无法自主组合多个输出完成复杂任务 |
打个比方:通用VLM像一个能理解图纸但手艺粗糙的工程师——他知道要做什么,但无法精确测量。专家视觉模型像一个手艺精湛但不看图纸的工匠——他能精确切割每个零件,但不知道最终要组装什么。
问题核心:这两种能力被割裂在不同的模型中,没有一种机制让它们有机融合——VLM无法利用专家模型的精确感知来弥补自身不足,专家模型也无法理解VLM的任务意图来自主协作。
1.3 为什么现有的"工具调用"方法不够?
一个自然的想法是:让VLM像调用函数一样调用专家视觉模型——这正是工具增强Agent(Tool-Augmented Agent)的思路,如ReAct、Toolformer等框架。
但这面临两个根本困难:
困难一:工具调用质量差。 初始的VLM不擅长"什么时候该用哪个工具"——它会格式错误地调用工具、传入无效参数、不必要地重复调用,甚至忽略与自身先验信念冲突的工具结果。直接对这种初始模型做强化学习(RL),探索空间太大、失败模式太多,训练极不稳定。
困难二:能力停留在"借用"而非"拥有"。 即使VLM学会了熟练使用工具,精确感知能力仍然驻留在外部专家模型中。这就像一个人学会了查字典,但永远无法脱稿演讲——每次推理都必须付出调用外部工具的开销(延迟、API成本、系统复杂度)。
SpatialCLI要解决的就是这两个问题:如何让VLM先学会用好工具,再将工具提供的能力真正"内化"为自己的推理能力。
二、论文定位和关联工作
2.1 研究脉络梳理
SpatialCLI处于三条研究脉络的交汇点:
脉络一:直接训练VLM获得空间能力
- SpatialVLM(2024):通过空间问答数据直接训练VLM做空间推理,但受限于训练数据中空间标注的精度和覆盖面
- SpatialRGPT(2024):在VLM中插入深度线索模块,通过3D标注增强空间理解
- RoboRefer(2025):通过多样化2D和3D空间参照数据训练
- VLM3(2026):展示标准VLM架构可从文本监督学习深度、像素对应、相机姿态和物体级3D理解
这些方法的共同局限:空间能力是通过训练数据"灌"进去的,而非从精确感知中"学"来的——数据标注的噪声和覆盖面决定了能力天花板。
脉络二:工具增强Agent
- ReAct(2023):LLM交替执行推理(Reasoning)和行动(Acting),行动即工具调用
- Toolformer(2023):让LLM自监督学习何时调用工具
- HuggingGPT / VisProg / ViperGPT:用LLM作为控制器调度专家视觉模型
- SpaceTools(2025)、AlloSpatial(2026):将空间推理工具暴露给VLM的Agent框架
这些方法的共同局限:VLM始终只是工具的"调度者"而非"学习者"——工具能力永远停留在VLM外部。
脉络三:知识蒸馏与能力迁移
- 在线策略自蒸馏(OPSD):用更强的教师模型蒸馏知识到学生模型
- GRPO(DeepSeek Math, 2024):组相对策略优化,通过组内相对比较实现高效RL
2.2 SpatialCLI的定位突破
| 维度 | 之前的路线 | SpatialCLI的突破 |
|---|---|---|
| 能力来源 | 通过训练数据灌输空间能力 | 通过工具使用轨迹学习空间能力 |
| 工具角色 | 永久依赖外部工具 | 工具是"脚手架",最终内化后可去掉 |
| 训练策略 | 直接SFT或直接RL | Cold-Start SFT → Agentic RL → 能力内化三阶段 |
| 最终状态 | 要么有工具无能力,要么有能力无工具 | 工具使用与内化能力共存 |
核心定位:SpatialCLI首次提出了"先用工具学会,再去掉工具"(Learn with tools, then without them)的范式——将工具使用从"永久依赖"变为"学习脚手架",最终能力内化后模型可以脱离工具独立推理。
三、问题定义
3.1 从具体场景到抽象本质
具体场景:如何让一个8B参数的小VLM在空间感知任务上达到甚至超越GPT-5.6 Sol(数千亿参数前沿模型)的水平?
抽象本质:如何将驻留在异构外部专家模型中的感知能力,可控地迁移到一个统一模型中,使其既能保留工具使用能力(必要时可调用),又获得独立的感知推理能力(无工具也能做)?
3.2 形式化定义
给定:
- 初始VLM策略 $\pi_0$(如Qwen3-VL-8B-Instruct,无工具时空间感知弱)
- 空间专家工具集 $\mathcal{U} = \{\text{Locate}, \text{Segment}, \text{Depth}, \text{Pose}\}$
- 任务分布 $\mathcal{D}$(需要组合空间感知的视觉问答任务)
求:训练后的策略 $\pi_\theta$,使得:
- 工具增强能力:$\pi_\theta$ 配合工具时性能 $\gg$ $\pi_0$ 配合工具时性能
- 内化能力:$\pi_\theta$ 不配合工具时性能 $\gg$ $\pi_0$ 不配合工具时性能
- 能力共存:工具使用能力不被内化训练破坏
约束:
- 不能直接修改专家工具的内部参数
- 训练数据不能包含标注好的"正确感知链"(否则就是普通SFT了)
- 工具调用结果不能保证正确(专家模型也有误差)
3.3 抽象的精妙之处
这个定义的精妙在于约束3(能力共存)——大多数蒸馏方法要么保留工具能力但无法内化,要么内化了但丧失工具使用能力。SpatialCLI要求两者并存,这意味着内化不能通过"覆盖"工具使用知识来实现,而必须找到一种让两种能力正交互补的训练方式。
四、问题解法
SpatialCLI的三阶段框架——Call → Learn → Internalize——每一步都解决前一阶段留下的瓶颈。
4.1 Call阶段:推理时工具增强
类比:这就像给一个只会看图纸的工程师配了一套精密测量工具——他的手艺没变,但有了工具就能做更精确的事。
核心机制:采用ReAct范式,VLM在每个交互步骤中先内部推理($z_t$),然后决定是给出最终答案还是调用工具($a_t$)。工具执行后返回结果($o_t$),VLM继续推理,直到给出答案或耗尽调用预算。
四个空间工具:
| 工具 | 底层模型 | 输入 | 输出 | 解决什么问题 |
|---|---|---|---|---|
| Locate | Locate Anything + Grounding DINO | 语言查询 | 物体边界框 [x_min, y_min, x_max, y_max] | VLM无法精确定位物体 |
| Segment | SAM 3 | 语言查询 | 多边形物体边界(3-16个顶点) | VLM无法获取精确轮廓 |
| Depth | Depth Anything 3 | 图像中查询点 | 度量深度(米) | VLM无法判断绝对距离 |
| Pose | Orient Anything V2 + VGGT | 物体或相机运动查询 | 物体朝向(8方向)/ 跨视图相机运动 | VLM无法判断朝向和视角变化 |
关键设计——结构化返回而非视觉叠加:
论文做了一个反直觉的设计:工具返回的是结构化文本坐标(如bbox_2d: [234, 156, 567, 489]),而不是在原图上画红框。消融实验证明这至关重要:
| 返回格式 | SpatialCLI-Bench |
|---|---|
| 仅红框可视化 | 45.9% |
| 结构化+可视化 | 66.0% |
| 仅结构化(本文) | 66.5% |
为什么结构化更好? 因为结构化坐标可以直接转化为文本,成为后续"能力内化"的训练监督——模型从"看到坐标"到"说出坐标"是一条直路。而红框只是视觉提示,模型看到红框后仍然无法把精确坐标"说出来"。
4.2 Learn阶段:Agentic微调(Cold-Start SFT + Agentic RL)
Call阶段留下的问题是:初始VLM的工具调用质量太差——格式错、参数无效、重复调用、忽略结果。Learn阶段通过两步解决。
4.2.1 Cold-Start SFT
类比:就像学徒跟着老师傅做一遍——先建立肌肉记忆,知道工具的基本用法。
做法:用Qwen3.5-397B-A17B作为教师模型,配备相同的Agent框架,记录完整的多轮工具交互轨迹。然后严格过滤——丢弃格式错误、执行失败、最终答案错误的样本,只保留高质量轨迹(约40%通过率),训练出SpatialCLI-SFT。
为什么需要SFT而不是直接RL? 消融实验显示了一个关键现象:
| RL策略 | 每条轨迹工具调用数 |
|---|---|
| RL with Tools without SFT | 3.36 → 6.74(膨胀!) |
| RL with Tools + SFT | ~2.56(稳定) |
没有SFT的冷启动,RL探索时模型会膨胀式地调用工具(从3.36次涨到6.74次),因为模型还没学会"什么时候不需要调用工具"。SFT提供了稳定的工具使用策略基线,RL在此基础上才可能优化而非发散。
4.2.2 Agentic RL
类比:学徒出师后自己独立干活,根据任务成败调整策略——做得好的多做,做错的少做。
核心算法:GRPO(组相对策略优化)。对每个任务采样 $G=8$ 个完整交互轨迹,每个轨迹获得结果奖励 $R_i$,计算组内相对优势:
$$\hat{A}_{i,\ell} = \frac{R_i - \text{mean}(\{R_j\})}{\text{std}(\{R_j\})}$$关键技巧:使用DAPO的Clip-Higher机制($\varepsilon_{\text{low}}=0.20$, $\varepsilon_{\text{high}}=0.28$),允许正面优势信号有更大的更新幅度,避免策略过早收敛到次优工具使用模式。
训练后产生SpatialCLI-RL——一个工具调用质量高、能组合多个专家工具完成复杂空间推理的Agent。
4.3 Internalize阶段:轨迹引导的能力内化
这是全文最核心的创新。 Learn阶段产出的模型虽然工具用得好,但精确感知能力仍驻留在外部专家中。Internalize阶段要解决:如何把"借用来的能力"变成"自己的能力"?
4.3.1 渐进式证据支撑轨迹语言化
问题:原始的工具使用轨迹充满了冗长的推理、工具调用语法、异构工具返回——直接拿来做训练数据效果极差(消融中CoT+Answer仅45.0%)。
解决方案:两步语言化——
第一步:逐轮证据整合。每轮工具交互后,提取当前工具结果中的穷尽语言化信息——把深度值、坐标、朝向等结构化输出全部转化为自然语言描述。要求每个感知陈述都必须可追溯到当前工具结果或之前的单元,正确答案不暴露(防止模型逆向工程答案)。
第二步:全局轨迹语言化。将整个交互过程组织成一条简洁的感知推理链——从工具证据到最终答案的因果逻辑链。
类比:就像一个翻译过程——原始轨迹是"工程师的工作日志"(充满代码、API调用、原始数据),语言化后变成"教科书讲解"(清晰的因果叙述)。
4.3.2 Dual-View Capability Internalization(双视图能力内化)
核心设计:从每个成功轨迹构建两个训练视图:
| 视图 | 提示类型 | 监督目标 | 训练什么 |
|---|---|---|---|
| 能力内化视图 | 直接回答提示(无工具描述) | 显式感知推理链 + 最终答案 | 无工具独立推理能力 |
| 工具使用视图 | 包含工具描述的提示 | 原始交互中的推理、工具调用、答案 | 保留工具使用能力 |
联合优化:$\mathcal{L}_{\text{CI}} = \mathcal{L}_{\text{internal}} + \lambda \mathcal{L}_{\text{agentic}}$,$\lambda=0.5$
为什么需要双视图? 消融给出了清晰的答案:
| 内化变体 | 无工具分数 | 带工具分数 |
|---|---|---|
| 仅内化视图 | 71.1% | 62.6%(下降!) |
| 仅工具使用视图 | 42.2%(没内化) | 89.0% |
| 双视图(本文) | 72.7% | 91.3% |
仅内化视图虽然无工具能力强,但会遗忘工具使用能力(62.6% < 初始66.5%)。双视图通过联合优化确保两种能力共存——无工具达72.7%的同时,带工具保持在91.3%。
4.4 全景流程总结
初始VLM(π₀) 能力:语义理解强、空间感知弱
│
▼ Call阶段:注册空间工具
带工具的VLM(π₀ + Tools) 能力:可调用工具但用不好
│
▼ Learn阶段①:Cold-Start SFT
SpatialCLI-SFT(π_SFT) 能力:基础工具使用行为稳定
│
▼ Learn阶段②:Agentic RL(GRPO)
SpatialCLI-RL(π_RL) 能力:高质量工具组合调用
│
▼ Internalize阶段:双视图内化
SpatialCLI(π_θ) 能力:无工具独立推理 + 工具增强共存
五、评估指标与实验证据
5.1 评估指标体系
SpatialCLI的评估覆盖三个层次:
层次一:端到端任务准确率
- SpatialCLI-Bench(516样本):覆盖定位+分割+深度+姿态的组合感知六选一问答
- MindCube:多视图空间推理
- MMSI(Motion-Cam + Pos-Cam-Cam):运动和位置相关的空间推理
- DA-2K:度量深度估计
- BOPASK(Trajectory + Object-Rearrangement):轨迹规划和物体重排
层次二:能力内化指标(CII)
- 四种能力的独立质量评估:Locate CII(IoU)、Segment CII(掩码IoU)、Depth CII(exp(-AbsRel))、Pose CII(余弦相似度)
- 在1000个留出样本上评估,每种能力200例
层次三:工具使用行为
- 平均工具调用数、调用工具的样本比例、每调用样本的平均调用数
5.2 核心实验结果
主实验:SpatialCLI-8B vs 前沿模型
| 模型 | SpatialCLI-Bench | MindCube | DA-2K | 平均 |
|---|---|---|---|---|
| Qwen3-VL-8B-Instruct(基座) | 35.3 | 29.3 | 68.1 | 35.7 |
| + SpatialCLI Tools | 66.5 | 47.2 | 91.6 | 56.7 |
| SpatialCLI-8B(无工具) | 72.7 | 73.8 | 80.8 | 62.9 |
| SpatialCLI-8B(带工具) | 91.3 | 84.6 | 91.8 | 73.2 |
| GPT-5.6 Sol(无工具) | 48.8 | 70.3 | 79.2 | 62.0 |
| GPT-5.6 Sol + SpatialCLI Tools | 72.9 | 72.1 | 86.1 | 68.1 |
关键发现:
- SpatialCLI-8B无工具(72.7)已超越GPT-5.6 Sol无工具(48.8)在SpatialCLI-Bench上的表现——8B小模型通过内化超越了数千亿参数前沿模型
- SpatialCLI-8B无工具在MindCube上达73.8%,比基座29.3%提升44.5个百分点——内化效果显著
- 内化后的模型仍可受益于工具增强(72.7→91.3),证明能力共存
消融实验:三阶段缺一不可
| 方法 | 无工具 | 带工具 |
|---|---|---|
| 初始模型 | 35.3 | 66.5 |
| 仅RL无工具+SFT | 51.6 | 48.1 |
| 仅RL有工具+SFT | 40.1 | 91.3 |
| SpatialCLI(完整三阶段) | 72.7 | 91.3 |
这个实验证明了什么? 仅做RL(不内化),无工具能力只能到40.1(甚至低于初始的35.3的合理范围)——因为RL学到的是"如何调用工具"而非"如何感知"。只有经过Internalize阶段,无工具能力才从40.1跃升到72.7。三个阶段各有不可替代的角色:Call提供即时感知支持、Learn稳定工具策略、Internalize将工具能力转移到推理中。
5.3 评估设计的证明力
为什么这些实验能证明论文的核心主张?
论文的主张是"工具→RL→内化"的渐进范式。关键验证点:
- 内化确实发生了(而非工具增强的残留效应):CII指标直接测量无工具条件下的感知质量,从45.6提升到61.6,且与无工具准确率呈一致的上升趋势(Figure 4a/4b)。
- 内化不是以牺牲工具使用为代价:双视图训练保留了工具使用行为(平均调用1.27次,与仅工具使用视图的1.28几乎相同),而仅内化视图会膨胀到20.70次——说明双视图设计精确控制了能力共存。
- 内化随模型容量持续扩展:工具使用性能在8B/27B/35B间差异不超过1分(饱和),但内化CII随容量大幅提升——证明内化是一个可规模化的轴,而非固定天花板。
六、效果优势的根源解释
6.1 为什么SpatialCLI-8B能超越GPT-5.6 Sol?
baseline的根本局限:GPT-5.6 Sol虽然参数量大数千倍,但其空间感知能力是通过海量预训练数据"隐式习得"的。这种隐式学习有两个不可逾越的障碍:
- 精度天花板:预训练中的空间标注(如"远处的山")是模糊的相对描述,而非"0.5米"这样的绝对值。模型从模糊标注中无法学到精确度量。
- 组合困难:即使大模型在单个空间能力上尚可,组合多种能力(先定位再深度再姿态)需要精确的中间结果传递——大模型的"链式推理"在每一步都可能丢失精度。
SpatialCLI的根本性改变:
- 精度来源改变:从"预训练隐式学习"变为"从专家工具的精确输出显式学习"。专家工具(如Depth Anything 3)的深度输出是以米为单位的度量值——这种精度是预训练数据无法提供的。
- 组合机制改变:从"模型内部链式推理"变为"工具间的精确结果传递"。工具返回结构化坐标(
bbox_2d: [234, 156, 567, 489]),下一个工具和模型推理都基于精确数值而非模糊印象。
因果链:专家工具的度量级精度 → 结构化返回转化为可学习文本 → SFT+RL学会组合调用 → 内化将度量级精度蒸馏到模型推理中 → 无工具也能产生精确感知(如Case 3中内化后估计深度0.362m vs 工具测量0.351m,误差<3%)。
6.2 为什么"结构化返回"比"红框可视化"更有效?
表面解释:结构化坐标比红框提供了更多信息。❌(这不准确——红框也包含坐标信息)
根源解释:信息表示模态的根本差异决定了可内化性。
- 红框可视化是视觉模态——模型"看到"红框但无法将其转化为文本输出。它是一种"感知增强"而非"能力增强"——推理时有用,但训练时无法作为文本监督。
- 结构化坐标是文本模态——与模型的输出空间对齐。模型不仅"看到"坐标,还能"说出"坐标。这种模态对齐使得工具输出可以直接转化为能力内化的训练监督——从"看到0.5米"到"说出0.5米"是一条直路。
因果链:结构化返回(文本模态) → 与模型输出空间对齐 → 可直接作为内化监督 → 工具的度量级精度被蒸馏到模型的文本生成中 → 无工具时模型也能生成精确感知描述。
6.3 为什么双视图训练能实现能力共存?
baseline(仅内化视图)的局限:如果只训练"无工具直接回答",模型会学会直接推理但遗忘工具使用语法和行为——因为训练数据中完全没有工具调用模式。
双视图的根本性改变:
- 内化视图教会模型"如何不依赖工具推理"——学习的是感知能力的语义内容
- 工具使用视图教会模型"如何调用工具"——学习的是工具使用的语法形式
这两种学习目标在表征空间中是正交的——语义内容(什么是深度、什么是朝向)与语法形式(如何格式化工具调用、如何处理返回值)不冲突。双视图联合优化同时维护两个正交维度的知识,因此能力可以共存。
反事实验证:$\lambda$从0.2到1.5的消融显示,CII Macro稳定在60.5-60.8(仅$\lambda=1.5$时下降到55.6),说明内化能力对工具使用视图权重不敏感——进一步证明两个视图的正交性。
七、必要知识反推
7.1 领域知识层
- 空间感知的四元组:定位、分割、深度、姿态——必须理解它们各自解决什么问题、为什么不可相互替代
- VLM的能力边界:必须知道当前VLM在哪些空间任务上可靠(语义理解)哪些不可靠(度量深度、精确边界),否则无法定义问题
- 专家视觉模型的能力与局限:必须了解SAM 3、Depth Anything 3、VGGT等模型各自的输入输出格式和精度特点,才能设计工具接口
7.2 方法论知识层
- ReAct Agent范式:理解推理-行动交替的交互循环,才能设计Call阶段的Agent框架
- GRPO强化学习:理解组相对优势的计算和Clip-Higher机制,才能设计Learn阶段的RL训练
- 知识蒸馏理论:理解教师-学生蒸馏的信息流动,才能设计Internalize阶段的轨迹语言化
- 多任务学习中的灾难性遗忘:理解为什么单视图训练会导致遗忘,才能设计双视图方案
7.3 工程知识层
- 工具调用格式设计:坐标系统约定([0,999]范围、原点位置)、序列化格式(bbox_2d/polygon_2d),需要大量工程细节
- 缓存设计:两层缓存(进程内LRU+磁盘),基于SHA-256键的内容寻址,平均延迟2.916秒——这些工程决策直接影响训练效率
- 评估指标设计:CII指标族的设计需要同时考虑定位IoU、分割掩码IoU、深度AbsRel、姿态余弦相似度的归一化
7.4 知识融合的关键节点
创造性融合节点:“结构化返回→文本监督→能力内化"的贯通。这需要同时理解:
- 工具输出格式设计(工程知识)
- 模态对齐原理(方法论知识)
- 空间感知能力的可分解性(领域知识)
单独掌握任何一项都无法想到这个设计——只有三者融合才能发现"让工具返回文本坐标而非视觉叠加"这个看似简单却至关重要的洞察。
八、论文中可以提取的通用性灵感
灵感一:“工具作为脚手架而非永久依赖"范式
核心思想:外部工具/模型不必永久作为推理时的依赖——可以先通过工具使用积累成功轨迹,再将轨迹中的能力蒸馏到模型自身,最终实现"无工具独立推理+工具可选增强”。
论文证据:SpatialCLI-8B无工具从35.3→72.7,且带工具仍可达91.3。
推广场景:
- 代码生成Agent:先用代码执行工具验证生成代码,再将"验证→修复"的能力内化为模型的自我纠错推理
- 搜索Agent:先用搜索引擎获取信息,再将"什么查询能找到什么信息"的检索策略内化为模型的知识定位能力
- 数学推理:先用计算器/符号求解器验证步骤,再将数值精度和符号操作能力内化为模型的隐式计算
- 多语言翻译:先用词典/语法工具辅助翻译,再将工具提供的精确对应内化为模型的直接翻译能力
灵感二:“模态对齐决定可内化性"原理
核心思想:当需要将外部能力蒸馏到模型中时,外部能力的信息表示模态必须与模型的输出空间对齐——文本模态的能力最容易内化到LLM/VLM中,因为内化监督可以直接从文本到文本。
论文证据:结构化文本坐标(66.5%)» 红框可视化(45.9%),差异20.6分。
推广场景:
- Agent技能蒸馏:将工具的使用经验转化为可学习文本技能(如SKILL-KD的"技能补丁”)
- 多模态知识图谱:将视觉/音频知识转化为文本描述以便LLM内化
- 专家系统迁移:将规则引擎的决策逻辑转化为自然语言推理链以便神经网络学习
灵感三:“Cold-Start SFT防止RL探索膨胀"的训练策略
核心思想:在复杂动作空间(如多工具组合)上直接做RL会导致探索行为膨胀(无效动作增加),需要先用SFT建立稳定的行为基线,再在基线上做RL优化。
论文证据:无SFT的RL工具调用从3.36膨胀到6.74;有SFT的RL稳定在2.56。
推广场景:
- 机器人操作RL:先用模仿学习建立基线动作,再做RL优化
- 对话系统RL:先用SFT学会基本对话模式,再做RL优化策略
- 任何多步骤决策的RL训练:当动作空间复杂时,“SFT冷启动→RL优化"比"直接RL"更稳定
灵感四:“双视图正交训练实现能力共存”
核心思想:当需要模型同时拥有两种能力(如工具使用+独立推理),且一种能力的训练可能破坏另一种时,可以通过构建两个训练视图并联合优化来利用两种能力在表征空间中的正交性实现共存。
论文证据:双视图(无工具72.7/带工具91.3)» 仅内化视图(71.1/62.6)或仅工具视图(42.2/89.0)。
推广场景:
- 持续学习中的遗忘防护:为新任务构建"新能力视图”+“旧能力视图"联合训练,防止学习新能力时遗忘旧能力
- 多语言模型:为不同语言构建独立视图,防止语言间干扰
- 安全与能力的共存:为"有用性"和"安全性"构建双视图,避免安全训练破坏能力