论文链接:WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 项目主页:WeAgent-MMSearch Project Page 发表时间:2026年8月 机构:腾讯微信AI(Weixin AI, Tencent)+ 中山大学(Sun Yat-sen University)。企业研究员主导(论文标注了项目负责人与通讯作者均来自微信AI),高校学生参与合作,属于典型的企业+高校联合工作。 领域标签:cs.AI,多模态智能体、搜索智能体、后训练
一、论文背景
要理解这篇论文,先要理解三个层层递进的概念。
多模态搜索智能体是什么? 多模态大模型(MLLM)的知识来自静态训练语料,语料再大也有边界:长尾实体、最近发生的事件、特定来源的事实,模型要么没见过,要么记忆已经过时。解决办法是让模型学会用外部工具——搜索拿最新证据、网页抽取拿上下文、图片工具拿到文字无法提供的视觉事实。这就叫多模态搜索(MMSearch):模型要能识别自己缺什么信息、调用合适的工具、再把多模态证据整合进答案。论文开头举的例子很直观:问『2026 年冬奥会上某国铜牌得主的赛服是什么颜色』,模型参数里根本没这条信息——比赛是训练截止后发生的,必须去搜,而且答案写在一张照片的像素里,不在任何文字里。
Harness(智能体运行环境)是什么? Harness 就像智能体的『驾驶舱』:它定义模型能看到什么状态、能调用什么工具、工具返回什么格式的观测、出错时怎么办。模型本体只负责生成下一个动作,其余一切——状态管理、工具路由、观测构造、预算控制——都是 harness 的职责。对智能体而言,harness 决定了信息流的边界:模型再强,看不到的信息也用不上。
当前方法的核心缺陷正是出在 harness 层,论文点出三个:
- 视觉反馈不完整。许多现有搜索环境把检索结果只用文本呈现,工具返回的图片从后续上下文中消失。视觉事实往往无法被忠实转写成文字(赛服的颜色、图表里某条曲线的形状),于是名义上的多模态轨迹坍缩成纯文本推理。论文的图 2 做了三段对比:同一个 MLLM 直接答会错(先验驱动、无视证据);接一个纯文本 harness 还是错(先验驱动、视觉盲);只有在图片被保留并跨轮回灌的环境里才答对。
- 长时程交互放大执行异常。多轮工具调用中,工具名或参数写错、单轮输出过长、超时、预算耗尽——这些异常在推理时中断回答,在训练时浪费已经花掉的 rollout 算力,还会把与搜索策略质量无关的失败信号混进梯度更新。
- 高质量监督稀缺。MMSearch 风格的任务要跨多步检索保持视觉依赖、要在目标工具契约下可执行,专家轨迹的采集还需要真实搜索、网页访问、图片获取与代码执行。任务合成、有效性校验、轨迹采集三道关卡共同限制了监督数据的供给。
一句话概括动机:环境丢图 + 异常轨迹污染训练 + 数据稀缺,三者分别对应这篇论文的三个产出——harness、训练算法、数据流水线。
二、论文定位和关联工作
论文把关联工作组织成三条谱系,本工作在每条谱系上都补了一块明确的空缺。
谱系一:智能体搜索(Agentic Search)。早期系统走模块化路线:AVIS 用规划器+推理器协调网页搜索、图片搜索与视觉感知工具;Vision Search Assistant 把视觉语言模型与网页智能体拼接。近期工作转向端到端 RL:借鉴文本搜索智能体(如 Search-R1)的范式,用单个视觉语言模型交替执行推理与搜索,代表有 MMSearch-R1、DeepMMSearch-R1、WebWatcher 等;OpenSearch-VL 和 Skywork-R1V4 进一步扩充了主动图像操作工具(OCR、裁剪、增强)。但论文指出:这些系统中,检索网页内嵌的图片常常不在模型可见的观测里,工具返回图片能否保留到后续轮次的支持参差不齐。WeAgent-Harness 的差异化在于把工具返回图片以稳定引用持久存储,并显式供后续推理与工具调用使用。
谱系二:长时程搜索的数据与优化。REDSearcher 用推理图拓扑与证据分散度控制合成任务难度,并协同设计中训与后训以降低交互成本;OpenSearch-VL 从 Wikipedia 采样路径、做模糊实体改写与源锚定的视觉定位,配合多样化工具环境与失败感知的 agentic RL。这些方法的任务合成主要基于既有实体源,对新种子实体——尤其是时效性事件——的系统化发现不在主线上。本文的数据流水线则同时从 Wikipedia 实体与实时网络事件发现种子,并在与训练、推理完全相同的执行契约下构造视觉依赖的反向多跳任务。
谱系三:多模态搜索基准。MMSearch 做组件级与端到端评测;MMSearch-Plus 强调溯源与证据归因;MM-BrowseComp 用专家撰写的多跳浏览题。这些基准都不是围绕『目标图像诊断』设计的。VisTarget-Bench 的独特之处:每道题配一张留出的目标图像,智能体返回答案的同时给出支撑图像的索引——把『找没找到对的图』和『用没用对这张图』拆开度量。
| 维度 | 之前的路线 | 本论文的突破 |
|---|---|---|
| 视觉证据处理 | 图片丢弃或仅在单轮可见,多模态轨迹退化为文本推理 | 图像注册为磁盘持久引用 + 可寻址标识,跨轮回灌 |
| 训练信号净化 | 异常轨迹当作普通样本进组归一化,或整批丢弃浪费算力 | 先恢复(超长重生成、错误自纠正、预算末答)再过滤,仅合格轨迹参与优势计算 |
| 任务种子来源 | 固定实体库(如 Wikipedia 路径采样) | 固定库 + 以五天为窗的实时网络事件挖掘 |
| 评测诊断粒度 | 只看最终答案对错 | 答案准确率与图像引用率、目标匹配率、匹配后准确率四级分解 |
定位结论:这不是一篇单纯刷分的论文,而是一篇『环境-数据-算法』三位一体的系统论文——它论证的命题是:harness 的信息保真度(图不丢)本身就是多模态搜索智能体的第一性瓶颈,环境契约应该贯穿数据构造、训练与推理全程。
三、问题定义
论文面对的具体场景是:训练一个会搜网、会看图、会写代码的搜索智能体。抽象掉工程细节后,它识别出的深层结构是两个被以往工作混在一起的问题:
问题 A:证据状态问题。 智能体轨迹本质是一个交替序列 τ = (q, (a₀,o₀), …, (a_T,o_T), y),其中观测 o_t 可以包含文本与新检索的像素。论文的核心洞察是:传统环境把 o_t 中的图像视为一次性的,而正确的抽象应把图像作为一等公民的状态变量——就像强化学习里的环境状态不应在转移中丢失分量。这等价于问:给定一个多模态观测流,如何定义最小契约,使任何时刻检索到的像素在此后所有轮次都保持可引用、可处理、可引用作答?
问题 B:训练信号问题。 组相对策略优化(GSPO 这类算法)假设组内每条轨迹都是策略质量的有效样本。但 agentic rollout 里,超时和格式错误产生的截断轨迹,其奖励与搜索策略好坏无关。论文把『运行时可恢复性』与『优化资格』拆成两个正交判定:先问这条轨迹能否被恢复成有效完成,再问恢复后的轨迹是否参与本次梯度更新。
形式化地:给定提示组 {o_gi},动态构造合格集 E_g = {i | o_gi 恢复后仍可训练},仅对 i ∈ E_g 计算。
| 深度学习/经典概念 | 本论文对应物 |
|---|---|
| 环境状态转移 | 证据工作区:文本历史 + 已注册图像联合序列化进每轮上下文 |
| 变量作用域/指针 | 图像的稳定标识(如 search_image_3)+ 来源元数据 |
| 数据清洗中的异常样本处理 | 先修复可修复的(重生成、自纠正)、再剔除不可修复的,而非一刀切 |
| 组归一化(如 batchnorm 按批统计) | 仅在合格子集上计算组均值与方差,异常轨迹不进统计量 |
这个抽象的精妙之处在于:两个问题都不需要改模型架构、不需要过程标注、不需要 critic——改的只是模型可见状态的定义与优势计算的样本资格,属于环境与目标函数层面的最小干预。
四、问题解法
整套解法由三层组成,自底向上是 harness、数据流水线、训练算法。
4.1 WeAgent-Harness:持久多模态状态 + 可靠有界执行
持久多模态状态。Harness 维护一个跨轮持久的证据工作区:文本历史与已注册图像联合序列化进每个后续策略上下文,新检索的像素直接条件化后续推理与工具调用。所有工具输出(web_extract、图搜、反搜、代码执行)被规范化为含文本与图像的多模态观测;每张图绑定一个模型可见的稳定引用(如 user_image_1 或 search_image_3)并保留来源元数据——后续轮次可以无歧义地重访、反搜或对比同一视觉证据。这就像给每张图发了一个永不失效的『身份证』。
可靠且有界的执行,五类机制各管一段:
| 机制 | 类比 | 做法 |
|---|---|---|
| 缓存支撑搜索 | CDN 缓存 | 对规范化后的搜索请求维护共享精确匹配缓存;命中即返,未命中走实时后端;定期刷新防止变成离线语料 |
| 参数修复 | 编译器纠错 | 只修复无歧义的错配(工具名别名、标量转列表、多余字段);意图不明则返回结构化错误观测让模型自纠 |
| 重复抑制 | 死循环检测 | 与上一次已执行调用完全相同的调用不再执行,返回纠正性观测;连续两次相同非法调用后注入循环防护提示 |
| 超长重生成 | 超时重试 | 单轮超长输出被丢弃并给一次重生成机会,防止一个异常轮毁掉整条轨迹 |
| 预算控制 | 资源配额 | 20 常规轮 + 最多 1 次无工具总结轮 / 32 次调用 / 32,768 token / 900 秒;上下文或时钟超限的轨迹直接从训练中剔除 |
论文的总结很到位:这些机制定义的不只是运行时行为——持久证据决定了策略能观察到什么,缓存、恢复与预算决定了哪些交互能成为有限、可重放的训练样本。
4.2 Harness 原生的数据流水线(四阶段)
由 Kimi K2.6 挂载 WeAgent-Harness 充当专家 MMSearch 智能体,用与后续训练/推理完全相同的工具与状态契约执行:
- 视觉锚定种子生成:从时效性网络事件(按五天窗口扫描 2026 年 1-7 月,覆盖体育、科技、财经等领域)与 Wikipedia 记录中挖种子。种子准入条件:目标图像可经 harness 到达、答案依赖可见像素而非标题/URL/图注/元数据、来源可审计。
- 反向多跳扩展:从终端 VQA 种子 (n_d) 出发反向构造推理链 (n₀ → n₁ → … → n_d),跳数 d ∈ {2,3,4}。每步只给当前节点 n_i,专家在开放网络搜证据并写一个答案解析到实体的问答对,得到前驱 n_{i-1};控制器重复 d 次得到完整链条。解出组合任务需要沿桥接关系检索目标图像并读其像素。
- 任务校验:结构上要求锚点、桥接关系、端点、来源齐全;检索层面过滤目标图缺失、桥接不唯一、答案被 URL/元数据/题面泄露的记录;再检查推理链内部一致、答案确实依赖目标图像,最后合成面向用户的最终问题。
- 轨迹采样:专家在同一契约下解题(因为图像会回灌,构造时施加的视觉依赖在采样中真实兑现)。答案正确且完整的轨迹进 SFT 集;失败任务不用于行为克隆但保留为 RL 素材,RL 查询集按『模型可解/不可解』分层以平衡可行性与提升空间。
开源数据归一化:外部数据(Metis、OpenSearch-VL、REDSearcher)工具名、动作模式、答案惯例各异,直接混会让同一串行动作携带来源相关的语义。处理方式:剔除损坏/超长(单轮超 4,096 token 或总长超 48K);给每个来源的工具加命名空间前缀(如 RED_);把所有助手轮改写成两种规范形态——中间动作为 think+tool_call,终止轮为 think+response。最终 SFT 混合 59.5K 条轨迹(自建 3.3K + 开源 56.2K),RL 混合 13.3K 条提示(自建 4.9K + 开源 8.3K)。RL 提示还经 8-rollout 过滤:全对或全错的都丢弃(组内无对比信号),并用 Kimi K2.6 审计标签剔除非可判定目标。
4.3 VisTarget-Bench:诊断视觉证据使用
150 道人审验证任务(80 道带输入图、70 道纯文本起始),从 SFT/RL 划分前留出的种子构造,与训练混合零重叠。评测时模型返回最终答案 + 支撑图像索引,四个指标把『用图』拆成流水线:Accuracy(答案对不对)、Image Cite(有没有引用任何工具检索图像)、Target Match(引用的图与留出目标图匹配吗,由 VLM 裁判判定)、Match+Acc(匹配到目标后答案正确率)。这个设计把图像检索失败与视觉感知失败分离——最终答案错,可能是没搜到图,也可能是搜到了没读懂。
4.4 Agentic 后训练:SFT + FA-GSPO
SFT:标准下一 token 预测,工具观测与 harness 干预提示(以用户角色插入)都做 loss 掩码,只算模型生成 token 的损失——学的是策略本身,不学环境输出。这教会模型一个基本 ReAct 式检索策略:先推理、缺信息再搜、看到新视觉观测后修正计划。
FA-GSPO(Failure-Aware GSPO):GSPO 的 agentic 扩展,核心设计是恢复在先、过滤在后:
- 超长轮重生成一次(省下丢弃整条轨迹的算力);坏工具调用变成结构化观测供下一轮自纠;预算耗尽触发一次无工具最终作答。
- 仍然超长、或超上下文/时钟限制的轨迹被排除出优化——工具侧与模型侧失败不再干扰主任务信号。
- 奖励简单到只剩两端:R = 0.9·C + 0.1·F,C 是外部裁判的答案正确性,F 是终止轮格式合规。
- 合格集 E_g 上做组归一化得优势(不足两条合格轨迹的组整组丢弃——组内无偏好信号),再套进序列级裁剪 GSPO 目标(重要性比率是 token 级比率的几何平均)。
五、评估指标与实验证据
指标体系分三层:
- 主指标:8 个基准的平均分(MMBrowseComp、MMSearch、MMSearch-Plus、VisTarget-Bench、SimpleVQA、VDR-Bench、LiveVQA、FVQA),证明系统级主张。
- 诊断指标:VisTarget-Bench 四级视觉证据指标(Accuracy / Cite / Match / Match+Acc),证明『检索』与『感知』分离的主张。
- 消融指标:harness 对比(vs Hermes)、图像回灌开关、SFT 数据三档、FA-GSPO vs 原版 GSPO,逐一归因每个组件。
除高成本闭源模型单次运行外,所有配置跑三次报均值±标准差;由 Kimi K2.6 做裁判。
主结果(8 基准平均分):
| 模型 | 参数 | 平均分 |
|---|---|---|
| Qwen3-VL(直答,无工具) | 30B(3B) | 19.13 |
| Kimi K2.6(直答) | 1T(32B) | 21.92 |
| OpenSearch-VL-30B(同规模搜索智能体) | 30B(3B) | 47.21 |
| WeAgent-MMSearch-Base(Qwen3-VL + harness,不训练) | 30B(3B) | 36.75 |
| WeAgent-MMSearch-SFT | 30B(3B) | 51.04 |
| WeAgent-MMSearch-RL | 30B(3B) | 55.97 |
| Gemini3.6-Flash(挂同一 harness) | – | 63.26 |
| GPT-5.6-Sol-High(挂同一 harness) | – | 62.85 |
三个关键读数:仅换 harness 不训练,Qwen3-VL 从 19.13 升到 36.75(+17.62);后训练总共再 +19.22;最终 30B 模型逼近 10 倍参数量的 Gemini3.6-Flash 与 GPT-5.6-Sol-High,且超过所有同规模开源搜索智能体。
诊断结果(VisTarget-Bench,Base → SFT → RL):准确率 8.00 → 24.00 → 30.22;图像引用率 1.33 → 14.00 → 20.67;Target Match(SFT/RL)47.62 / 87.10;Match+Acc 70.00 / 77.78。无工具直答时 Qwen3-VL 只有 0.00、Kimi K2.6 只有 1.99——证明该基准几乎不可能靠参数记忆答对。值得注意的是 Match+Acc 没到满分:找到对的图不等于读对了图,这正是两级失败分离设计的价值。
消融链(每个数字都对应一个组件的因果证据):
- harness 因果:同一 Kimi K2.6,Harness 换成 WeAgent-Harness 后平均 55.09 → 58.42(VisTarget-Bench 20.01 → 33.78 提升最大);Gemini3.6-Flash 60.95 → 63.26;Qwen3.5-Plus 49.63 → 51.58。
- 图像回灌因果:保留全部工具接口、仅把返回图像从后续轮次移除,WeAgent-MMSearch-RL 平均分从 55.97 崩到 46.89(-9.08),MMSearch-Plus 掉 14.56、VisTarget-Bench 掉 19.78。这是全文最重要的反事实实验:视觉状态通道的贡献独立且巨大。
- 数据归一化因果:同样 56.2K 开源轨迹,原始格式 44.07 vs 归一化格式 48.06(+3.99);再加自建 3.3K 轨迹到 51.04(VisTarget-Bench 14.45 → 24.00)——一致的轨迹语法与同分布示范各自有贡献。
- FA-GSPO 因果:去掉恢复与过滤(退回原版 GSPO)平均 51.10 → 55.97,VisTarget-Bench 9.78 → 30.22(+20.44)——训练信号净化对 agentic RL 的收益集中在最需要长时程可靠性的场景。
- 恢复机制使用率(单次 RL 运行统计):超长重试触发率 3.7%、触发后 56.7% 的轨迹保留进训练;轮数耗尽后末轮作答触发率 7.0%、保留 43.4%;非法调用处理触发率 3.2%、保留 60.3%;上下文/时钟超限的直接排除。
实验设计为何能证明论点:harness 消融固定模型只换环境,隔离了环境契约的影响;图像回灌消融固定工具接口只删图像通道,隔离了视觉状态的影响;FA-GSPO 消融固定数据只改优化信号处理,隔离了训练净化的影响。三条消融链正交,各自的增量都能追溯到具体机制,这是本文实验设计的严谨之处。
六、效果优势的根源解释
对比对象一:纯文本 harness(Hermes 类)为什么曾经有效、如今不够? 文本 harness 对纯文本搜索智能体足够,因为文本证据转写无损。但多模态任务的答案可能只存在于像素中——赛服颜色、图表配色、文字排布方向。文本 harness 的根本局限不在工具集(它可以调用图搜),而在信息流:工具返回的图片进不了后续模型可见状态,等于证据在状态转移中被系统性丢弃。这不是『它没做图像回灌』的表面问题,而是其观测序列化协议决定了任何不可文字化的信息都会在下一轮消失——一个不可逾越的表征层瓶颈。WeAgent-Harness 的图像持久引用 + 跨轮回灌改变了信息流结构:像素一旦检索就永远在场,可被后续任意轮次引用、反搜、对比、甚至交给代码工具放大裁剪。因果链:图像成为一等状态变量 → 视觉证据不再从可见状态中消失 → 依赖像素的推理路径变得可行 → 体现在所有视觉依赖基准的提升;反事实(关掉回灌即掉 9.08 分)验证了这条通道的必要性。
对比对象二:原版 GSPO 为什么不够? GSPO 的组归一化假设所有 rollout 都是策略质量的样本。agentic 场景里超时/格式崩溃的轨迹拿到低奖励不是因为它搜得差,而是因为环境执行出岔子。把这些轨迹照常计入组均值和方差,等于往梯度里注入与策略无关的噪声——组内对比信号被稀释,策略学到的是『避免超时』而非『搜得更好』,最坏时超长轨迹的长尾还会拖垮 rollout 吞吐。FA-GSPO 的根本性改变在于把『执行失败』与『策略失败』两类信号解耦:可恢复的异常先恢复(一条被超长轮毁掉的轨迹通过一次重生成被救回,其中前 15 轮的优质搜索行为得以保留),不可恢复的剔除出统计量与梯度。因果链:恢复+过滤 → 组内奖励对比只剩策略质量差异 → 优势信号信噪比提升 → VisTarget-Bench 9.78 → 30.22 的跃升集中在最需要长时程稳定性的任务上。60.3% 的非法调用轨迹被救回进训练,直接量化了『不浪费已花算力』的收益。
对比对象三:固定实体源的数据流水线为什么不够? 从 Wikipedia 采样的任务有固定语料即可覆盖,但多模态搜索的独有价值恰恰在时效信息(比赛结果、新发布产品的截图)。本文以五天窗口扫实时事件做种子,使训练分布覆盖『固定语料里不存在』的信息需求。同时,专家轨迹在与其后训练/推理完全相同的契约下采集,保证示范分布与环境分布同源——数据消融中自建 3.3K 轨迹带来 VisTarget-Bench +9.55(14.45 → 24.00)的每条增益远高于开源轨迹,说明同分布示范的杠杆率极高。
还有一个不应忽略的诚实结论:Match+Acc 在目标图匹配后也只有 77.78%,说明瓶颈并未完全消除——检索到正确证据后仍有约两成的视觉解读失败。作者如实指出这一点,它同时定义了下一个研究方向的边界。
七、必要知识反推
假设一个零知识的人要完成这项工作,倒推其必须掌握的知识:
领域知识层:
- 多模态搜索任务的失效模式:参数知识过时、长尾实体缺失、视觉事实不可文字化。不理解这三点就无法定位『图像回灌』这个抓手。
- 智能体环境的解剖:状态管理、工具路由、观测序列化、预算控制分别是什么、各自如何影响模型可见信息。这是设计 harness 的前提。
- 长时程工具交互的异常分类学:工具名错、参数错、超长、超时、重复调用——每一类对应一种恢复策略,分类不全会导致恢复机制设计遗漏。
方法论知识层:
- GSPO 的组相对优势计算与序列级重要性比率(几何平均),否则无法在其上做『合格集』改造。
- ReAct 式交错推理-行动范式与 SFT 的 loss 掩码惯例(只对模型生成 token 计损失)。
- 反向多跳任务构造的思想(从答案端反推问题链),以及任务有效性校验的常见泄漏通道(URL、元数据、题面泄露)。
- 基准设计中的『失败分离』思想:单看准确率无法区分检索与感知两级失败,需要条件概率式的分级指标。
工程知识层:
- 异步 RL 基础设施:SGLang rollout 服务器、独立奖励服务器、Megatron 训练引擎的并行协同——rollout 与训练解耦是缓存与恢复机制能落地的地基。
- 搜索缓存的权衡:精确匹配、快照消费、定期刷新——把新鲜度换延迟的边界在哪里。
- 分布式数据归一化:异源工具命名空间的冲突处理与轨迹语法的规范化重写。
- MoE 模型(30B 总参/3B 激活)微调配置:语言模型与视觉塔差异化学习率、RL 阶段冻结视觉塔等实践细节。
知识融合的关键节点:
- 『环境契约统一』的洞察:把 harness 同时当作数据工厂、训练环境与推理运行时——这个一致性设计要求作者同时理解数据构造与 RL 训练两套流程,并在『同一契约』这个节点上融合它们,使得自建轨迹天然与训练分布对齐。
- 『可恢复性 vs 优化资格』的解耦:需要同时理解运行时工程(哪些错误可以确定性修复)与策略优化理论(哪些样本应该进梯度),在『恢复后再过滤』这个节点上融合两者。
- 『目标图像留出』的评测设计:把机器学习里的 held-out 思想从数据集层面迁移到证据层面——每道题的支撑图像本身留出,用引用索引与留出目标的匹配做裁判。这融合了基准设计与因果诊断的思想。
八、论文中可以提取的通用性灵感
灵感 1:模态信息流是智能体环境的第一性瓶颈。 核心思想:智能体能力上限不由模型或工具集决定,而由环境的状态序列化协议决定——任何无法进入持久状态的证据,等于不存在。 论文证据:固定 30B 模型与全部工具接口,仅移除图像回灌即从 55.97 掉到 46.89(-9.08);反之不训练仅换 harness,Qwen3-VL 提升 17.62 分。 推广场景:语音智能体保留音频原始证据供跨轮重听;GUI 智能体保留历史截图而非只留文字摘要;数据分析智能体保留中间数据文件供回溯重算;机器人智能体保留触觉/深度流的持久引用。
灵感 2:把『可恢复性』与『优化资格』解耦,是处理训练噪声的通用范式。 核心思想:异常样本不应二选一地『全保留』或『全丢弃』——先按确定规则修复可修复的,再把不可修复的从统计量中干净剔除。 论文证据:FA-GSPO 使 56.7%-60.3% 的局部异常轨迹得以保留进训练,同时把上下文/时钟超限的轨迹整条排除,净效果是平均分 51.10 → 55.97。 推广场景:推荐系统训练中先修复爬虫截断的日志再过滤机器人流量;代码大模型训练中先修复可自动纠错的语法错误样本再丢弃编译都过不了的;自动驾驶仿真中先恢复可重置的传感器故障帧再剔除物理不可行轨迹。
灵感 3:用『条件分级指标』分离流水线式能力,比单一准确率诊断力强得多。 核心思想:当能力由多级流水线串联(找到证据 → 用对证据),应设计条件概率指标定位失败发生在哪一级。 论文证据:VisTarget-Bench 的 Cite/Match/Match+Acc 四级指标揭示:RL 后 Target Match 达 87.10% 但 Match+Acc 仅 77.78%——瓶颈已从检索转向感知解读。 推广场景:RAG 系统分离『检索命中』与『生成忠实』;代码智能体分离『定位到相关文件』与『写出正确补丁』;医疗诊断 AI 分离『影像获取质量』与『判读准确』;客服智能体分离『理解意图』与『给出可行方案』。
灵感 4:环境同源的数据自带杠杆率。 核心思想:在目标环境(而非通用语料)中采集的少量示范数据,其单位样本价值可以远超大规模异源数据——关键变量是分布一致性而非数量。 论文证据:56.2K 开源轨迹归一化后从 44.07 升至 48.06,而追加仅 3.3K 自建同契约轨迹即升至 51.04,VisTarget-Bench 上每条自建轨迹的边际贡献约为开源轨迹的数十倍。 推广场景:机器人操作用目标硬件平台上遥操作的少量数据叠加大规模仿真数据;垂直领域微调用真实业务闭环中采集的小批日志叠加通用指令数据;数据库 NL2SQL 用目标 schema 上执行的轨迹叠加通用 SQL 语料。
灵感 5:评测与训练用同一生成流水线,但种子严格留出。 核心思想:让基准与训练集共享构造流程(保证分布 representative)同时在种子层面隔离(保证无泄漏)——比『另起炉灶造基准』或『随机切分』都更可信。 论文证据:VisTarget-Bench 从 SFT/RL 划分之前留出的种子构造,覆盖 8 个领域、150 道人审任务,无工具直答准确率接近 0(Qwen3-VL 0.00%),证明参数记忆不可达。 推广场景:代码生成基准从真实仓库 issue 流水线留出;搜索智能体基准从事件种子库留出;对话系统基准从真实用户会话种子留出——核心都是『同流水线、早留出』。
灵感 6:确定性规则优先于模型推断,做环境修复要克制。 核心思想:环境侧的自动修复只应处理无歧义的错误(别名、标量转列表),意图不明的错误必须返回结构化观测交给策略自纠——过度修复会让模型学不到纠错行为。 论文证据:harness 的参数修复明确『从不推断缺失信息』,配合结构化错误观测与循环防护,使非法调用轨迹的 60.3% 通过策略自纠保留进训练。 推广场景:编译器只做语法级自动修复、语义错误交给开发者;API 网关只重试幂等请求;自动驾驶只修正标定漂移、不替驾驶员做决策;数据库只自动重连、不自动改写可疑查询。
附录:一个标志性案例
论文附录 E 的案例 1 完整展示了系统的推理链路:输入一张运动员庆祝照片,问『同项目中东道主表现最好的运动员冲线照片里赛服的两大主色』。系统先用反搜识别出运动员是 Max Langenhan(德国雪橇金牌得主),推知项目为 2026 米兰-科尔蒂纳冬奥会男子单人雪橇、东道主为意大利;再检索确认意大利最佳选手是铜牌得主 Dominik Fischnaller;然后图搜其冲线庆祝照片,肉眼判断蓝紫配色后还调用代码工具加载两张候选图并排确认;最终答出『蓝与紫』并内嵌引用两张 Getty/Alamy 原图。九轮交互中图像被反复回访与交叉验证——这条轨迹本身就是『持久视觉状态』价值的最好注脚。