论文链接:Iris: Climbing to the Search Frontier 发表时间:2026年9月(arXiv:2609.04304,HF Daily Papers 当日第二,50 赞;权重与完整配方承诺开源) 机构:AllSpark Team(产业独立团队) 领域标签:cs.AI / 搜索智能体 / RLVR / 数据工程

一、论文背景

**搜索智能体(search agent)**是当下最受关注的智能体形态之一:给定一个需要外部信息的问题,模型自主调用搜索工具、阅读网页、多跳推理,最终给出答案。BrowseComp、Humanity’s Last Exam(HLE)这类基准上的表现,已经成为衡量模型"深度研究能力"的公开标尺。

这个领域有两个少被言明的顽疾:

  • 训练数据可作弊:常见做法是用现成问答对或者简单改写生成训练任务。但很多"多跳问题"其实可以从问题的表面字符串直接猜出答案(比如答案实体在问题里有独特的描述搭配)——模型学到的不是搜索能力,而是参数里记住的捷径。训练分一高,真实能力没涨。
  • SFT 与 RL 割裂:标准流程是先监督微调(SFT)注入格式与先验,再用强化学习(RL)优化。但 RL 阶段探索出的好轨迹用完就丢,SFT 阶段固化的先验也可能成为 RL 的天花板——两个阶段像两段断开的楼梯。

概念铺垫:

  • 实体图(entity graph):把语料中的实体作为节点、超链接关系作为边构成的图。
  • 多跳链(multi-hop chain):答案需要经过 A→B→C 多次"根据描述找到下一个实体"的推理链。
  • 描述性引用(descriptive reference):不直接给出实体名字,而是给出一段"它是什么"的描述,迫使模型根据语义去检索。

二、论文定位和关联工作

谱系代表思路与本论文的区别
闭源搜索智能体各家实验室的 deep research 类产品不公开配方;Iris 承诺开源权重+数据构造+训练+评估全流程
开源搜索智能体基于 Qwen/开源底座的 SFT+RL 方案多数沿用现成问答数据,存在字符串匹配捷径;Iris 用描述性改写从数据根上断绝
任务合成反向问答、检索增强数据合成Iris 的"闭卷必须失败、开卷必须成功"双重过滤器是新的质量闸门
SFT-RL 结合交替训练/蒸馏回流“把每轮 RL 最难解出与最高效轨迹回流给下一轮 SFT"的 climbing 循环是最系统的呈现

定位结论:Iris 的贡献不在单点算法,而在把"数据不可作弊性"提升为搜索智能体训练的一等设计约束,并给出该约束下的完整可复现配方。

三、问题定义

具体问题:如何训练一个不被表面捷径污染、两阶段互相增强的搜索智能体?

抽象化:任务 D 对策略 π 是"不可作弊的”,当且仅当 π 无法在不见证据的条件下(闭卷)以显著优势解决 D 中的任务,但能在证据可得时(开卷)解决。 训练目标是找到任务分布 D 与训练程序 T 的组合,使得到的策略在证据依赖推理上最大化。

形式化要点:

  • 给定:网页语料的超链接结构、一个参考模型;
  • 求:满足闭卷失败/开卷成功双重条件的问题集合 Q,以及在其上交替优化后的策略;
  • 约束:所有非答案线索必须不可字符串匹配解析。

这个抽象的精妙之处:把"数据质量"这个模糊概念转译成一个可执行的拒绝采样程序——参考模型就是作弊探测器,闭卷失败是它的报警器。

四、问题解法

4.1 反向任务构造(从超链接到不可作弊问题)

  1. 从种子页面及其出链蒸馏实体图;
  2. 在图上人工编排多跳链(作者参与逐条编排,保证链的语义合理性);
  3. 把链上所有非答案实体改写为描述性引用——这是关键一步:如果线索 A 直接写实体名,模型可能靠共现统计作弊;改写成"那家以某种工艺闻名的作坊"之后,字符串匹配彻底失效,必须真的去搜;
  4. 双重过滤:只保留参考模型闭卷答不出、提供证据后能答的问题。闭卷失败说明没有参数捷径,开卷成功说明任务可解且证据充分。

4.2 轨迹与轮次双层过滤

问题转化为搜索轨迹后:

  • 轨迹级过滤:剔除错误、退化(如无意义循环)与搜索深度异常的轨迹;
  • 轮次级过滤:用一位裁判逐轮评分,且裁判的评分标准(rubric)从数据中归纳得出而非人工书写——降低主观偏差。

4.3 对抗真实搜索的 RL 工程

  • RL 阶段的策略直接对抗真实搜索引擎(而非离线快照);
  • 奖励裁判与观测摘要器部署在训练集群内部,避免推理服务瓶颈;
  • 超长 rollout 在请求级中断、下一步从已提交前缀恢复——不浪费已完成的搜索。

4.4 SFT-RL Climbing(爬坡式交替)

每轮 RL 结束,把最难被解出的(信息量最大)与最高效的(搜索行为最经济)两类轨迹回流进下一轮 SFT。整个流程像登山:SFT 扎营(把新能力固化进先验),RL 冲顶(在先验之上探索),把冲顶经验带回营地再出发。

五、评估指标与实验证据

基准Iris-mini(35B-A3B)Iris-pro(397B-A17B)说明
BrowseComp82.288.6深度搜索主基准
BrowseComp-ZH84.885.1中文深度搜索
DeepSearchQA86.992.9多跳搜索问答
Humanity’s Last Exam52.356.4前沿知识+搜索

(均为开启推理时上下文管理的结果;单 ReAct 智能体、无子智能体、无测试时验证。)

指标如何证明论点:

  1. 四个基准覆盖英/中、知识密集/搜索密集多种形态,同参数段开源最优的一致性排除了单一基准过拟合的解释;
  2. 论文最有方法论价值的设计:每个基准都同时报告开/关上下文管理两组数字——作者发现推理时上下文管理的收益大于多数系统间报告的模型差异,不控制这个变量,模型间比较基本失真。这是对整个领域评测实践的方法论纠偏;
  3. “闭卷失败"过滤器本身就是消融:若数据可作弊,闭卷就能解的题目会被过滤器拦截,训练增益无法用捷径解释。

六、效果优势的根源解释

Baseline 为什么弱:使用可作弊数据的模型,其训练梯度大部分花在巩固参数内捷径上——表面指标涨,搜索行为(调用工具的时机、查询的构造)没有真实改进。这解释了为什么很多"高分"搜索模型在换了防作弊的评测上集体掉分。

Iris 的根本改变发生在数据分布层面:描述性改写使"不搜索就答对"的条件概率被压到参考模型水平(闭卷过滤器保证),因此训练信号只能来自"证据获取→证据利用"这条链路。梯度分配被数据分布强制重定向到真实搜索能力上。

SFT-RL climbing 的机制收益:纯 RL 的探索成果存在"窗口期”——没有固化进先验之前容易被后续更新冲掉;climbing 把每轮的硬样本与高效模式回灌 SFT,等价于把 RL 的探索资本转存为先验资产,下一轮 RL 从更高的起点出发。这是把两阶段从"流水线"改造成"循环"后的复利效应。

反事实:去掉描述性改写(保留原实体名),闭卷可解比例上升,RL 可以通过压缩搜索行为走捷径获利——增益将集中在参数记忆而非工具使用;去掉 climbing,RL 后期轨迹的探索价值流失,渐近性能受限于单一 SFT 先验的质量。

七、必要知识反推

领域知识层:

  • 搜索智能体的行为空间(查询构造、页面阅读、证据聚合)与失败模式(查得太多、查错方向、轻信单源);
  • BrowseComp/HLE 基准的构造与评分方式。

方法论知识层:

  • 数据合成中的反向构造(从结构到问题)与拒绝采样;
  • RLVR 的奖励设计与轨迹过滤;
  • 参考模型作为数据质量探测器(闭卷/开卷差分)。

工程知识层:

  • 大规模 RL 训练集群的服务布局(裁判/摘要器内置);
  • 请求级中断恢复的 rollout 管理;
  • 推理时上下文管理的工程实现及其在评测中的控制。

融合的关键节点:作者把"数据投毒式捷径"具体化为字符串可匹配性,并意识到超链接图+描述性改写可以在结构上消灭它;同时把 SFT/RL 的取舍重新定义为时间上的循环而非流程上的先后——两个洞察叠加才构成完整配方。

八、论文中可以提取的通用性灵感

  1. “参考模型闭卷必须失败"是通用防作弊过滤器

    • 核心思想:任何训练任务都应先证明强参考模型无证据时解不出——否则任务在测记忆而非能力。
    • 论文证据:闭卷失败/开卷成功双重闸门。
    • 推广场景:代码智能体训练任务合成(防止从函数名猜实现)、评测集构建、面试题库设计、Agent 技能评估。
  2. 把探索成果回流为先验

    • 核心思想:RL 探索出的高价值轨迹应及时蒸馏回 SFT 先验,两阶段循环化。
    • 论文证据:每轮回流最难+最高效轨迹的 climbing 机制。
    • 推广场景:自进化智能体系统(本文读者关注的 SkillOpt 方向)、机器人技能学习、自动化科学发现的经验管理。
  3. 评测变量控制大于模型比较本身

    • 核心思想:推理时工程(上下文管理、工具集)的收益可能大于模型间差异,论文必须报告"开/关"两组。
    • 论文证据:Iris 对所有基准双报告的设计。
    • 推广场景:所有智能体论文的评测规范、企业内部模型选型测试、Harness 设计(与本日 Multi-Harness RL 论文互为印证)。
  4. 改写线索强度 = 重定向学习信号

    • 核心思想:把任务描述中的"可直接匹配的锚点"改写为语义描述,能把训练压力从记忆系统性地转移到目标能力上。
    • 论文证据:非答案实体的描述性引用改写。
    • 推广场景:RAG 训练数据构造、对抗性评测设计、课程学习中的提示退化。