论文链接:Omni Interaction Agent Technical Report(Gander) 代码仓库:github.com/Omni-Interaction-Gander/Omni-Interaction-Agent(项目页:Omni-Interaction-Gander.github.io) 发表时间:2026年9月 机构:腾讯混元语音团队(Hunyuan Speech Team)+ 浙江大学 + 上海交通大学 + 香港中文大学 + 南洋理工大学 —— 典型"企业+高校"合作:腾讯提供工业级训练基建与 Hy-Realtime 部署通道,高校团队承担模型与数据方法 领域标签:eess.AS / Omni Interaction / Full-Duplex Speech / Voice Agent

一、论文背景

人与 AI 的语音交互至今仍是"对讲机模式":你说话(VAD 判断你说完了),模型想,模型答——轮流发言、一次一轮。但人类对话完全不是这样:我们同时听与说、随时被打断、会补一句"嗯"“对"的附和、在嘈杂环境里依然交流。全双工(full-duplex)就是让模型获得这种持续在场的能力。

另一边,语音助手正在变成语音 Agent:用户希望通过说话完成多步任务——“帮我改一下代码里的这个 bug”,模型要检索、改文件、跑测试。这就要求长程推理与工具执行。

难点在于:这两个能力对计算的要求是反的。实时对话要求低延迟、快响应;复杂工作流要求长程推理、迭代规划。用单个单体模型同时满足两者,会陷入"响应快但想不深、想得深但反应慢"的固有折中。此外还有个更根本的问题:交互时机(什么时候该说话、什么时候该闭嘴)到底应该是外挂模块(VAD)还是模型内生能力?外挂 VAD 只看声学信号,无法理解"用户话说一半但在等回应"这类语义场景——这就限制了交互的自然度上限。

Gander 的回答分两半:交互时机必须是模型内生的(自己学会在流中决策听/说),而深推理可以外挂(交给免训练的通用 Agent 后脑)——两者用"小脑-大脑"分工解耦。

二、论文定位和关联工作

脉络一:语音语言模型到全双工。 早期语音 LLM 靠 VAD 轮转;BayLing-Duplex 把听/说/结束做成状态 token 内生预测;Qwen-Audio-3.0-Realtime 引入流式分块;Seeduplex 攻克嘈杂环境的持续倾听。共同点:仍以音频交互为中心,环境理解靠声学。

脉络二:Omni 多模态持续交互。 Qwen Omni 统一多模态输入+流式语音生成;MiniCPM-o 4.5 的 Omni Flow 把多模态输入输出放上统一时间轴;SeedRealtime 实现原生音视频全双工。这些工作验证了"连续多模态在场”,但 Agent 执行仍是短板。

脉络三:语音 Agent。 Qwen Audio Agent 的语音 runtime 把任务委托给后端工作流;GPT-Live+Codex、Claude Voice Mode 是产品化尝试。共同缺口:交互状态与任务状态从未在同一个端到端过程里联合建模。

维度语音全双工系Omni 交互系Gander
交互时机内生(状态 token)内生内生(chunk 级控制 token)
模态音频为主音视频音视频+屏幕流
Agent 执行无/弱弱一等公民(免训练大脑+编排运行时)
延迟与深度快而浅中分工:小脑快、大脑深

定位结论:Gander 是第一个把全双工交互与 Agent 执行在统一框架内做成一等公民的开源系统,并明确给出"交互内生、推理外挂"的架构主张。

三、问题定义

具体问题:单个端到端系统如何同时提供低延迟全双工对话与长程 Agent 任务执行,且交互时机完全内生。

核心洞察(抽象):把系统拆成两个时间尺度——小脑处理毫秒-秒级的感知-决策-发声循环,大脑处理分钟-小时级的推理-执行循环。两个循环的唯一交接面是结构化工具调用(task_start/send/resolve),由确定性的编排运行时(而非另一个模型)保证状态机的正确性。小脑内部,所有模态被拍平到统一时间轴:每秒一个 chunk = 该秒的音视频 token + 一个控制 token(listen/speak/interrupt)+ N 个文本 token——“是否说话"作为独立预测先于"说什么”,解耦两个决策让全双工行为稳定。

形式化:交互序列为 chunk 流 C₁C₂…,每个 Cᵢ = (perceptᵢ, ctrlᵢ, textᵢ),ctrlᵢ ∈ {listen, speak, interrupt}。上下文用固定 128 chunk(约两分钟)滑动窗口。任务生命周期由编排运行时的五实体(Project/Task/Run/WorkerEvent/Delivery)与三操作(start/send/resolve)管理,后脑通过 context_fetch/memory_search/share 三个运行时接口与小脑交互。

精妙之处:把"何时说"从内容生成里剥离成先行预测,等于把对话中的话轮转换(turn-taking)变成一个显式的每秒分类问题——这直接指向可训练(交互数据)与可评测(交互指标)。

四、问题解法

4.1 小脑:流式 Thinker-Talker

  • 感知:视频经 SigLIP+resampler 压缩 16× 到 448×448 分辨率;音频经流式 Whisper 编码器 50 帧/秒、MLP 下采样 5× 到约 10 token/秒——两路都在固定时长窗口上增量运行,token 率被压到与骨干解码吞吐相称。
  • 统一 chunk 流:全部输入输出按秒对齐拍平进单一因果序列;每 chunk 头部预测控制 token——listen(本秒静默继续观察)/speak(生成本秒文本交给语音合成)/interrupt(切断自己正在说的话)。无需外挂 VAD:主动发言、打断、附和都是同一机制的输出。
  • 语音生成:骨干保持文本域,小自回归 speech token 解码器+流式 flow matching 波形解码器级联出声——reference 音频进 prompt 即可零样本音色控制;波形按 chunk 因果增量输出,保住实时性。

4.2 大脑:免训练的通用 Agent

后脑不训练,直接实例化为 Codex(GPT-5.6 驱动)或 Claude Code 这类通用编码 Agent,负责检索、代码、文件、文档等长程任务。它获得三个运行时接口:context_fetch(按引用/角色/事件类型/时间范围取实时任务上下文)、memory_search(跨会话持久多模态记忆检索)、share(把验证过的中间发现推回小脑向用户播报)。

4.3 编排运行时:确定性粘合层

小脑的结构化工具调用(task_start 建任务/task_send 增量交互含 fork 只读旁路/task_resolve 四种生命周期控制)由 Gateway 落地:管理任务状态机、worker 调度、工作区隔离、权限(allow_once/allow_session/deny 的确定性授权控制)、结果投递。两种控制模式:lean(直通,低延迟高确定性)与 coordinator(独立控制平面模型生成执行指令,解耦任务规划)。关键安全设计:任务指令绑定到传输层确认的用户轮,而非小脑自行生成的工具参数——防止小脑被注入后伪造任务。

4.4 数据构造

四族语料:语音交互(37%,含 InteractionSpeech 合成管线——对话内容合成+双工事件标注+时间线音频渲染)、音视频交互、Agent 交互、鲁棒性与负样本(该沉默时的沉默)。全双工行为(打断、重叠)在数据里显式合成而非从轮转语料继承。

五、评估指标与实验证据

Full-Duplex-Bench v3(100 个含工具的场景,端到端评测——音频进 Thinker、合成音频经 ASR 转录后评分):

系统ToolSelArgAccRespQualPass@1Take-turn↑Interrupt↓
GPT-Realtime0.8760.6800.7920.60096.013.5
Gemini Live 3.10.8170.5880.7180.54078.019.2
级联(Whisper→GPT-4o→TTS)0.8030.5620.6000.450100.033.0
Gander(9B)0.7590.5030.4900.400100.08.0
Gander 仅大脑(文本直连)0.9340.5900.7400.520——

读表的正确方式(论文自己强调):Take-turn 与 Interrupt 必须联读——等久一点就能少打断,级联管道 100% 话轮+33% 打断就是典型买一送一。Gander 是唯一在两个时机指标上同时最优的系统(全部 100 场景恰当时机接话+仅 8% 过早打断)。任务精度指标上 Gander 9B 落后于闭源大系统,但"仅大脑"行显示 0.934 的工具选择能力就位——瓶颈在语音链路与 9B 骨干,不在 Agent 架构;Filler 51.6% 偏高亦被论证为"任务委托期间不能冷场"的合理行为而非缺陷。

SpokenQA/VoiceBench(2052 条):Gander 9B 在全双工组两项知识子集第一(75.60/59.30,超 Audio-Interaction 8.29/4.96、超 Moshi 13+/33+),VoiceBench 两子集组内第二——全双工的交互能力没有以理解能力为代价(这是与 Moshi 时代"全双工=变笨"的直接对照)。

证明力评估:评测脚本原样运行、无 benchmark 特调(系统提示与训练逐字节一致)、跨输入条件的三条件消融(音视频/仅视频/仅音频共 13107 次推理)量化跨模态整合。局限:任务精度与闭源系统的差距如实呈现,交互行为的消融(如去掉控制 token 的变体)未报。

六、效果优势的根源解释

外挂 VAD/级联管道的根本缺陷:VAD 从声学判断"用户说完没"——它够不到语义。级联管道 33% 的打断率就是病征:外部端点器在声学静音处承诺话轮,而用户只是换气。更深一层,级联架构里"何时说"的决策与"说什么"的内容生成分属不同系统,时机决策永远缺语义上下文。

Gander 的机制改变与因果链:

  1. 控制 token 先于内容生成 → 时机决策拥有完整语义表征 → 8% 打断率的来源。“是否说话"的预测与内容生成条件于同一个不断更新的多模态表征:模型可以在用户"语义未完"时持续 listen,哪怕声学上出现停顿。这解释了 Gander 为何同时拿下 100% 恰当时机(语义到位才接话)与 8% 低打断(语义未完就闭嘴)——两个指标在级联架构里是此消彼长的权衡,在统一表征下变成同一个机制的两面。
  2. 免训练大脑 → 交互与深推理解耦 → 快而不傻。小脑专注每秒级循环,不被长程推理拖累;大脑的推理深度随底层 Agent(Codex/Claude Code)免费升级——这是"响应性-智能性"折中的架构解,9B 的小脑配 GPT-5.6 的大脑,参数效率远超单体路线。
  3. 确定性运行时 → 结构化调用保证状态正确 → 长任务可中断可改派。task_start/send/resolve 由 Gateway 而非模型落地,用户打断、改需求、授权(allow_once/deny)都有确定语义——Agent 任务的可靠性从"模型自觉"变成"运行时保证”。

反事实线索:仅大脑条件(无小脑、无音频时间线)精度最好但三个交互指标全部不可测——抽掉小脑,交互性归零,证明交互能力不在大脑里;Moshi 一系全双工模型的理解分崩(SpokenQA 62.2/26.3)则从反面证明"为全双工牺牲语义"曾是常态,Gander 的 chunk 对齐设计避免了这一代价。

七、必要知识反推

领域知识层:

  • 语音对话的时机现象学(话轮转换、打断类型、backchannel 附和、重叠语音)——数据合成管线的设计直接映射这些现象类别;
  • 流式多模态编码的 token 率经济学(每模态每秒多少 token 才不淹没骨干);
  • Agent 生命周期管理(任务/运行/事件/投递的状态机建模)。

方法论知识层:

  • Thinker-Talker 架构的语义-声学解耦原理;
  • 全双工评测的指标学(时机指标与任务指标必须联读的反直觉);
  • 合成数据的双工事件标注(在文本对话上注入打断/重叠事件再渲染音频)。

工程知识层:

  • 流式推理的调度(增量编码、前缀缓存、限流);
  • 运行时的确定性状态机与权限控制(allow_once/deny 等授权原语);
  • 免训练后脑的 worker provider 接口抽象。

知识融合的关键节点:融合发生在"对话时机现象学(何时说话是人机交互的核心难题)“与”Agent 任务生命周期管理(企业工作流工程)“之间。语音社区把时机当声学问题,工作流社区把任务编排当纯后端问题。作者看到两者的交汇点:话轮决策与任务决策共享同一个"上下文-意图-时机"结构——把任务操作建模成小脑的工具调用,任务状态就进入了小脑的语义表征,时机决策自动获得任务上下文(“任务在跑所以我该播报进度”)。中枢的 chunk 控制token 设计则来自把两个决策解耦的训练直觉。

八、论文中可以提取的通用性灵感

1. 快慢双系统用结构化接口解耦,而非单体硬扛。 核心思想:响应性与深度推理的时间尺度冲突,用"快小脑+慢大脑+确定性总线"的分工解决,大脑免训练还能随底层模型免费升级。 论文证据:9B 小脑+GPT-5.6 大脑在时机指标全场最佳的同时保住任务能力(0.934 ToolSel)。 推广场景:客服系统(一线机器人+后台专家);驾驶系统(反射层+规划层);个人工作流(即时响应+深度委托)。

2. 把"时机决策"做成独立于内容生成的先行预测。 核心思想:何时行动与如何行动解耦为两个预测,前者获得全部上下文、后者保持生成质量——多任务冲突由此消解。 论文证据:8% 打断+100% 话轮双优,级联架构做不到。 推广场景:推荐系统的"何时推荐"与"推荐什么"分离;通知系统的发送时机建模;对话机器人的插话策略。

3. 交互时机必须是内生能力,外挂启发式有天堑。 核心思想:只看表面信号的时机判断(VAD 之于声学)永远缺语义;时机应作为训练目标内生于模型。 论文证据:级联 33% 打断 vs Gander 8%。 推广场景:自动驾驶的接管时机预测;交易系统的下单时机;协作工具的"打断保护”。

4. Agent 的任务指令要绑定可信来源,不能信中间层的转述。 核心思想:编排层应把任务锚定在"传输层确认的用户输入"上,防止中间模型被注入后伪造任务。 论文证据:Gateway 将 task 操作绑定到确认的用户轮。 推广场景:多级代理的指令溯源;MCP 工具调用的权限绑定;企业自动化流水线的审计锚点。

5. 为"该沉默"显式建模负样本。 核心思想:交互系统的训练数据必须包含"正确地什么都不做",否则模型学会的是永不沉默。 论文证据:鲁棒性与负样本数据族(该沉默/抑制回应场景)。 推广场景:告警系统的降噪训练;客服机器人的克制策略;自动驾驶的"不接管也是决策"。


本文基于 arXiv:2609.08977 全文精读撰写。数据与结论均引自原文。