SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 精读
语音 Agent 必须完全通过语音完成工具调用与多轮对话,主流范式却在文本中训练。SpeechGym 在未修改的 τ²-bench 之上构建首个音频原生、多轮工具调用、可端到端 RL 训练的语音 Agent 环境:两个 Qwen3-Omni-30B 全模态模型以原生语音直接对话,工具接口保持文本以分离感知与行为错误。诊断发现文本到语音的落差主要源于感知缺陷——槽值误听率 32%,为文本通道的 16 倍;per-turn 过程奖励把携带梯度的组比例从 16% 提至 99.6%,破解 outcome-only GRPO 的梯度饥饿。训练后零调参迁移到独立实现的 τ-Voice 基准,pass@1 从 24% 升至 53%,开源 30B 模型升至排行榜第二、超过 GPT-Realtime-2,且轮数与 token 同步下降。