Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models 精读

深度精读阿里通义千问团队 Qwen-Scope 论文——首个将稀疏自编码器(SAE)从’事后分析工具’升级为’全链路开发基础设施’的开源实践。基于 Qwen3/Qwen3.5 系列 14 组 SAE 权重,覆盖推理时引导、评估去重、数据分类与合成、后训练优化四大应用方向,系统展示了可解释性如何从学术好奇走向工程工具。

May 27, 2026 · 5 min

RGAO 精读:多智能体代码生成的检索条件化拓扑选择与可证明预算守恒

深度精读 arxiv:2605.05657——提出 RGAO 架构,通过检索代码仓库提取结构复杂度向量来动态选择编排拓扑,配合预算代数系统实现静态预算守恒。误路由率从 30.1% 降至 8.2%(p<10⁻⁶),预算验证在任何 LLM 调用前完成。首次将检索条件化路由与形式化预算代数组合,产生两者单独都不具备的可证明安全性。

May 27, 2026 · 7 min

Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning 精读

深度精读 UIUC NeurIPS 2025 论文——首次将 LLM 模型路由从单轮一对一映射升级为多轮序贯决策过程。Router-R1 将路由器本身实例化为 LLM,通过强化学习训练其交替执行’思考’和’路由’动作,动态整合多个 LLM 的互补优势。在 7 个 QA 基准上平均 EM 达到 0.416,超越 RouteLLM、GraphRouter、FrugalGPT 等 14 种基线方法,同时通过成本奖励实现性能-成本 Pareto 优化。

May 27, 2026 · 4 min

Structured Uncertainty guided Clarification for LLM Agents 精读

深度精读马里兰大学 + Adobe Research 合作论文——首次将 LLM Agent 工具调用消歧从非结构化自然语言空间搬到结构化工具参数空间。提出基于 EVPI 的结构化不确定性建模框架,SAGE-Agent 在模糊任务上覆盖率提升 7-39%、澄清问题减少 1.5-2.7 倍;不确定性引导奖励建模让 3B 模型超越 7B 标准训练。

May 27, 2026 · 5 min

GPS: Graph-Guided Proactive Information Seeking in Large Language Models 精读

深度精读北京大学 ICLR 2026 论文 GPS,提出用 DAG 显式建模文档中的条件规则结构,通过图遍历引导 LLM 在 RAG 系统中高效主动追问,成功率超最强基线 7.5%,追问效率提升 4.2%。

May 26, 2026 · 4 min

Natural-Language Agent Harnesses 精读

深度精读清华+哈工大 NLAH 论文——首个系统性探索 Agent Harness 策略能否外化为可执行自然语言对象的工作。NLAH+IHR 四层架构用不到代码 5% 的篇幅表达完整策略,三大基准成绩可比,策略层从几万行代码中提炼为几千字文档。模块消融揭示反直觉结论:收紧验收纪律比扩大搜索范围更有效。

May 26, 2026 · 5 min

SkillOpt: Executive Strategy for Self-Evolving Agent Skills 精读

深度精读微软 SkillOpt 论文——首个将深度学习完整优化纪律系统迁移到文本空间 Agent 技能优化的工作。从 Skill/Harness 概念补全、六项前序工作定位、问题形式化抽象、五大核心机制详解、必要知识反推到七条通用性灵感,全面拆解这项在52个评估单元上全部取得最优的开创性研究。

May 26, 2026 · 5 min