Structured Uncertainty guided Clarification for LLM Agents 精读
深度精读马里兰大学 + Adobe Research 合作论文——首次将 LLM Agent 工具调用消歧从非结构化自然语言空间搬到结构化工具参数空间。提出基于 EVPI 的结构化不确定性建模框架,SAGE-Agent 在模糊任务上覆盖率提升 7-39%、澄清问题减少 1.5-2.7 倍;不确定性引导奖励建模让 3B 模型超越 7B 标准训练。
深度精读马里兰大学 + Adobe Research 合作论文——首次将 LLM Agent 工具调用消歧从非结构化自然语言空间搬到结构化工具参数空间。提出基于 EVPI 的结构化不确定性建模框架,SAGE-Agent 在模糊任务上覆盖率提升 7-39%、澄清问题减少 1.5-2.7 倍;不确定性引导奖励建模让 3B 模型超越 7B 标准训练。
深度精读北京大学 ICLR 2026 论文 GPS,提出用 DAG 显式建模文档中的条件规则结构,通过图遍历引导 LLM 在 RAG 系统中高效主动追问,成功率超最强基线 7.5%,追问效率提升 4.2%。
深度精读清华+哈工大 NLAH 论文——首个系统性探索 Agent Harness 策略能否外化为可执行自然语言对象的工作。NLAH+IHR 四层架构用不到代码 5% 的篇幅表达完整策略,三大基准成绩可比,策略层从几万行代码中提炼为几千字文档。模块消融揭示反直觉结论:收紧验收纪律比扩大搜索范围更有效。
深度精读微软 SkillOpt 论文——首个将深度学习完整优化纪律系统迁移到文本空间 Agent 技能优化的工作。从 Skill/Harness 概念补全、六项前序工作定位、问题形式化抽象、五大核心机制详解、必要知识反推到七条通用性灵感,全面拆解这项在52个评估单元上全部取得最优的开创性研究。