Structured Uncertainty guided Clarification for LLM Agents 精读
深度精读马里兰大学 + Adobe Research 合作论文——首次将 LLM Agent 工具调用消歧从非结构化自然语言空间搬到结构化工具参数空间。提出基于 EVPI 的结构化不确定性建模框架,SAGE-Agent 在模糊任务上覆盖率提升 7-39%、澄清问题减少 1.5-2.7 倍;不确定性引导奖励建模让 3B 模型超越 7B 标准训练。
深度精读马里兰大学 + Adobe Research 合作论文——首次将 LLM Agent 工具调用消歧从非结构化自然语言空间搬到结构化工具参数空间。提出基于 EVPI 的结构化不确定性建模框架,SAGE-Agent 在模糊任务上覆盖率提升 7-39%、澄清问题减少 1.5-2.7 倍;不确定性引导奖励建模让 3B 模型超越 7B 标准训练。
5月26日AI前沿速递:Claude Mythos以简洁证明攻克悬置78年的Erdős单位距离猜想;谷歌AlphaProof Nexus解决2道56年未解数学难题;微软Webwright仅1000行代码让GPT-5.4跑分提升81%;昆仑万维发布百万上下文Agent模型SkyClaw-v1.0;面壁智能开源MiniCPM5-1B以1B参数超越所有2B模型;蚂蚁百灵KPop技术让MoE模型SWE-bench突破76分。
深度精读北京大学 ICLR 2026 论文 GPS,提出用 DAG 显式建模文档中的条件规则结构,通过图遍历引导 LLM 在 RAG 系统中高效主动追问,成功率超最强基线 7.5%,追问效率提升 4.2%。
深度精读清华+哈工大 NLAH 论文——首个系统性探索 Agent Harness 策略能否外化为可执行自然语言对象的工作。NLAH+IHR 四层架构用不到代码 5% 的篇幅表达完整策略,三大基准成绩可比,策略层从几万行代码中提炼为几千字文档。模块消融揭示反直觉结论:收紧验收纪律比扩大搜索范围更有效。
深度精读微软 SkillOpt 论文——首个将深度学习完整优化纪律系统迁移到文本空间 Agent 技能优化的工作。从 Skill/Harness 概念补全、六项前序工作定位、问题形式化抽象、五大核心机制详解、必要知识反推到七条通用性灵感,全面拆解这项在52个评估单元上全部取得最优的开创性研究。
5月25日AI前沿速递:微软SkillOpt开创Agent技能文本空间优化新范式,GPT-5.5平均提升23.5分;xAI发布Grok Build Beta编程智能体对标Claude Code;Grok V9-Medium 1.5T模型完成训练;苹果据称采用定制1.2T参数Google模型重塑Siri;GPT-5.6曝光支持150万token上下文;面壁智能联合清华开源中国首个昇腾训练1.58-bit端侧大模型。
5月24日AI前沿速递:Google DeepMind AlphaProof Nexus自主解决9个Erdős开放问题,阿里巴巴与南京大学RTPurbo百步训练实现1M上下文9倍加速,Anthropic推出Claude Memory Files文件化记忆系统,Maestro 4B编排器超越GPT-5与Gemini-2.5-Pro,DeepSeek永久降价75%并推出本地编码代理Reasonix,TrapDoor供应链攻击利用AI助手配置文件窃取凭证。
5月23日AI前沿速递:Anthropic准备发布Claude Mythos 1模型并警告漏洞发现速度超修补能力,微软Fara1.5浏览器智能体72%任务成功率超OpenAI Operator,Qwen3.7-Max自主运行35小时优化芯片代码,DeepSeek V4 Pro永久降价输出token低于GPT-5.5至少34倍,Nemotron-Labs扩散语言模型挑战自回归范式,研究揭示AI代理性能更依赖外部控制系统而非提示词。
5月22日AI前沿速递:Qwen3.7-Max发布定位智能体基座,DeepSeek-V4-Pro永久降价75%,Gemini月活突破9亿并推出AI代理功能,Anthropic Project Glasswing首月挖出万级漏洞,NVIDIA扩散语言模型逼近光速级生成,谷歌DeepMind AlphaProof Nexus将LLM与形式化验证结合。
介绍自动化信息收集系统——一个自动搜集 AI 行业信息并智能汇总的工具,实现从信息源采集到结构化输出的全流程自动化。