Verbalizable Representations Form a Global Workspace in Language Models 精读
Anthropic团队在Claude模型内部发现了一个类似人脑全局工作空间的特权表示子空间——J-space。它由一小撮不断演变的’未说出的词语’组成,仅占激活方差不到10%,却承担着言语报告、内部推理、灵活泛化和自我监控的核心功能。本文深度解析Jacobian Lens技术、J-space的五个功能属性、以及反事实反思训练这一全新对齐范式。
Anthropic团队在Claude模型内部发现了一个类似人脑全局工作空间的特权表示子空间——J-space。它由一小撮不断演变的’未说出的词语’组成,仅占激活方差不到10%,却承担着言语报告、内部推理、灵活泛化和自我监控的核心功能。本文深度解析Jacobian Lens技术、J-space的五个功能属性、以及反事实反思训练这一全新对齐范式。
通过40轮迭代搜索arxiv上596篇论文,逐一验证GitHub仓库可用性,最终筛选出33个有公开可用代码仓库的coding方向benchmark。覆盖仓库级SE、代码审查、形式化验证、硬件RTL、安全等12个方向,并预测代码重构(当前0个可用仓库)、安全联合评估等12个值得做的未来方向。
基于 ACL Anthology 官方元数据,对 ACL 2026 主会长文 2222 篇全量分类研究方向并对比 ACL 2025(1602 篇)。核心结论:智能体(+6.8pp)与推理(+6.5pp)两大方向最快崛起,LLM 基础研究份额被稀释而非衰退;以 GRPO/RLVR 为代表的「可验证奖励强化学习训练推理模型」成为贯穿推理与智能体的新主线。
深度精读华盛顿大学论文——首次系统研究 LLM Agent 的’弃权’问题:当任务不可行时,智能体是否知道该停下而非继续行动?在 28,000+ 任务上评估 13 个 LLM-as-Agent 系统,发现核心挑战不是’能不能弃权’而是’何时弃权’。提出的 CONVOLVE 上下文工程方法仅用 20 条轨迹就将 Llama-3.3-70B 的及时弃权率从 26.7% 提升至 57.4%,且小模型蒸馏的规则可跨模型迁移。
深度精读微软与上海交通大学合著论文 FastContext,提出将代码仓库探索从主求解代理中解耦为独立的轻量级探索子代理,通过 SFT + RL 训练 4B-30B 专门探索模型,在三大 SWE-bench 基准上将解决率提升最高 5.5%,同时减少主代理 token 消耗最高 60%。
深度精读阿里通义千问团队的 Qwen-AgentWorld——首个覆盖 7 大领域(MCP/Search/Terminal/SWE/Android/Web/OS)的统一语言世界模型。它通过’CPT注入→SFT激活→RL锐化’三阶段训练管线,以混合 rubric-and-rule 奖励驯服开放环境模拟的强化学习训练,在 AgentWorldBench 上以 58.71 分超越 GPT-5.4(58.25)。更关键的是,世界模型训练可作为智能体基础模型的有效预热——在 7 个下游基准上带来泛化增益,其中 3 个完全分布外基准平均提升 +9~11 分。
深度精读微软研究院与北京外国语大学合著的 SKILL-DISCO 论文——将 Agent 成功执行轨迹蒸馏为可重用的参数化控制流子图(PFSM),再编译为可调用、可执行、可验证的过程技能。在 ALFWorld 和 WebArena 上,仅用 5 个技能(对比 ASI 的 110 个)就将成功率推高至 99.3%,且技能可跨模型迁移——GPT-4o 归纳的技能让 Qwen3.5-9B 在 ALFWorld 上达到 98.5%。
深度精读 Williams College 的 Probe-and-Refine Tuning 论文——一种用合成 bug 修复探针迭代打磨仓库引导文件(AGENTS.md)的极简方法。无需智能体循环、无需工具调用、无需强化学习,仅靠约 22 次单轮 LLM 调用就让 SWE-bench Verified 解决率从 25.5% 提升到 33.0%。核心发现是:改进的不是补丁质量而是覆盖率,指导文件让 Agent 跑到了正确的文件。
深度精读微软 FastContext 论文——把代码仓库探索从主 Agent 中剥离、交给一个专门训练的小模型来干。用 4B-30B 的专用探索模型替代昂贵的探索过程,端到端解决率最高提升 5.5%,主模型 token 消耗最高降低 60%。从编码 Agent 瓶颈分析、模型分工解构、SFT+RL 训练配方,到必要知识反推与通用性灵感,全面拆解这项将仓库探索’模块化、可训练化’的工作。
深度精读 Google DeepMind 重磅报告《From AGI to ASI》——由 DeepMind 联合创始人 Shane Legg 领衔、AIXI 理论发明人 Marcus Hutter 等 14 位顶尖研究者合著。报告系统性地探讨了 AGI 实现之后 AI 如何继续向人工通用超级智能(ASI)演进:从 Universal AI(AIXI)的理论框架出发,定义了 AGI 和 ASI 的清晰边界,提出四条可能并行的技术路径(算力扩展、范式转变、递归自我改进、多智能体集体涌现),并诚实地分析了六大瓶颈与高度不确定性。核心洞见是:AI 进展不太可能在人类水平附近停滞,我们面对的可能是连续的变革而非单一拐点。