Grounded Skill Synthesis from Code at Scale for Agentic Intelligence 精读

本文精读蚂蚁国际的 Code2Skill:一种从开源代码库大规模合成「接地(grounded)、可验证、可迁移」技能库的全自动流水线。它把 GitHub 上经过人类调试打磨的仓库代码抽象为三粒度技能卡(原子/复合/模式),并用「源码盲重建 + 源码感知裁判 + 仲裁器」的往返验证过滤不可靠记录,最终产出含 1,006,822 条记录的 CodeSkillBank。在 72 组协议匹配评测中 57 组提升、宏平均 +11.7%,并在统一接口下全面超越轨迹派技能库。文章按九部分结构,从 Skill 概念的「岗位操作手册」类比讲起,逐层拆解其问题定义、四阶段解法、实验证据、优势根源与外部交叉验证,并提炼可推广的通用性灵感。

September 22, 2026 · 4 min

RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents 精读

RecreationWorld 由阿里巴巴 Token Hub 提出,围绕「应用复刻」构建五平台可验证环境,训练并评测能融合 GUI 探索与代码实现的混合计算机使用智能体(hybrid CUA)。本文梳理其背景、与 OSWorld/WebArena 的谱系定位、任务抽象、五平台+双通道测试生成+拒绝采样训练的解法、250 任务十模型评测与 OOD 迁移,并深究「为何满分复刻仅 2.8%」及优势根源。

September 22, 2026 · 2 min

SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs? 精读

SWE-Proof 把 SWE 类基准的判定信号从「隐藏测试」升级为「机器检查的形式化证明」,提出 BENCHPROOFER 流水线(规范合成 + 环境公理化 + 13 道正确性门)与 SWE-PROOF 基准(500 例 SWE-Bench Verified 100% 过门 + 242 例 SWE-Bench Pro)。核心发现:隐藏测试只采样有限输入,会放过四分之一到一半的缺陷 patch;给定正确形式化规范可将解决率从 85.0%/81.2% 提升至 96.2%/94.4%,且对抗审计后仅损失 0.9 个百分点;但让模型自写规范对解决率零收益,瓶颈在于 faithfulness——规范只约束了部分行为面。本文按九部分结构拆解其背景、定位、问题定义、解法、评估、根源与外部交叉验证。

September 22, 2026 · 4 min

信号质量二重奏:CoVer 验证器协同训练与 DENSE 轨迹蒸馏 精读

本文合并精读两篇同主题论文:CoVer(UT San Antonio)与 DENSE(复旦+美团)。二者共同回答 RL 与智能体自改进中「信号从哪来、可不可信」这一核心问题。CoVer 在单策略 GRPO 内协同训练 coder 与 verifier,用协方差门控的互信息奖励挤出退化测试、用三级去重降低估计方差,把「自生成测试的信息价值」变成可证明的训练信号;DENSE 在完全结果盲视(无奖励、无验证器、无标签)下,把一条执行轨迹蒸馏成证据接地的嵌套 shortcut 树,用 REFIT 协议隔离出反馈这一唯一信息通道。文章从背景、定位、问题定义、解法、评估、根源、知识反推到通用灵感和交叉验证表,系统梳理两条「信号质量」路线如何从不同方向逼近同一结论:高质量信号胜过信号特权。

September 22, 2026 · 4 min

统一智能体双璧:MintAct 空间统一与递归语言模型推理统一 精读

本篇合并精读两篇关于「统一智能体」的论文,二者分别从空间域与推理结构两个维度回答同一个问题:能否用一个模型替代一堆专用模型而不掉点?Apple 的 MintAct 用 2B/4B/8B 单一 VLM 统一 UI grounding、移动/桌面/网页/VTU 四域导航与视觉工具调用,靠四阶段训练(高分辨单步 SFT→低分辨多步均衡 SFT→每域 RL 专家拒绝采样蒸馏→联合异步 RL)与异步四机制(配额、背压、双裁剪、截断 IS)在 OSWorld-Verified 上以 48.9 同尺寸登顶。TTIC 的《Recursive Language Models Generalize Out of Domain》则从理论(MDL)与受控实验证明:递归模型用「隔离上下文栈」让 CoT 在分布内占到的「看得全」的便宜,在分布外变成致命捷径——mod-10 长度泛化上 RM 95.7% 对 CoT 6.2%。两文共同揭示:统一的代价不在模型容量,而在如何控制「每个子任务看到什么」。

September 22, 2026 · 4 min

Self Improvement via Fast Tree-search 精读

MIT 与 Sakana AI 的 SIFT 把递归自改进(RSI)编码智能体的最大瓶颈从’生成候选’移到了’验证候选太贵’:用 pairwise LLM-as-a-judge(每次 $0.044)+ 正则化 Bradley-Terry 聚合替代 $6.0 的基准子集评估作为中间信号,在完全解耦的树搜索流水线中让扩展与评估并行。Polyglot-225 上以 DGM 约 1/10 的 CPU 小时拿到 31.1%(Qwen3-30B)/35.1%(o3-mini)全面超越 DGM/HGM/SICA,TerminalBench 2.1 从 29.2% 提到 36.7%。本精读覆盖’便宜排名+昂贵验证’分离范式的机制因果、judge 输入格式的消融证据、与 DGM 谱系的定位对比,以及’把验证成本当一等公民’的通用性灵感。

September 21, 2026 · 4 min

StudentSim: Training LLM-based Student Simulators 精读

微软研究院与 UIUC 的 StudentSim 把’AI 学生模拟器’形式化为可优化的双目标问题:行为保真度 F(复现特定学生的真实行为)与指导响应度 R(被导师教会的能力)。两阶段训练——跨学生池化预训练学共享模式 + 每生 LoRA 特化——让 Qwen3-4B 在国际象棋、二语写作、数学三个领域 F/R 双指标全面超过 prompted GPT-5.4(chess 0.51/0.91 vs 0.23/0.72),用其做奖励的导师 RL 经专家盲评三轴全胜(准确率 90.5% vs GPT-5.4 奖励的 71.6%)。本精读覆盖 F×R 分解的问题化、‘池化贡献多样性而非更新量’的消融证据、4B 特化胜过前沿 API 的机制根源,以及’模拟器即基础设施’的通用性灵感。

September 21, 2026 · 4 min

Cache-to-Cache: Direct Semantic Communication Between Large Language Models 精读

多 LLM 协作系统里模型之间只能’说话’(生成文本)——高维内部表征被压缩成一维 token 串再被对方解码,既丢语义又付逐 token 解码延迟。清华牵头、五机构合作的 C2C(ICLR 2026)给出替代范式:用小神经网络把 Sharer 模型的 KV-Cache 投影融合进 Receiver 模型,可学习门控逐层决定注入。四个基准上 C2C 比单模型平均高 6.4-14.2%,比文本协作高 3.1-5.4% 且平均 2.5 倍加速。本精读拆解其 oracle 实验→fuser 设计→消融全链路,并对照 DroidSpeak、Skeleton-of-Thought 等工作交叉验证’绕过文本’路线的边界。

September 20, 2026 · 3 min

Memory Compression for High-Fanout Agent Sandboxes (AgentZip) 精读

Agent 平台把每个动作都关进沙箱,而 RL 训练和并行推理让一个任务扇出几十个沙箱——内存(而非算力)成为并发上限。HKUST 的 AgentZip 是首个专为 Agent 沙箱设计的内存压缩系统:用模板增量、同类群字典、页内 RLE 三种编解码器榨取’近似相同’页面的冗余,用恢复期预取取代保守选页,把昂贵压缩搬进 LLM 思考的空闲窗口。实测沙箱内存最高降 8.7 倍(Linux 配置仅 2.1 倍),激进压缩的减速从 3.1 倍压到 1.40 倍。本精读逐页拆解其 How/What/When 三问重构与全部消融,并对照 DeltaBox、DroidSpeak 等同期系统工作交叉验证。

September 20, 2026 · 3 min

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression 精读

DeepSeek-V4.1-Flash 用三件武器把长上下文智能体的部署成本打下来:CED 非对称架构让 prefill 只激活 8B 参数(decode 16B),CSA2 跨层 KV 复用 + FP4 量化把全局 KV 缓存压到 890 字节/token(较 V1 降 437 倍),SWA Bounded Replay 把持久化缓存再压到 1/8。在 Codeforces 3348→3471、DeepSWE v1.1 达 74.2% 的同时,45T token 多模态预训练完全开源。本文拆解其架构因果链与’智能体负载第一性’的设计哲学。

September 19, 2026 · 3 min