CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 精读

CalibForge 提出了一个自主终端任务合成系统,把求解器行为当作’构建时反馈’,通过多求解器校准和对比求解器校准两种对抗式策略,将候选任务反复修订到’可证明可解但又不被统一求解’的求解器相对可学习区间。基于 5,431 个校准任务蒸馏 SFT 后,Qwen3-30B-A3B 在 Terminal-Bench 2.0 从 7.87% 跃升到 32.58%,并在 SWE-bench Pro、Doc2Repo 两个分布外基准上同步取得 +27.68、+30.04 个百分点的迁移提升。本文从终端任务与可学习区间讲起,逐层拆解对抗式作者-求解器循环、轨迹反馈的三类修订模式,并从第一性原理分析’为何校准优于单求解器反馈’。

August 8, 2026 · 7 min

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction 精读

腾讯发布多领域编码 Agent 基准 WorkBuddy Bench,覆盖代码、前端、办公、安全四大真实工作场景。其核心贡献在于从真实 commit/CVE/业务场景逆向工程出抗污染的口语化任务,并将任务目录、环境镜像、评估框架、测试与参考方案完全开源。跨模型排行榜显示没有任何单一模型通吃,开源权重模型 GLM-5.2 在安全子集双框架登顶,为可信代码评测体系的构建提供了新的方法论范式。

August 5, 2026 · 6 min

MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems 精读

MANTA首次将多Agent系统的通信拓扑从’部署前固定的设计选择’重新定义为’推理时可自我演化的系统变量’。通过拓扑规划器、轨迹审计器和技能反射器三个编排组件,MANTA在任务执行期间监控协作过程并应用有界结构修复——修改角色、通信链路、执行顺序和信息可见性。在五个基准上平均74.0分,超越最强baseline 5.8分,且总token消耗最低。论文揭示了’拓扑是自我改进的独立层次’这一新范式。

August 2, 2026 · 3 min

Perception-Correction Distillation:多模态推理器感知蒸馏信用分配精读

中科院自动化所Hongyu Lin团队提出PCD(Perception-Correction Distillation),用下游失败和师生分歧作为互补见证的贝叶斯证据组合,形成软AND门精准识别’可纠正的感知失败’。乘法是唯一在任一见证缺失时归零的归一化双线性门。8B→2B从OPD的44.50提升至47.28,32B→8B从56.94提升至61.22。

August 2, 2026 · 1 min

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow 精读

ShadowDancer提出影子对(shadow pairs)和跨影子预测(cross-shadow prediction),通过构造方式解决潜在动作模型的外观-动力学耦合问题。同一动力学轨迹在不同外观下重放,预测一个影子所需的表示必然是共享动力学本身。任何演示片段成为可复用动作资产,在新环境中重放无需动作标签、运动估计器或微调,跨五族动力学平均盲测胜率86%。论文揭示了’构造性不变量提取’的全新自监督范式。

August 2, 2026 · 3 min

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 精读

SpatialCLI提出Call-Learn-Internalize三阶段框架,教VLM先用空间专家工具(定位/分割/深度/姿态)学会组合感知,再通过双视图训练将专家能力内化为无工具推理。8B模型内化后无工具达72.7%、带工具达91.3%,均超越GPT-5.6 Sol。论文揭示了’工具→RL→内化’的渐进式能力蒸馏新范式。

August 2, 2026 · 3 min

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation 精读

β-OPSD揭示在线策略自蒸馏(OPSD)是KL正则化策略优化家族中β=1的特例,将β从隐式固定值变为可控参数后,最优策略变为参考策略与特权教师之间的几何插值。通过将RL推导的闭式解转化为蒸馏目标,用廉价的蒸馏近似昂贵的策略优化。Return-to-go信用分配纠正token级更新的短视性。在Qwen3-1.7B上数学推理平均提升5.74分,持续超越vanilla OPSD、SFT和GRPO。

August 2, 2026 · 2 min

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement 精读

RSIBench-Data 是首个专门评估「LLM Agent 能否自动化数据中心化后训练研究」的受控基准。它固定训练/服务/评估基础设施,隔离 Agent 的研究决策能力。实验揭示了「发现-���靠性差距」:Agent 在 58.33% 的设置中能通过反馈迭代改进首次尝试,但在达到峰值后继续搜索时,78.26% 反而退化。强运行轨迹有四种模式:准确假设、验证信号、行为对齐数据、保留最佳检查点。

July 31, 2026 · 3 min

2026-06 arXiv 智能体/工具智能体领域综述:916 篇分主题精读

工具智能体领域综述。LLM_Agents 桶 1001 篇扣除记忆子领域后按 13 主题分桶精读,提炼工具量质失衡、agent RL 信用分配、长程可靠性与上下文管理、过程级评测、工具环境不可靠、多智能体幻觉优势、治理权限可审计性等 7 大共识问题,并识别 strained coherence、agentic abstention、world-model collapse 等原创问题。

July 17, 2026 · 7 min

2026-06 arXiv 智能体记忆系统(Agent Memory)领域综述:113 篇全文精读

智能体记忆子领域纵深综述。从 11930 篇 6 月 arXiv 预印本中筛定 113 篇核心集,全部下载 PDF 抽全文逐篇精读,提炼 7 大共识性问题(检索不等于使用、固化的保留与遗忘决策、上下文成本爆炸、一致性/矛盾解决、评测混淆变量、记忆即新攻击面、遗忘治理)与多项原创问题定义,关键新框架已联网交叉验证。

July 17, 2026 · 5 min