VibeMemBench:在真实仓库任务上用可执行测试受控评测 Coding Agent 记忆系统

VibeMemBench 是首个把「真实仓库编程任务 + 可执行测试」与「持久记忆系统」接起来的受控评测基准:它不考记忆系统能否答对回忆题,而考注入的历史经验能否真正提升可执行的仓库修复结果。论文用 SIEVE 四阶段流水线(来源校验、补丁模式筛选、历史执行与经验蒸馏、验证 uplift 并冻结)从 90 个仓库筛出 111 个目标与 3634 条历史轨迹,并提出「只改记忆开关」的匹配干预协议。核心结论有反差感:冻结的、已被执行验证过有用的经验,迁移到 5 个预留 solver 时让 4 个的解决率提升 1.1~4.5 个百分点、且步数全面下降;但当 Mem0 / SimpleMem / MemoryOS / A-MEM 这四个现有记忆系统必须从同一段历史里自己写、自己检索经验时,12 组 solver×系统配对中有 11 组没能超过「不开记忆」的配对基线。失败归因显示主因不是「没检索到」(ranking miss 仅 1.3%),而是「记录形态崩坏」(form degradation 占 69.3%)——strip 消融进一步证明危害来自原始 transcript 的体积而非指令语义。本文按九部分结构拆解其背景、定位、问题定义、构建方法、评估协议、外部交叉验证、核心结果、根因分析与启示。

September 23, 2026 · 4 min

WorldCrafter:用隐式 3D 感知记忆打造可一致探索的视频世界模型 精读

深度精读腾讯 IEG ARC Lab 与北京大学联合提出的 WorldCrafter。它用一个「隐式 3D 感知记忆」模块让视频世界模型在长时间、可自由探索的交互中保持场景一致性:以 LagerNVS 初始化记忆编码器、用姿态引导读出、与视频 DiT 联合训练,配合最大覆盖历史检索与少步蒸馏,在 4 卡上达到 16fps 实时。重访一致性 LPIPS 从 Lyra 2.0 的 0.487 降到 0.255,相机控制旋转误差 13.536 为全场最低。

September 23, 2026 · 3 min

Agent 技能自进化二重奏:EVOLVE 与 GraphSkillEvo 精读

2026年9月同主题连发的两篇论文不约而同地把「Agent 技能库」当作可进化的资产:Adobe+Brown 的 EVOLVE 让冻结模型在真实用户流量中演化 SKILL.md 技能库(Widening/Deepening 两轴 + Matched Replay Gate 保守准入);港城大+NUS+南科大的 GraphSkillEvo 则把技能表示为「全局指导+有向图」,用种群进化(4算子变异/交叉)优化。本文合并精读二者,共用背景与灵感节,逐篇拆解问题定义、解法与评估,并用因果链解释优势根源(保守准入防评分漂移、图结构压缩搜索空间),交叉对照 Reflexion/ExpeL/Voyager/Safe-Policy-Improvement/GEPA 谱系。两文共同指向一条结论:把「改模型权重」换成「改模型身边的自然语言资产」,是一条更稳、更安全、可迁移的持续适应路线。

September 22, 2026 · 5 min

Agent 评测方法学三重奏:Next-Turn 指标为何失灵 精读

本文合并精读三篇同主题论文,剖析「next-turn(单轮/下一步)指标」为何无法可靠预测 Agent 的真实工作能力。A(Dialpad)用五级评测协议链证明:SFT 在金历史评测下让文本轮大幅提升,但闭环工作流成功率最高仅 10.4%、整体裁判 0/77,根源是金历史恢复了正确状态、测的是「响应预测」而非「状态构建」。B(LibreDB)用 8,199 次生产级真机运行与四类失败 taxonomy 证明:75.7% 的损失来自真正调用过工具的 run,而 5 项服务器侧(非模型侧)修复让 6/6 模型同时提升。产业基准 τ²-bench 提供「必须真实」的旁证:最强编码智能体仅过 23.9%。三篇合流结论:Agent 评测必须闭环、必须真实、必须归因到接口层。

September 22, 2026 · 6 min

AI 可信性二重奏:递归评审崩塌与模型测谎仪 精读

两篇同期 arXiv 论文从「内部表征」视角审视 AI 自我监督/递归训练的可信性。A(TrustReviewer)用受控递归实验证明:让后一代评审模型学习前一代的合成评审,会使评分分布与语义多样性单调收窄——「科学判断崩塌」;并提出「语料策展 + 配对激活引导」两阶段干预。B(PIR)把法医学的「 concealed information test(测谎)」移植到激活层,用「题内正确项与干扰项的残差流对比方向」无参考地读出模型隐藏的知识,在 sandbagging、密码锁定、电路熔断等隐瞒场景下识别率 0.70–0.93,而真正遗忘(RMU 擦除)则跌至未知基线。本文按背景、定位、问题、解法、评估、根源、知识反推、灵感八节合并解读,并附外部交叉验证表。

September 22, 2026 · 4 min

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读

CodeMidas(小米 LLM Core 联合北大、港大、人大)提出用源代码作为唯一输入,把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习(RL)环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线,CodeMidas 首次做到五项开发记录全免,覆盖 3,185 个代码库、23 种语言、15 个领域,经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5,在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升(DeepSWE +11.7pp、ProgramBench +17pp)。消融证明「质量>数量」:清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。

September 22, 2026 · 6 min

EvoOntology: A Self-Evolving Ontology Layer for Data Agents 精读

EvoOntology(中国人民大学 ruc-datalab)提出一个面向数据智能体的「自进化本体层」:把数据库的领域概念、字段映射与约束封装成可被 agent 在运行时按需查询的 MCP 服务,并用 builder agent 自动构建初版本体、用「诊断—归因—修补—门控」四步环从失败轨迹中持续进化。本文按九部分结构精读,重点拆解三层架构、四步进化环,以及为何「静态语义层全量注入反而掉分」是全篇最有证明力的实验设计,并从因果链上解释其优势根源。

September 22, 2026 · 5 min

Grounded Skill Synthesis from Code at Scale for Agentic Intelligence 精读

本文精读蚂蚁国际的 Code2Skill:一种从开源代码库大规模合成「接地(grounded)、可验证、可迁移」技能库的全自动流水线。它把 GitHub 上经过人类调试打磨的仓库代码抽象为三粒度技能卡(原子/复合/模式),并用「源码盲重建 + 源码感知裁判 + 仲裁器」的往返验证过滤不可靠记录,最终产出含 1,006,822 条记录的 CodeSkillBank。在 72 组协议匹配评测中 57 组提升、宏平均 +11.7%,并在统一接口下全面超越轨迹派技能库。文章按九部分结构,从 Skill 概念的「岗位操作手册」类比讲起,逐层拆解其问题定义、四阶段解法、实验证据、优势根源与外部交叉验证,并提炼可推广的通用性灵感。

September 22, 2026 · 4 min

RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents 精读

RecreationWorld 由阿里巴巴 Token Hub 提出,围绕「应用复刻」构建五平台可验证环境,训练并评测能融合 GUI 探索与代码实现的混合计算机使用智能体(hybrid CUA)。本文梳理其背景、与 OSWorld/WebArena 的谱系定位、任务抽象、五平台+双通道测试生成+拒绝采样训练的解法、250 任务十模型评测与 OOD 迁移,并深究「为何满分复刻仅 2.8%」及优势根源。

September 22, 2026 · 2 min

SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs? 精读

SWE-Proof 把 SWE 类基准的判定信号从「隐藏测试」升级为「机器检查的形式化证明」,提出 BENCHPROOFER 流水线(规范合成 + 环境公理化 + 13 道正确性门)与 SWE-PROOF 基准(500 例 SWE-Bench Verified 100% 过门 + 242 例 SWE-Bench Pro)。核心发现:隐藏测试只采样有限输入,会放过四分之一到一半的缺陷 patch;给定正确形式化规范可将解决率从 85.0%/81.2% 提升至 96.2%/94.4%,且对抗审计后仅损失 0.9 个百分点;但让模型自写规范对解决率零收益,瓶颈在于 faithfulness——规范只约束了部分行为面。本文按九部分结构拆解其背景、定位、问题定义、解法、评估、根源与外部交叉验证。

September 22, 2026 · 4 min