Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents 精读

深度精读中国科学技术大学与腾讯合著的 MMPO 论文——一种元认知记忆策略优化方法,通过引入 Belief Entropy(信念熵)作为自监督代理信号,为 LLM Agent 的记忆摘要提供密集的中间监督。在 RULER-HotpotQA 基准上,即使扩展到 175 万 token 上下文,仍能保持 97.1% 的性能。核心洞察:记忆优化的目标不应仅仅是最终任务是否成功,更应关注中间记忆是否让模型保持对任务状态的清晰认知。

June 9, 2026 · 4 min

Rethinking Continual Experience Internalization for Self-Evolving LLM Agents 精读

深度精读中国人民大学高瓴人工智能学院与美团联合发表的 Rethinking Continual Experience Internalization 论文——系统性地揭示了 LLM 智能体在多轮经验内化中出现的’能力崩塌’现象,从经验粒度、注入模式和内化机制三个维度诊断根因,提出’原则级经验 + 逐步注入 + Off-policy 蒸馏’的稳定自进化配方,使模型在连续迭代中实现可持续的性能提升而非渐进退化。

June 9, 2026 · 4 min

From Context to Skills: Can Language Models Learn from Context Skillfully? 精读

深度精读清华大学、DeepLang AI、UIUC 等机构联合发表的 Ctx2Skill 论文——一个无需人工标注和外部反馈的自进化技能发现框架。通过多智能体自博弈循环让 Challenger 和 Reasoner 共同进化技能集,配合 Cross-Time Replay 机制防止对抗性坍塌,在 CL-bench 四个上下文学习任务上跨模型一致提升解决率。

June 6, 2026 · 4 min

SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories 精读

深度精读浙江大学 ZJUNLP 团队 SkillAdaptor 论文——一个免训练的步骤级技能自适应框架。从 Skill/Harness 概念补全、步骤级归因 vs 轨迹级反思的核心区别、三阶段适应流水线(归因-修改-资格验证)、必要知识反推到通用性灵感提取,全面拆解这项在 WebShop/PinchBench/Claw-Eval 三个基准上均优于基线的创新工作。

June 3, 2026 · 4 min

Yunjue Agent: 零起点原位自进化智能体系统精读

深度精读 Yunjue Agent 技术报告——首个完全可复现的零起点原位自进化 Agent 系统。从自进化 Agent 三大支柱(工具/上下文/工作流)背景补全、四类自进化方法定位、工具进化为关键路径的问题抽象、多 Agent 协作+并行批进化+进化泛化损失指标详解、必要知识反推到通用性灵感,全面拆解这项在5个基准上零起点超越专有系统的开创性工作。

June 2, 2026 · 4 min

δ-mem: Efficient Online Memory for Large Language Models 精读

深度精读南洋理工大学 DeCLaRe Lab 的 δ-mem 论文——在冻结的大语言模型上添加仅 8×8 的在线联想记忆状态矩阵,通过 delta-rule 学习实现高效动态记忆。从 LLM 记忆困境背景补全、三大记忆路线定位、核心问题抽象、四步计算流程与三种写入策略详解、必要知识反推到六条通用性灵感,全面拆解这项在 MemoryAgentBench 上取得 1.31× 提升的轻量级记忆工作。

June 2, 2026 · 3 min

Skill0.5: Joint Skill Internalization and Utilization for OOD Generalization in Agentic RL 精读

深度精读 Skill0.5 论文——华东师大 × 美团联合提出的首个区分通用技能内化与任务特定技能利用的 Agent RL 框架。从 Skill/Harness 概念补全、四代技能增强方法演进定位、双范式困境的问题抽象、难度感知路由+特权蒸馏+反捷径利用三大机制详解、必要知识反推到七条通用性灵感,全面拆解这项在 OOD 泛化上大幅超越全部基线的创新研究。

June 1, 2026 · 5 min

Never Stop Learning: Continual Learning 与 Self-Iteration 综述精读

深度精读 DeepSeek 研究员陈德里(Deli Chen)的持续学习与自我迭代综述——首个统一 LLM 持续学习与自我改进两大研究方向的全景式综述。从三轴分类法、五大方法族、收敛性定理、多模型实验验证到六大开放挑战,全面拆解这篇47页、151篇参考文献、由 Deli AutoResearch 框架协作完成的重量级研究。

May 31, 2026 · 3 min

DeGRe: Dense-supervised Generative Reranking for Recommendation 精读

深度精读 KDD 2026 论文 DeGRe——首个通过密集监督弥合离线探索与在线效率差距的生成式重排序框架。从推荐系统多阶段架构、重排序三阶段演进脉络、启发式标签偏差与信用分配两大痛点出发,详述 DeGRe 的离线-在线解耦设计、Lookahead Evaluator 累积回归、密集监督蒸馏到轻量级生成器的完整技术路线,并在淘宝闪购在线 A/B 测试中实现 GMV +3.75%。

May 28, 2026 · 2 min

An Empirical Study of Proactive Coding Assistants in Real-World Software Development 精读

深度精读 arxiv:2605.05700——首次大规模收集1246名工业开发者的真实IDE交互轨迹,揭示LLM模拟数据与真实开发行为的显著差距(Sim2Real Gap),构建首个真实场景主动式意图预测基准ProCodeBench,发现当前最强模型Pass@1仅13.57%。模拟数据不能替代真实数据,但可作为预训练补充。

May 27, 2026 · 4 min