SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 精读

港科大的 SkillProx 把 LLM Agent 的「技能自进化」重新拆解为「近端梯度下降」的前向-后向两阶段:前向用闭环重执行拦截退化的诊断补丁,后向用冻结的留一效用审计配合验证门控选择性整合/降级/删除知识单元。相比最强梯度基线 SkillGrad 平均提升 3.0pp,且消融清晰地揭示了「闭环诊断 -1.5、近端收缩 -2.5」的因果分工。本精读以九部分结构,详解这套自进化框架的方法机制、实验证据、效果根源与可迁移灵感。

August 11, 2026 · 7 min

2026-06 arXiv 智能体/工具智能体领域综述:916 篇分主题精读

工具智能体领域综述。LLM_Agents 桶 1001 篇扣除记忆子领域后按 13 主题分桶精读,提炼工具量质失衡、agent RL 信用分配、长程可靠性与上下文管理、过程级评测、工具环境不可靠、多智能体幻觉优势、治理权限可审计性等 7 大共识问题,并识别 strained coherence、agentic abstention、world-model collapse 等原创问题。

July 17, 2026 · 7 min

2026-06 arXiv 智能体记忆系统(Agent Memory)领域综述:113 篇全文精读

智能体记忆子领域纵深综述。从 11930 篇 6 月 arXiv 预印本中筛定 113 篇核心集,全部下载 PDF 抽全文逐篇精读,提炼 7 大共识性问题(检索不等于使用、固化的保留与遗忘决策、上下文成本爆炸、一致性/矛盾解决、评测混淆变量、记忆即新攻击面、遗忘治理)与多项原创问题定义,关键新框架已联网交叉验证。

July 17, 2026 · 5 min

2026-06 LLM 代码生成领域综述:357 篇全文通读

代码生成领域综述。从 B23 软件工程桶 770 篇筛出 358 篇逐篇下载全文 PDF 通读(非仅摘要),聚焦 pass@k 失效、仓库级定位与探索、代码幻觉、AI 代码的审查信任与组织影响、评测有效性、形式化验证等议题,识别出隐形彩票、验证地平线、substrate collapse 等 12 个新颖问题与研究范式转移。

July 17, 2026 · 3 min

智能体技能演化(Skill Evolution 与 Self-Evolving Agents)综述:53 篇核心论文精读

技能演化与自演化智能体综述。从 116 篇候选中筛定 53 篇 CORE 论文下载全文精读,提炼技能库选择退化、技能创建与部署脱节、自演化缺乏可靠接受准则、上下文无界膨胀等共性问题,以及 16 个范式级新转变(PACE、Bayesian-Agent、Red Queen Godel、Trellis、MMG2Skill 等 5 个已联网验证)。

July 17, 2026 · 4 min