2026-06 arXiv 智能体记忆系统(Agent Memory)领域综述:113 篇全文精读

智能体记忆子领域纵深综述。从 11930 篇 6 月 arXiv 预印本中筛定 113 篇核心集,全部下载 PDF 抽全文逐篇精读,提炼 7 大共识性问题(检索不等于使用、固化的保留与遗忘决策、上下文成本爆炸、一致性/矛盾解决、评测混淆变量、记忆即新攻击面、遗忘治理)与多项原创问题定义,关键新框架已联网交叉验证。

July 17, 2026 · 5 min

2026-06 LLM 代码生成领域综述:357 篇全文通读

代码生成领域综述。从 B23 软件工程桶 770 篇筛出 358 篇逐篇下载全文 PDF 通读(非仅摘要),聚焦 pass@k 失效、仓库级定位与探索、代码幻觉、AI 代码的审查信任与组织影响、评测有效性、形式化验证等议题,识别出隐形彩票、验证地平线、substrate collapse 等 12 个新颖问题与研究范式转移。

July 17, 2026 · 3 min

智能体技能演化(Skill Evolution 与 Self-Evolving Agents)综述:53 篇核心论文精读

技能演化与自演化智能体综述。从 116 篇候选中筛定 53 篇 CORE 论文下载全文精读,提炼技能库选择退化、技能创建与部署脱节、自演化缺乏可靠接受准则、上下文无界膨胀等共性问题,以及 16 个范式级新转变(PACE、Bayesian-Agent、Red Queen Godel、Trellis、MMG2Skill 等 5 个已联网验证)。

July 17, 2026 · 4 min

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes 精读

大语言模型让研究构思变得容易,但有效的创意开发远不止生成候选方向。本文精读微软研究院与南洋理工合作的 ResearchStudio-Idea,一个面向研究构思’第一公里’的可复用技能套件。论文从 1,947 篇 ICLR/ICML/NeurIPS 论文中归纳出 15 个可复用的研究构思模式,将成功条件与失败模式配对成操作性卡片,并打包为端到端的 IdeaSpark 技能——在盲法自动评审中,IdeaSpark 在 88/100 个种子问题上质量排名第一,同时保持竞争性新颖性。

July 9, 2026 · 5 min

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog 精读

微软研究院的 ResearchStudio-Reel 把论文传播的"最后一公里"——海报、演讲视频、双语博客——重构为五个可组合技能。它用一次共享提取替代三次重复读论文,用硬性渲染门控替代软性美学打分,用可编辑的 PowerPoint/Word 替代只读 PDF。在 100 篇论文基准上,它生成的海报美学评分甚至超过了作者本人手绘的海报,在 84%-93% 的论文上获胜,并且是目前唯一同时交付三种可编辑传播产物的流水线。

July 9, 2026 · 3 min

Harness Engineering for Self-Improvement 精读

Lilian Weng(Thinking Machines Lab 联合创始人、前 OpenAI 研究副总裁)在这篇万字综述中系统梳理了「Harness 工程」——围绕基础模型的运行时系统——作为通往递归自我改进(RSI)现实路径的核心命题。文章从 RSI 的思想起源讲起,把 Harness 定义为决定模型如何思考、规划、调用工具、管理上下文、评估结果的系统层,并梳理了三大设计模式(工作流自动化、文件系统持久记忆、子代理并行)、四大优化方向(上下文工程、工作流设计、自我改进、进化搜索)以及与模型权重的联合优化,最后坦诚列出七大瓶颈。本精读将这篇综述放在 RSI→Harness 的研究脉络中定位,提炼其方法论骨架与可迁移的普适灵感。

July 7, 2026 · 8 min

Token Maxing退潮,Agent开始干活——亚马逊云科技中国峰会探展复盘

2026年过半,AI产业从年初"Token Maxing"的狂热转向"Token Minimizing"的理智。本期《硅谷101》走进亚马逊云科技中国峰会,实地探访AI在短剧出海、金融量化、药物研发、游戏开发、端侧硬件与安全攻防等领域的真实落地——不再是PPT,而是已经在产生价值的业务。

July 7, 2026 · 1 min

2026年 Coding 方向 Benchmark 全面调研:33个可用仓库 + 12个未来方向预测

通过40轮迭代搜索arxiv上596篇论文,逐一验证GitHub仓库可用性,最终筛选出33个有公开可用代码仓库的coding方向benchmark。覆盖仓库级SE、代码审查、形式化验证、硬件RTL、安全等12个方向,并预测代码重构(当前0个可用仓库)、安全联合评估等12个值得做的未来方向。

July 3, 2026 · 9 min

ACL 2026 主会长文研究方向调研:2222 篇论文全量分类与新增领域分析

基于 ACL Anthology 官方元数据,对 ACL 2026 主会长文 2222 篇全量分类研究方向并对比 ACL 2025(1602 篇)。核心结论:智能体(+6.8pp)与推理(+6.5pp)两大方向最快崛起,LLM 基础研究份额被稀释而非衰退;以 GRPO/RLVR 为代表的「可验证奖励强化学习训练推理模型」成为贯穿推理与智能体的新主线。

July 3, 2026 · 4 min

Agent元年前500天:Headless软件、CLI开放与Skill经济的全面爆发

整理自「此话当真×十字路口」联合节目,真格基金投资总监天杰(Jack)与归藏(张师傅)回顾Agent元年前500天的六大关键词:Headless无头软件、CLI命令行接口、Skill技能经济、Agent Economy智能体经济、OpenClaw共识塑造、Token Grant创业赞助。两人从投资人、创作者和重度用户的三个视角,深入讨论了GUI思维软件为何不再值得投资、消费级产品为何竞相开放CLI、Skill的商业价值被严重低估,以及下一个"抖音"可能是十倍产能的抖音而非全新形态。

July 2, 2026 · 1 min