2026-06 LLM 代码生成领域综述:357 篇全文通读

代码生成领域综述。从 B23 软件工程桶 770 篇筛出 358 篇逐篇下载全文 PDF 通读(非仅摘要),聚焦 pass@k 失效、仓库级定位与探索、代码幻觉、AI 代码的审查信任与组织影响、评测有效性、形式化验证等议题,识别出隐形彩票、验证地平线、substrate collapse 等 12 个新颖问题与研究范式转移。

July 17, 2026 · 3 min

智能体技能演化(Skill Evolution 与 Self-Evolving Agents)综述:53 篇核心论文精读

技能演化与自演化智能体综述。从 116 篇候选中筛定 53 篇 CORE 论文下载全文精读,提炼技能库选择退化、技能创建与部署脱节、自演化缺乏可靠接受准则、上下文无界膨胀等共性问题,以及 16 个范式级新转变(PACE、Bayesian-Agent、Red Queen Godel、Trellis、MMG2Skill 等 5 个已联网验证)。

July 17, 2026 · 4 min

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes 精读

大语言模型让研究构思变得容易,但有效的创意开发远不止生成候选方向。本文精读微软研究院与南洋理工合作的 ResearchStudio-Idea,一个面向研究构思’第一公里’的可复用技能套件。论文从 1,947 篇 ICLR/ICML/NeurIPS 论文中归纳出 15 个可复用的研究构思模式,将成功条件与失败模式配对成操作性卡片,并打包为端到端的 IdeaSpark 技能——在盲法自动评审中,IdeaSpark 在 88/100 个种子问题上质量排名第一,同时保持竞争性新颖性。

July 9, 2026 · 5 min

2026年 Coding 方向 Benchmark 全面调研:33个可用仓库 + 12个未来方向预测

通过40轮迭代搜索arxiv上596篇论文,逐一验证GitHub仓库可用性,最终筛选出33个有公开可用代码仓库的coding方向benchmark。覆盖仓库级SE、代码审查、形式化验证、硬件RTL、安全等12个方向,并预测代码重构(当前0个可用仓库)、安全联合评估等12个值得做的未来方向。

July 3, 2026 · 9 min

ACL 2026 主会长文研究方向调研:2222 篇论文全量分类与新增领域分析

基于 ACL Anthology 官方元数据,对 ACL 2026 主会长文 2222 篇全量分类研究方向并对比 ACL 2025(1602 篇)。核心结论:智能体(+6.8pp)与推理(+6.5pp)两大方向最快崛起,LLM 基础研究份额被稀释而非衰退;以 GRPO/RLVR 为代表的「可验证奖励强化学习训练推理模型」成为贯穿推理与智能体的新主线。

July 3, 2026 · 4 min