SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring 精读

深度精读 COLM 2026 论文 SWE-Bench ProMax——字节跳动与香港科技大学合作的专家策划多语言代码重构基准。170个实例覆盖7种编程语言,平均每实例修改11.4个文件、261.6行代码。揭示近60%未解决的 SWE-bench Verified 实例存在过窄或过宽的缺陷测试,前沿模型甚至能逐字复现训练数据中的 gold patch。在两种 Agent scaffold 下,最强模型解决率仅41.2%,证明基准未饱和。多阶段专家策展流程从源头堵住测试质量和数据泄漏两大漏洞。

August 11, 2026 · 8 min

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction 精读

腾讯发布多领域编码 Agent 基准 WorkBuddy Bench,覆盖代码、前端、办公、安全四大真实工作场景。其核心贡献在于从真实 commit/CVE/业务场景逆向工程出抗污染的口语化任务,并将任务目录、环境镜像、评估框架、测试与参考方案完全开源。跨模型排行榜显示没有任何单一模型通吃,开源权重模型 GLM-5.2 在安全子集双框架登顶,为可信代码评测体系的构建提供了新的方法论范式。

August 5, 2026 · 6 min

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation 精读

VideoCoCo由港中文Pheng-Ann Heng联合中国科学技术大学等26位作者提出,用可执行的Blender程序作为视频生成的过程级链式思维:编码智能体将文本提示合成为Blender代码,仿真引擎运行产生确定性时空草稿,生成式视频引擎通过草稿条件编辑转化为逼真视频。PhyGenBench从0.475提升至0.558,VBench-2.0从52.18提升至77.88。

August 2, 2026 · 2 min

Recursive Harness Self-Improvement 精读

Sakana AI 与 UC Berkeley 提出 RHI(递归式框架自改进):把多智能体框架当作提示词级对象,仅用当前与上一版本的自我比较来迭代优化,少数几轮就能让低推理强度的 Agent 超越同族最高推理强度设置,同时把推理成本降低最高 60%。本文从 Harness 是什么、模型-框架协同进化讲起,拆解 RHI 的轨迹局部目标、算法流程、信息论隐式目标,并提炼可推广的通用性灵感。

July 23, 2026 · 6 min

2026 Q2 AI季报:RSI从科幻走向创业赛道,Coding战场大洗牌,强者愈强的未来

2026年Q2 AI季报深度解读:Anthropic与OpenAI的模型竞争进入新阶段,GPT 5.6与Claude Maestro/Phable正面交锋;RSI(递归自进化)从科幻概念变成明确的创业方向,Recursive、Miranda等公司涌现;Cursor以600亿美元天价被收购;中国开源模型"四杀"引发全球关注;Anthropic的Cloud Tag与OpenAI的Record and Replay重新定义AI交互。本文基于播客全文转写整理,涵盖竞争格局、RSI、机器人、智能扩散、交互创新和公司动态。

July 22, 2026 · 3 min

AI时代什么值得学?知识、代码都贬值了,经验和技能才是硬通货

WAIC 2026期间,科大讯飞AI大学堂发布AI热点和AI Vault两大新功能。围绕"AI时代什么值得学",极客时间业务负责人王一鹏、科大讯飞开放平台总经理李佳琪、野生AI Hacker许恒在围炉夜话中展开了深度讨论:AI的角色正从"知识百科"转向"私人教练"和"军师谋士",个人知识库被AI记忆系统取代,系统化学习回归经典课程,人才供需的gap在持续拉大——这个时代真正奖励的是热爱、执行力和深度判断力。

July 22, 2026 · 1 min

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune 精读

编码 Agent 在多轮交互中累积大量冗余工具输出,现有剪枝方法依赖外部评分模型。SWE-Pruner Pro 提出一个关键发现:Agent backbone 在读取工具输出时,其内部隐藏状态已经编码了行级重要性信号。通过一个轻量级 head 直接从 backbone 内部表示读取剪枝决策,在四个多轮基准上节省高达 39% 的 token,同时在部分基准上甚至提升了任务质量。本文精读其动机发现、方法设计、工程实现与通用性启示。

July 22, 2026 · 7 min

2026-06 LLM 代码生成领域综述:357 篇全文通读

代码生成领域综述。从 B23 软件工程桶 770 篇筛出 358 篇逐篇下载全文 PDF 通读(非仅摘要),聚焦 pass@k 失效、仓库级定位与探索、代码幻觉、AI 代码的审查信任与组织影响、评测有效性、形式化验证等议题,识别出隐形彩票、验证地平线、substrate collapse 等 12 个新颖问题与研究范式转移。

July 17, 2026 · 3 min

Harness Engineering for Self-Improvement 精读

Lilian Weng(Thinking Machines Lab 联合创始人、前 OpenAI 研究副总裁)在这篇万字综述中系统梳理了「Harness 工程」——围绕基础模型的运行时系统——作为通往递归自我改进(RSI)现实路径的核心命题。文章从 RSI 的思想起源讲起,把 Harness 定义为决定模型如何思考、规划、调用工具、管理上下文、评估结果的系统层,并梳理了三大设计模式(工作流自动化、文件系统持久记忆、子代理并行)、四大优化方向(上下文工程、工作流设计、自我改进、进化搜索)以及与模型权重的联合优化,最后坦诚列出七大瓶颈。本精读将这篇综述放在 RSI→Harness 的研究脉络中定位,提炼其方法论骨架与可迁移的普适灵感。

July 7, 2026 · 8 min

2026年 Coding 方向 Benchmark 全面调研:33个可用仓库 + 12个未来方向预测

通过40轮迭代搜索arxiv上596篇论文,逐一验证GitHub仓库可用性,最终筛选出33个有公开可用代码仓库的coding方向benchmark。覆盖仓库级SE、代码审查、形式化验证、硬件RTL、安全等12个方向,并预测代码重构(当前0个可用仓库)、安全联合评估等12个值得做的未来方向。

July 3, 2026 · 9 min