Recuris: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 精读

Recuris(NUS × Stanford × Oxford × Princeton)把递归自我改进从『改模型/改智能体』收缩到『只演化外置记忆控制层』:工作记忆维护经检查器验证的任务状态并按需调用技能,跨任务的固定 Meta-Agent 读结构化轨迹、把失败归因到 E/W/ρ/C 四组件之一并只修补被归因组件,经修复源任务且不回退开发集的验证门才准入。在 4 个长程基准 × 10 个模型上 35/37 完成的模型-基准对成功率提升,GPT-5.6 Sol +17.8、Claude Opus 5 +15.6、最长任务 +32.2 分,六类长程失败模式下降 20–86%;机制上证明长程失败是执行问题而非检索问题,技能价值是『调用条件性』的,结构化轨迹使故障定位从 13.0% 提升到 64.8%。

August 27, 2026 · 3 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

Naver Labs、Einsia.AI 与清华大学推出 AI4AI-Bench:冻结 10 个真实研究仓库,覆盖 SFT、agentic RL、蒸馏、奖励建模、DPO、扩散 RL、遗忘、图扩散、权重平均与剪枝十族算法,测评 agent 能否改写仓库训练算法本身。agent 在单块 B300 用 4 小时改代码;提交后源码从零训练 12 小时,由冻结评估器打分,σ 坐标统一指标(0.1 为原算法,1.0 为最优)。负结果:290 格平均 0.166,最强系统 Claude Opus 5 仅 0.250;触及学习层者平均 0.226,远高于只动运行层的 0.126。

August 24, 2026 · 4 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

深度精读 Einsia.AI 与清华大学 2026 年 8 月提出的 AI4AI-Bench:首个隔离测量 LLM Agent 训练算法设计能力的基准。10 个冻结研究仓库、单块 B300 四小时改写、十二小时从零重跑、0/0.1/1.0 三锚点统一量表,29 个配置平均仅 0.166、最佳 0.250——最强系统连’已有算法到最优’距离的五分之一都没走完;而推理预算买到的主要是’敢去改’的意愿,参与率从 8% 提升到 64%。

August 22, 2026 · 3 min

Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution 精读

LMU Munich 团队提出的 Mendel Gödel Machine (MGM),将孟德尔遗传学中「受控比较分离遗传效应」的原理引入自改进编码智能体。在 HGM 的树搜索框架之上,MGM 新增两种自我修改算子——反应规范突变(跨任务比较同一基因型)和跨谱系杂交(跨谱系比较同一任务),在不增加任何额外任务评估成本的前提下,把 Qwen3.6-35B-A3B 在 Polyglot 上的成绩从 50.8% 拉到 93.3%,以约 117× 更少参数超越闭源 GPT-5;进化的脚手架迁移到 DeepSeek-V4-Pro 后在完整 Polyglot-225 上达 96.9%。本精读覆盖其生物学启发、三种算子机制、加性适应度景观下的收敛性证明、实验证据与通用性灵感。

August 12, 2026 · 9 min

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution 精读

本文精读 Anton Razzhigaev、Roman Yampolskiy 等人 2026 年发表的 Ouroboros——一个能够自开发的前沿编程 Agent。它把 Agent 的工具、提示词、上下文组装乃至核心实现本身都视为可被审查、可被修改的活体代码,并通过多模型对抗式 diff 审查作为变更门控,实现经审查的核心进化(Reviewed Core Evolution)。文章在 Terminal-Bench 2.1、OSWorld-Verified、CL-Bench 等基准上刷新 SOTA,并在代号为 Hope 的 161 天活体实验中持续运行(累计 1085 次自我修改提交、94.2% 由 Agent 撰写)。本精读将从背景、定位、问题定义、方法、评估、优势根源、必要知识反推、通用性灵感八个维度系统拆解这篇论文。

August 11, 2026 · 6 min

RSI比Coding Agent大得多:对话田渊栋,递归自进化为什么是阶段式突破而非渐进攀升

前Meta FAIR研究员田渊栋创立Recursive Superintelligence(A轮6.5亿美元,估值46.5亿美元)后首次系统阐述RSI:它比coding agent大得多、难得多;完全自动化不会很快发生,递归会先发生;智能发展是S型曲线而非scaling law的平滑攀升,这恰恰给了初创公司窗口。他们的第一阶段成果在算子优化、NanoChat训练和NanoGPT SpeedRun三个方向取得SOTA,用一套通用系统击败了专业GPU团队。田渊栋认为AI终将从炼金术变成化学,可解释性是少数派但正确的路。

August 7, 2026 · 1 min

Recursive Harness Self-Improvement 精读

Sakana AI 与 UC Berkeley 提出 RHI(递归式框架自改进):把多智能体框架当作提示词级对象,仅用当前与上一版本的自我比较来迭代优化,少数几轮就能让低推理强度的 Agent 超越同族最高推理强度设置,同时把推理成本降低最高 60%。本文从 Harness 是什么、模型-框架协同进化讲起,拆解 RHI 的轨迹局部目标、算法流程、信息论隐式目标,并提炼可推广的通用性灵感。

July 23, 2026 · 6 min

2026 Q2 AI季报:RSI从科幻走向创业赛道,Coding战场大洗牌,强者愈强的未来

2026年Q2 AI季报深度解读:Anthropic与OpenAI的模型竞争进入新阶段,GPT 5.6与Claude Maestro/Phable正面交锋;RSI(递归自进化)从科幻概念变成明确的创业方向,Recursive、Miranda等公司涌现;Cursor以600亿美元天价被收购;中国开源模型"四杀"引发全球关注;Anthropic的Cloud Tag与OpenAI的Record and Replay重新定义AI交互。本文基于播客全文转写整理,涵盖竞争格局、RSI、机器人、智能扩散、交互创新和公司动态。

July 22, 2026 · 3 min