A Programming Paradigm for Spatiotemporal Composability 精读

北大与 DeepSeek-AI 合作的 88 页长文,为「插件系统、自进化 Agent Harness」这类动态组合软件给出了第一个完整的编程范式级形式化基础:把经典效应系统提升为可逆效应、把协同效应系统提升为响应式协同效应,统一成一个递归上下文类型,再配上动态组合演算与全套元理论(保持性、恢复精确性、活性、合流性),实现为 Cordis 元框架并在 Koishi(4000+ 社区插件)上验证。本文按背景、定位、问题、解法、评估、根源解释、知识反推、通用灵感八个层面完整拆解。

August 15, 2026 · 5 min

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design 精读

把一篇20页论文变成一张合格学术海报,需要上百次工具调用、多轮排版修订与视觉验证——这是典型的长时程智能体设计任务。本文精读美团联合多家高校的 AutoDesign:它不直接训练模型,而是让一个元harness优化器引导 code agent 基于 rollout 反馈递归自改进 harness,经 7 天演化沉淀出可复用、可迁移的学习型 DesignHarness。在自建的 PosterBench 百篇论文基准上,AutoDesign 以 78.32 分超过商业系统 Claude Design 7.45 分,盲测人类偏好 BT 值 64.0% 位列第一;给 7 个模型配置挂载该 harness,平均分从 54.99 提升到 67.39。本精读重点拆解其双层优化循环、五组件 harness 结构,并用因果链解释’学习型 harness 为什么弱模型受益更大’。

August 15, 2026 · 3 min

QuoteBench: How Matched Scores Can Hide Command-Path Failures 精读

LLM 编码 agent 的 Bash 命令在到达终端前,往往要经历序列化、包装、重新解析等“生成-执行边界”。QuoteBench 用 2×2 交叉设计(生成契约 × 执行传输)加固定回复重放证明:同一个回复只是多过一层解析器,成功率就暴跌 55.4–73.2 个百分点;而一句“你的命令会被嵌套进 bash -c 双引号”的边界披露,能让 6/8 配置恢复 30.4–60.7 点。GPT-5.6-sol 表面仅 -3.6 点的匹配分差,实际是 -64.3 点传输损伤与 +60.7 点模型补偿的合力。本精读覆盖其 56 任务 14 家族的构造、四格交叉的因果解耦机制、最终状态验证器设计,以及“评测五要素报告规范”的普适启示。

August 15, 2026 · 4 min

Vero: Can AI Agents Build Formally Verified Software Repositories? 精读

AI agent 能写出“保证正确”的软件仓库吗?UC Berkeley Dawn Song 组牵头推出 Vero——首个仓库级“实现+证明”联合合成基准:43 个多模块 Lean 4 仓库、743 个 API、2705 条规格,并首创让 agent 形式化证明“基准本身有错”的审计机制。最强配置 GPT-5.5 (xhigh) + Codex 仅完全解决 27/43,仍有 10 个实例、219 条规格抵抗全部 8 个配置。本精读覆盖其基准构建、反作弊协议、审计机制与失败模式的因果分析。

August 15, 2026 · 3 min

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents 精读

ByteDance Seed 团队提出的 Harness-IF 把「编程 Agent 是否真的在遵守指令」这件事第一次变成了可量化、可归因的规则级测量问题。它构造了 642 条原子规则的库,实例化出 60 个多轮编程任务,在 5 个可配置的「指令表面」(系统提示/工具描述/技能描述/项目文件/用户指令)上分别打分;更重要的是,它用 Against-Prior Accuracy(AP-Acc)把「模型本来就是这么做」的巧合从「真正遵从指令」中剥离出来——12 个前沿模型无一例外都在反先验规则上表现更差,平均落差 5.81 分。配套的 E0 冲突实验还揭示了一个反直觉结论:表面优先级并不服从提示深度,SP/PF/UI 同居首位,而工具描述和技能描述垫底。这篇精读从背景、定位、问题、解法、证据、根源、知识反推到通用灵感,完整拆解这项与 Harness 评估方向高度相关的工作。

August 12, 2026 · 9 min

Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution 精读

LMU Munich 团队提出的 Mendel Gödel Machine (MGM),将孟德尔遗传学中「受控比较分离遗传效应」的原理引入自改进编码智能体。在 HGM 的树搜索框架之上,MGM 新增两种自我修改算子——反应规范突变(跨任务比较同一基因型)和跨谱系杂交(跨谱系比较同一任务),在不增加任何额外任务评估成本的前提下,把 Qwen3.6-35B-A3B 在 Polyglot 上的成绩从 50.8% 拉到 93.3%,以约 117× 更少参数超越闭源 GPT-5;进化的脚手架迁移到 DeepSeek-V4-Pro 后在完整 Polyglot-225 上达 96.9%。本精读覆盖其生物学启发、三种算子机制、加性适应度景观下的收敛性证明、实验证据与通用性灵感。

August 12, 2026 · 9 min

DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds 精读

深度精读华为加拿大软件卓越中心与女王大学的 DCAS 论文——首个系统揭示开源 CLI Agent 存在’scaffold 锁定’现象的工作。论文发现:在 OpenHands 单一 scaffold 下微调的模型,迁移到其他 scaffold 时性能可从 52.6% 暴跌至 8.4%。通过提出 DCAS 后端替换拦截层和区分显式/隐式规划两种形式,论文给出了一条从 scaffold 制品到模型能力的可行迁移路径,仅用 576 条规划感知轨迹即可让模型在非训练 scaffold 上一致提升。

August 11, 2026 · 9 min

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training 精读

编码智能体在 RLVR 训练中长期受困于「信用分配粒度不足」——一个动作里同时打包了对代码不同区域的多种修改,谁贡献了通过、谁制造了失败,传统方法无法区分。DiDPO 从代码 diff 的结构出发,用「可分组性分数」动态选择锚点,把完整 diff 切成可比较的子 diff 组,把 episode 级优势投影到 token 级信号。Qwen2.5-7B-Coder 上超越可比方法超 10%,并附带开源 verl-code 代码库。本精读按九部分结构拆解:从背景、定位、问题抽象、解法、实验证据到优势根源的因果链,再到必要知识反推与通用性灵感。

August 11, 2026 · 8 min

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution 精读

本文精读 Anton Razzhigaev、Roman Yampolskiy 等人 2026 年发表的 Ouroboros——一个能够自开发的前沿编程 Agent。它把 Agent 的工具、提示词、上下文组装乃至核心实现本身都视为可被审查、可被修改的活体代码,并通过多模型对抗式 diff 审查作为变更门控,实现经审查的核心进化(Reviewed Core Evolution)。文章在 Terminal-Bench 2.1、OSWorld-Verified、CL-Bench 等基准上刷新 SOTA,并在代号为 Hope 的 161 天活体实验中持续运行(累计 1085 次自我修改提交、94.2% 由 Agent 撰写)。本精读将从背景、定位、问题定义、方法、评估、优势根源、必要知识反推、通用性灵感八个维度系统拆解这篇论文。

August 11, 2026 · 6 min

P³: Joint Program-and-Proof Planning for Verified Code Generation 精读

深度精读 arXiv:2608.09277——受 Dijkstra「程序与其正确性论证应携手开发」启发,P³ 提出「先从规范导出统一的程序-证明计划,再在该计划下细化实现与证明脚手架」的 Agent 工作流,在 Verina/AlgoVeri/Lean4Commit0 三个基准的全部 12 个(基准, 模型)单元中均获最高求解率,相比更强基线绝对提升 4.6–11.2 个百分点,困难子集上每任务 API 成本最高降约 40%、墙上时间最高降约 37%。文章还提出了从 108 个真实开源仓库提炼的库级基准 Lean4Commit0(1030 个占位符,含跨 API 关系规范),填补了仓库级验证代码生成评估的空白。

August 11, 2026 · 11 min