DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds 精读

深度精读华为加拿大软件卓越中心与女王大学的 DCAS 论文——首个系统揭示开源 CLI Agent 存在’scaffold 锁定’现象的工作。论文发现:在 OpenHands 单一 scaffold 下微调的模型,迁移到其他 scaffold 时性能可从 52.6% 暴跌至 8.4%。通过提出 DCAS 后端替换拦截层和区分显式/隐式规划两种形式,论文给出了一条从 scaffold 制品到模型能力的可行迁移路径,仅用 576 条规划感知轨迹即可让模型在非训练 scaffold 上一致提升。

August 11, 2026 · 9 min

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution 精读

本文精读 Anton Razzhigaev、Roman Yampolskiy 等人 2026 年发表的 Ouroboros——一个能够自开发的前沿编程 Agent。它把 Agent 的工具、提示词、上下文组装乃至核心实现本身都视为可被审查、可被修改的活体代码,并通过多模型对抗式 diff 审查作为变更门控,实现经审查的核心进化(Reviewed Core Evolution)。文章在 Terminal-Bench 2.1、OSWorld-Verified、CL-Bench 等基准上刷新 SOTA,并在代号为 Hope 的 161 天活体实验中持续运行(累计 1085 次自我修改提交、94.2% 由 Agent 撰写)。本精读将从背景、定位、问题定义、方法、评估、优势根源、必要知识反推、通用性灵感八个维度系统拆解这篇论文。

August 11, 2026 · 6 min

Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines? 精读

深度精读 Hui Xue 与 Fan Yang 的《Rethinking Self-Evolving Agents》——一项直面预设流水线是否仍然必要的反思性研究。文章提出 OEO(Open-Ended Optimization,开放式优化):固定目标、交互、预算、数据边界和评估这五项不可妥协的约束,但把优化过程完全交给前沿模型自行组合。在 GPT-5.5 驱动下,OEO 在 14 次正面交锋中 12 胜 1 平 1 负,仅用 SkillOpt 配置预算中位数 34.3% 的目标交互 token。本精读按九部分结构拆解其背景、定位、问题抽象、机制、实验证据、优势根源、必要知识反推与通用性灵感,并重点解读能力依赖的脚手架这一核心洞见。

August 11, 2026 · 7 min

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 精读

深度精读 SHE 论文——复旦、阿里达摩院、莱斯大学等多校合作提出 Safety Harness Evolution,将 Agent 安全 harness 解构为 System Prompt / Rule Bank / Safety Memory / Tool Policy 四个责任显式、独立可进化的制品,并通过归因引导的进化循环把轨迹失败转化为结构化诊断、局部精化与安全-效用验证。在 Agent-SafetyBench 上攻击成功率(ASR)相比静态 SafeHarness 降低 3.1 倍,同时良性任务效用不降反升;进化后的 harness 还能零成本泛化到 held-out 的 AgentHarm 基准并跨 Agent 模型迁移。本精读按九部分结构展开:从 Agent 安全 harness 的’整体黑盒’困境,到 SHE 的’免疫系统白细胞规则集’类比,再到归因引导进化与’精准医疗 vs 全身化疗’的范式对照。

August 11, 2026 · 10 min

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring 精读

深度精读 COLM 2026 论文 SWE-Bench ProMax——字节跳动与香港科技大学合作的专家策划多语言代码重构基准。170个实例覆盖7种编程语言,平均每实例修改11.4个文件、261.6行代码。揭示近60%未解决的 SWE-bench Verified 实例存在过窄或过宽的缺陷测试,前沿模型甚至能逐字复现训练数据中的 gold patch。在两种 Agent scaffold 下,最强模型解决率仅41.2%,证明基准未饱和。多阶段专家策展流程从源头堵住测试质量和数据泄漏两大漏洞。

August 11, 2026 · 8 min

「模型能力已经够了,要卷就卷 Infra」|对话戴冠兰:从 Cloudflare 到 Runta,为十亿个 Agent 造执行底座

Runta 创始人戴冠兰(前 Cloudflare/Kong 核心)在十字路口播客中提出核心判断:模型能力爬坡已放缓,真正制约 Agent 落地的是执行层基础设施。Runta 刚完成 2000 万美元种子轮(a16z 领投,Jeff Dean、李飞飞天使),定位是为 Agent 打造确定性执行底座——在概率性大模型之上加入隔离、权限、审计和热迁移等系统能力,让企业敢于把生产权限交给智能体。文章梳理了 Token Maximizing 到 Minimizing 的反转、Agent 安全必然爆发的逻辑、以及公有云和基模厂商为何难以抢占这一赛道。

August 10, 2026 · 2 min

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories 精读

Agent 部署后会积累大量失败轨迹,但它的行为通常固定不变——模型不更新,Harness(运行时框架)也不更新。Harness-R1 首次把’编辑可执行运行时’本身变成一个可被在线 RL 训练的能力:一个 9B 的’harness 工程师’模型从失败批次中生成可执行补丁,用冻结目标 Agent 重跑的真实成功率作为奖励。结果这个 9B 工程师反超 GLM-5.2、GPT-5.5、DeepSeek-V4-Pro 等所有更大的前沿模型编辑器;即便目标 Agent 微调后,工程师仍能再 +5.0pp。本文从’把脚手架变成可学习对象’的第一性原理,解释为什么小模型+真实结果奖励能赢过大模型+教师提议。

August 5, 2026 · 2 min

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks 精读

长程任务(long-horizon)是 Agent 走向真实世界的最后一块硬骨头。LongHorizon-Harness 把’执行-状态管理-完成评估’从一个不断增长的上下文里拆开,重构为 Manage-Execute-Audit(MEA)循环:Manager 只管状态不碰环境、Executor 每轮用新鲜上下文执行、Auditor 只读独立验证。这套架构让 Qwen 3.7-Plus 在 WeaveBench 上从 51.8% 跃升到 80.7%(近乎翻倍官方 SOTA),OSWorld 2.0 上把 Claude Opus 4.7 从 20.0% 提到 34.3%。本文从’状态-执行-审计’分离的第一性原理出发,解释为什么这套架构在难任务上收益更大、在更强模型上 token 反而更省。

August 5, 2026 · 3 min

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction 精读

腾讯发布多领域编码 Agent 基准 WorkBuddy Bench,覆盖代码、前端、办公、安全四大真实工作场景。其核心贡献在于从真实 commit/CVE/业务场景逆向工程出抗污染的口语化任务,并将任务目录、环境镜像、评估框架、测试与参考方案完全开源。跨模型排行榜显示没有任何单一模型通吃,开源权重模型 GLM-5.2 在安全子集双框架登顶,为可信代码评测体系的构建提供了新的方法论范式。

August 5, 2026 · 6 min

Meta AI Proactive Memory Agent:记忆教练精读

Meta AI提出主动记忆智能体架构,用独立的’记忆教练’智能体在固定间隔审查行动智能体的近期步骤,更新结构化记忆库(私有状态/知识记忆/程序记忆),并决定是否注入定向提醒。核心创新在于’何时提醒’的策略决策——选择性干预优于全量检索。Terminal-Bench从38%提升至46%,tau2-Bench从55%提升至62%,超越Mem0生产记忆层。

August 2, 2026 · 2 min