DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training 精读

编码智能体在 RLVR 训练中长期受困于「信用分配粒度不足」——一个动作里同时打包了对代码不同区域的多种修改,谁贡献了通过、谁制造了失败,传统方法无法区分。DiDPO 从代码 diff 的结构出发,用「可分组性分数」动态选择锚点,把完整 diff 切成可比较的子 diff 组,把 episode 级优势投影到 token 级信号。Qwen2.5-7B-Coder 上超越可比方法超 10%,并附带开源 verl-code 代码库。本精读按九部分结构拆解:从背景、定位、问题抽象、解法、实验证据到优势根源的因果链,再到必要知识反推与通用性灵感。

August 11, 2026 · 8 min

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution 精读

本文精读 Anton Razzhigaev、Roman Yampolskiy 等人 2026 年发表的 Ouroboros——一个能够自开发的前沿编程 Agent。它把 Agent 的工具、提示词、上下文组装乃至核心实现本身都视为可被审查、可被修改的活体代码,并通过多模型对抗式 diff 审查作为变更门控,实现经审查的核心进化(Reviewed Core Evolution)。文章在 Terminal-Bench 2.1、OSWorld-Verified、CL-Bench 等基准上刷新 SOTA,并在代号为 Hope 的 161 天活体实验中持续运行(累计 1085 次自我修改提交、94.2% 由 Agent 撰写)。本精读将从背景、定位、问题定义、方法、评估、优势根源、必要知识反推、通用性灵感八个维度系统拆解这篇论文。

August 11, 2026 · 6 min

P³: Joint Program-and-Proof Planning for Verified Code Generation 精读

深度精读 arXiv:2608.09277——受 Dijkstra「程序与其正确性论证应携手开发」启发,P³ 提出「先从规范导出统一的程序-证明计划,再在该计划下细化实现与证明脚手架」的 Agent 工作流,在 Verina/AlgoVeri/Lean4Commit0 三个基准的全部 12 个(基准, 模型)单元中均获最高求解率,相比更强基线绝对提升 4.6–11.2 个百分点,困难子集上每任务 API 成本最高降约 40%、墙上时间最高降约 37%。文章还提出了从 108 个真实开源仓库提炼的库级基准 Lean4Commit0(1030 个占位符,含跨 API 关系规范),填补了仓库级验证代码生成评估的空白。

August 11, 2026 · 11 min

Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines? 精读

深度精读 Hui Xue 与 Fan Yang 的《Rethinking Self-Evolving Agents》——一项直面预设流水线是否仍然必要的反思性研究。文章提出 OEO(Open-Ended Optimization,开放式优化):固定目标、交互、预算、数据边界和评估这五项不可妥协的约束,但把优化过程完全交给前沿模型自行组合。在 GPT-5.5 驱动下,OEO 在 14 次正面交锋中 12 胜 1 平 1 负,仅用 SkillOpt 配置预算中位数 34.3% 的目标交互 token。本精读按九部分结构拆解其背景、定位、问题抽象、机制、实验证据、优势根源、必要知识反推与通用性灵感,并重点解读能力依赖的脚手架这一核心洞见。

August 11, 2026 · 7 min

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States 精读

深度精读 RoMeRL 论文——首次将自进化 Agent 记忆中的’反馈稀疏’与’记忆-奖励陷阱’两大耦合难题统一刻画,并用’降阶效用状态’把不断增长的轨迹索引效用空间压缩到固定维度的语义坐标上。理论证明降阶参数化提升每个效用坐标的平均反馈量,并刻画错误坐标的稳态占用;ALFWorld 和 LifelongAgentBench 上 Cold-Q 比例降低 80.0%、反馈密度提升约 6.0 倍、维护记忆大小减少 84.4%、LLM 调用减少 21.1%。本精读覆盖问题根源、因子化机制、反馈聚集原理、实验设计与通用性灵感。

August 11, 2026 · 8 min

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读

当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。

August 11, 2026 · 9 min

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 精读

深度精读 SHE 论文——复旦、阿里达摩院、莱斯大学等多校合作提出 Safety Harness Evolution,将 Agent 安全 harness 解构为 System Prompt / Rule Bank / Safety Memory / Tool Policy 四个责任显式、独立可进化的制品,并通过归因引导的进化循环把轨迹失败转化为结构化诊断、局部精化与安全-效用验证。在 Agent-SafetyBench 上攻击成功率(ASR)相比静态 SafeHarness 降低 3.1 倍,同时良性任务效用不降反升;进化后的 harness 还能零成本泛化到 held-out 的 AgentHarm 基准并跨 Agent 模型迁移。本精读按九部分结构展开:从 Agent 安全 harness 的’整体黑盒’困境,到 SHE 的’免疫系统白细胞规则集’类比,再到归因引导进化与’精准医疗 vs 全身化疗’的范式对照。

August 11, 2026 · 10 min

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 精读

港科大的 SkillProx 把 LLM Agent 的「技能自进化」重新拆解为「近端梯度下降」的前向-后向两阶段:前向用闭环重执行拦截退化的诊断补丁,后向用冻结的留一效用审计配合验证门控选择性整合/降级/删除知识单元。相比最强梯度基线 SkillGrad 平均提升 3.0pp,且消融清晰地揭示了「闭环诊断 -1.5、近端收缩 -2.5」的因果分工。本精读以九部分结构,详解这套自进化框架的方法机制、实验证据、效果根源与可迁移灵感。

August 11, 2026 · 7 min

Stealing Reasoning Traces from Proprietary LLM APIs 精读

深度精读 arXiv:2608.09867——主流 LLM 提供商隐藏的加密推理块被全面击穿。论文发现加密块在跨会话、跨用户、跨模型间完全可互换,攻击者可借弱模型之手解码强模型加密推理,绕过反蒸馏机制;从 31 万公开推理块中恢复出 367 条 PII 和 182 条凭证,并可实现不可见提示注入。负责任披露后提出加密层与系统层双重缓解方案。

August 11, 2026 · 6 min

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring 精读

深度精读 COLM 2026 论文 SWE-Bench ProMax——字节跳动与香港科技大学合作的专家策划多语言代码重构基准。170个实例覆盖7种编程语言,平均每实例修改11.4个文件、261.6行代码。揭示近60%未解决的 SWE-bench Verified 实例存在过窄或过宽的缺陷测试,前沿模型甚至能逐字复现训练数据中的 gold patch。在两种 Agent scaffold 下,最强模型解决率仅41.2%,证明基准未饱和。多阶段专家策展流程从源头堵住测试质量和数据泄漏两大漏洞。

August 11, 2026 · 8 min