PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation 精读

为什么最强的编码 Agent 一进专业仓库就失灵?北京大学团队把根因锁定在「隐性知识」——那些只存在于开发者脑中、从不写进文档的业务规则、接口契约与操作约定。它们潜伏在开发实践之下、沿代码依赖图分散传播、且 Agent 根本不知道自己缺什么,三重性质让一切检索式方案天然失效。PRAXIS 给出四阶段闭环:让 Agent 在目标仓库里真实写代码暴露行为差异、蒸馏为带触发条件的结构化四元组、锚定到依赖图上双向传播与去重仲裁、并在任务初始化与工具交互时主动注入,支持在线演化。KoCo-Bench 四域平均 Pass@1 达 32.06%,较次优基线相对提升 16.7%,且随实践积累持续上涨。

August 24, 2026 · 5 min

Q-Learning with World Models 精读

斯坦福与北大合作的 QWM 提出了一条与世界模型协作的新路线:世界模型完全不参与策略与价值函数的训练,只在测试时(在线采样与评估执行)通过树搜索帮助挑选动作。策略提议 N=8 个候选动作,世界模型为每个动作想象 K=8 个未来状态,递归展开至深度 4,节点值由 Q 函数估计器与奖励加未来值估计器等权聚合。由于训练只发生在真实转移上,模型偏差不会复合进策略;在 Robomimic 与 LIBERO 机器人操作基准上,QWM 在样本效率与最终性能上均显著超越强基线,而传统 model-based 方法几乎无法在同等预算内学出非零成功率。

August 24, 2026 · 3 min

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance 精读

深度精读 HKUST、HKBU 与 NTU 合作的 arXiv 2026 论文 ReguSim。论文构建可执行金融合规交易环境与 ReguBench 监控基准,将陈述推理、尝试动作、执行强制与监控证据四类工件分离审计,发现规则全文可见时 DeepSeek V4 Pro 仍有 24.2% 订单被拒,简单结构化基线反超最强 LLM 监控器,交易者自辩还会把独立监控者的误接受率从 25.0% 推高到 46.9%。

August 24, 2026 · 5 min

Repo0: Design-Driven Zero-to-All Code Generation 精读

上海交通大学(7 人主导)联合重庆大学的论文 Repo0 聚焦『从零到整仓』代码生成:仅凭自然语言需求从零构建整个软件仓库,必须同时推断功能与架构。核心创新是把一次性静态图规划改造成连续结构演化——维护『需求级 DAG+组件级 DAG+多对多对齐』的 Dual-DAG 架构状态,用内聚度低于 2/3 触发拆分、耦合度(Jaccard)高于 0.7 触发合并、图割提供拆分证据,迭代至结构收敛后再进入 TDD 代码生成。在 RepoCraft 六仓库、GPT-5 mini 与 DeepSeek V3.2 双骨干的全部设置下均取得最高功能覆盖率与通过率,requests 覆盖率达 100%,较最强基线 RPG 覆盖率最高提升 20.08 个百分点、通过率最高提升 29.74 个百分点;消融证明结构演化、双图分离与依赖序生成缺一不可。

August 24, 2026 · 4 min

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning 精读

深度精读厦门大学与南洋理工大学 2026 年 8 月论文 SAPO:面向多轮 Agent 的强化学习后训练,让策略、状态价值与动作价值共享同一个自回归主干,在动作前后的两个因果边界分别读出 V 与 Q,以两个保留词元的 logit 差经裁剪映射为有界标量并从动作分布中剔除;配合单次 rollout 的轨迹级 GAE 与批归一化轮级优势,一次反向传播统一更新。在 ALFWorld 与 WebShop 上以 Qwen2.5-1.5B/7B 训练,平均超越 PPO 与 GRPO 15.1 与 12.1 个百分点,单轮迭代运行时缩短 33.2%,并彻底消除独立 critic 的显存开销。

August 24, 2026 · 5 min

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC、KUKA、上海交大与浙大合作的SemaPLC提出验证门控的agent harness:生成逻辑必须嵌入既有工业PLC项目、通过编译,并在真实运行时与金轨迹比对正确才算完成。凭借仅日志确认的检查可判定完成、编辑使旧判定失效、每检查限两次重试三条完成纪律,它在117任务功能轨上七模型全部夺魁(均值72.6%),在65任务项目轨上动态行为分达52.2,远超基线的22.4~31.4。层消融揭示:静态分相近的方法在运行时剧烈分层——执行才是检验控制逻辑的忠实标尺。

August 24, 2026 · 3 min

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学联合小红书提出 SkillGate,解决长程 Agent 在 episode 中途该读哪个技能文件的训练难题。论文先诊断出 outcome-only RL 失效的结构性根源——selector credit starvation:技能命名 token 仅占轨迹损失的中位 0.14%,随轨迹变长稀释约 7 倍,且近五分之二的正确选择因后续执行失败收到错误负号的信用,而该决策本身价值 +11.2 个百分点。SkillGate 将同一 GRPO 更新的 token 支持划分为构造上不相交的双 credit 通道:任务通道只把组归一结果优势广播到执行 token,整段 read call 从损失掩码删除;选择通道把单次读取且为 oracle 才计 1 的 action-local 效用做组中心化后仅落在身份 token,等权归一使选择权重与轨迹长度无关。5 个基准 385-trial 协议下,9B 模型从 SFT 的 40.8% 升至 53.2%,超同预算 outcome-only RL 6.2 个百分点,oracle 读取率 54.3% 升至 83.9%,误导暴露降约三分之二且读得更少。

August 24, 2026 · 5 min

SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

SPADE 由九所高校联合提出,让单一 LLM 在自我对弈中同时扮演 Environment Designer 与 Reasoning Agent 两个角色:前者以 Python 代码生成带 reset/step 接口的完整可执行 MDP 训练环境与特权提示,后者解题学习。Designer 的奖励是提示前后的回报差(hint-based regret),能持续瞄准学习前沿,配合预训练语料接地与环境记忆防止坍缩。30B 模型在 8 个 held-out 基准平均 58.3(较 base +8.1),工具使用基准 ACEBench-Agent +13.9,验证了环境设计本身可学习这一迈向开放式自提升的关键一步。

August 24, 2026 · 5 min

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

SWE-bench Science 由上海创新研究院与复旦大学联合提出,是一个仓库级科学软件工程基准:119 个任务、98 个真实 GitHub 仓库、覆盖 20 个科学领域,通过证据链协议将公有测试与私有科学断言物理隔离,并把任务分为 Issue 驱动、专家探索、工程集成三种范式。八个前沿 coding agent 横评中最高 Pass@1 仅 47.90%(Claude-Opus-5),而同配置公开分高达 96.64%,暴露出「表面修复」问题。论文还人工归因出四类失败机制,并用 91 任务配对消融证明科学知识注入并非普遍有益——错位信息反而诱发锚定。

August 24, 2026 · 4 min

What Makes Software Issue Resolution Tasks Difficult for Agents? 精读

这篇 ESEM 2026 论文回答一个基准测试长期回避的问题:对编码智能体而言,一个 issue 修复任务到底难在哪里、难度可否预知?作者在 CoderForge-Preview 的 45,769 个任务、1,553 个仓库上,用补丁、仓库、提示词三组共 54 个确定性静态特征预测智能体成功率,AUC 达 0.863、可解释 41% 的通过率方差。消融发现补丁碎片化与仓库规模几乎承载全部难度信号,而提示词的语言特征只有在中等难度区间才浮现(进入 top-5 贡献者占 70.3%),呈现清晰的分层结构。本精读覆盖其动机、特征体系、实验设计、根源解释与可迁移灵感。

August 24, 2026 · 3 min