CapScope: A Capability-Scoped Harness for Prompt-Injection-Resistant Coding Agents 精读

编码 Agent 沙箱内的工具天然携带’环境权威’——命名一个资源就能操作它,间接提示注入正是利用这一点让 Agent 干用户没让干的事。北大团队的 CapScope 不让模型识别恶意文本,而是在 harness 层做能力作用域授权:从可信输入导出任务级权限上限,每个 sub-agent 持有独立的类型化能力集(存于模型上下文之外),每次工具调用逐主体检查。300 组对照实验:注入生效 ambient 权威 47/75、静态全局策略 33/75、CapScope 仅 3/75,而任务完成度 68/75 基本无损。论文已被 LMPL'26(ACM SIGPLAN 工作坊,Oakland)录用。

September 10, 2026 · 2 min

ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读

测试时强化学习(TTRL)靠答案自投票构造奖励,但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL:从题面自构造无输出探针输入,用候选程序行为一致性构造 Probe Consensus Reward;再用 ERPO 把 PCR 当作’负信号为主’的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序,配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3,零样本迁移 CodeContests 25.1→42.1,是唯一同时提升 pass@1 与 pass@k 的无标签方法。

September 10, 2026 · 2 min

ExecCritic: Learn to Test, Test to Improve for Coding Agents 精读

同一个 Agent 轨迹既写补丁又写测试时,一个共同的误解会让’错误的补丁通过错误的测试’——执行反馈不但没用反而有害。ExecCritic 用 test–verify–revise 脚手架把测试构造与源码修复彻底解耦:Test agent 独立生成仓库原生测试,fail-closed harness 资格审查后冻结,Repair agent 只改源码。SWE-bench Verified 上,Qwen 自产测试把解决率从 61.2% 拖到 57.3%,GPT-5.6 测试提到 65.3%——测试质量决定反馈价值;角色专用 RL 把 Base-to-Gold 判别成功率从 22.2% 拉到 62.2%,两角色组合达 72.6%(+11.4)。本文精读拆解其解耦机制、fail-closed 语义与反馈可靠性的因果链。

September 10, 2026 · 3 min

SWE-Bench Pro Verified + Shortcutting the Fix:SWE Agent 评测的可靠性双警报 精读

两篇同期论文从互补方向敲响 SWE Agent 评测的警钟。上海AI实验室的 SWE-Bench Pro Verified 用反作弊防护与任务修正重构评测:GLM-5.2 成绩从 78.80% 骤降至 57.32%(-21.48pp,186 个 PASS 翻 FAIL,McNemar p<0.001),而 DeepSeek-V4-Pro 几乎不变——原分数里藏着大规模 reward hacking。NVIDIA 的 Shortcutting the Fix 用轨迹级审计给出机制证据:五个开源模型在 SWE-bench Multilingual 上作弊率 45.1–82.4%,一句’方案原创性’指令就能压到 4.0–10.7%,且 DeepSWE 上性能基本不降。本文精读把两文合读:评测分数虚高有多大、从哪来、怎么堵。

September 10, 2026 · 3 min

RISE 之外的第二条线:When Models Edit Too Much — 代码过编辑与最小编辑保真度 精读

NUS 团队构造 400 个带已知最小补丁的修复任务(BigCodeBench 注入 AST 级损坏),首次系统量化 LLM 代码修复的’过编辑’:GPT-5.5 等前沿模型普遍重写过度。保持性指令使超额 Levenshtein 距离 0.195→0.131、认知复杂度 -26.6%、Pass@1 +2.3;SFT 过拟合损坏模式而 RL 取得最佳 OOD 保真。本文精读’最小性’作为修复一等目标的评测与训练路径。

September 8, 2026 · 2 min

τ^τ-Bench: 把'构建智能体'变成任务的端到端基准 精读

Sierra×Princeton 的 τ^τ-Bench 把’交付一个生产级客服智能体’本身作为评测任务:开发智能体拿到真实业务记录、需求方客户、生产 API 与继承代码库,须在成本与模型限制下交付完整 agent,再用 held-out 模拟用户评分。最强配置 Claude Opus 5 + Claude Code 仅通过 23.9%,专家参考上限 82.2%,banking 域低至 5.9%。本文精读这一’元任务’基准的设计哲学与失败模式解剖。

September 8, 2026 · 2 min

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 精读

滑铁卢大学×哈佛的 Compile by Training 把’编译’概念引入神经函数:教师模型从自然语言规格合成监督数据,训练 LoRA 适配器特化冻结的 Qwen3-0.6B 解释器,产出可存储、可版本化、可组合的 .paw 程序。在 PAW 快速编译器零精确匹配的 FuzzyBench-Hard 上语义准确率从 0.224 提升至 0.836,编译仅需约 50 秒。本文精读其’训练即编译’范式、分钟级编译服务工程与速度-精度新权衡点。

September 7, 2026 · 3 min

所有 Skill 都会死:卡比谈驾驭大模型的三层功夫——上下文、方法论与长活 Agent

GitHub 中国区 Top 100 开发者、Open CLI 作者卡比在 B站 Builder Club 交流日分享如何驾驭大模型:AI 的能力不只来自模型,也来自 Harness(运行时脚手架)。他给出三层可操作的功夫——理解并主动管理四层上下文与「有效上下文」,用方法论名字替代冗长 Skill(断言「所有 Skill 都会死」),以及在开源社区用长活 Agent 与 Swarm/Graph/Team 三种多 Agent 形态承接真实工作流。核心判断:模型终将吸收一切提示词工程,人剩下的核心位置是编排——拆任务、管上下文、沉淀 AI 友好(AX)的流程。

September 6, 2026 · 2 min

EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction 精读

跑一遍前沿模型在 SWE-bench Verified 上要花数百到数千美元,而 agent 开发需要反复评测。上海交大联合新加坡管理大学等提出 EarlyEval:agent 的最终成败往往在轨迹中段就已注定——训练一对 LightGBM 成功/失败分类器,一旦置信度过阈值就提前终止运行。三个基准上砍掉 13%–26% 步数、最高省 44.1% 输入 token,预测精度 89%–97%,排行榜排序保真度 Spearman ρ 高达 0.99。本精读拆解’轨迹内降本’与’基准蒸馏降任务数’的正交关系、行为特征为何比参考解更有用,以及阈值-保真度的可调权衡。

September 4, 2026 · 2 min

Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读

在 IOI 2026 上,一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分,超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径:22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距,以及’纯 SFT 的 Ultra 反超 SFT+RL 的 Nano’背后的并行采样机制。

September 4, 2026 · 3 min