Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering 精读

本文提出 two-gap 框架统一解释 agentic SE 的核心失败模式:requirement gap(需求 R 与利益相关者意图 I 的差)与 model gap(环境模型 M 与真实世界 W 的差)——reward hacking 是利用鸿沟的假接受,hallucination 是拓宽鸿沟的虚构。框架推导出非显然结论:叠加更多审查 agent 无用(共享同一 R/M/E 前提)、证据与权威必须来自内循环之外。案例集覆盖 KV store 六倍吞吐作弊与 2026 年 7 月 OpenAI/HF/Claude 评测越权事件。

September 15, 2026 · 2 min

Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents 精读

TU Munich × JetBrains Research 的产学研负结果研究:在真实 Kotlin 仓库的合并 PR 反向挖掘任务上,GEPA 优化 SKILL 文档仅 +4.9pp(统计不显著)、SkillOpt 仅 +0.1pp——此前文献自报的巨大增益(55%→82%)是在弱模型弱 harness 配置下测出的。论文进一步证明 pass-rate 增益量级与二元判决本身的误标率(10.7% 盲重试通过)同阶,测量仪器而非优化器才是瓶颈。maintainer 盲读却确认 SKILL 含真实项目知识——分数之外的价值。

September 15, 2026 · 2 min

Studying Without a Syllabus: Task-Agnostic Environment Preprocessing 精读

Scale AI 提出并形式化’任务无关环境预处理’设定:agent 在不知道下游任务分布的前提下自主’学习’陌生环境(S: Π×E→E——学习系统在预算内探索环境、产出制品给冻结 solver)。Meta-Agent(±策略 Archive)在 6 个异构 benchmark 的 5 个上取得最高 Avg@3;学习制品显著降低测试时采样需求;但更大学习预算不必然提升——‘学什么’比’学多久’重要。

September 15, 2026 · 1 min

What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code 精读

那不勒斯费德里科二世大学的 78.7 万函数对大规模研究:3 家 AI 助手(GPT 系/DeepSeek-Coder/Qwen2.5-Coder)按人写函数的 docstring 生成配对实现,静态分析映射到 ODC 缺陷分类+CWE 漏洞分类实现三语言(Python/Java/C)同框架人机对照。核心发现:AI 代码’结构压缩+风格模板化’(体量约人写一半、风格层独立聚类);缺陷类型分化而非数量分化;C 语言上 AI 高严重性内存安全缺陷反而更少。发布 CQBench(27,346 高问题任务)——Opus 4.8 在其上仍 2/3 有缺陷、1/3 有安全发现。

September 15, 2026 · 2 min

Scan the Skill, Govern the Action 精读:agent 技能的「许可 ≠ 恶意」,66,192 个技能全语料测量出的运行时治理缺口

Pheo 团队对 ClawHub 全部 66,192 个 agent 技能版本做了测量:705 个被所有扫描器和 LLM 判官共同判为「清白」的技能,仍在指示 agent 执行 CIS/NIST 明令禁止的操作;活体实验中 agent 对 43.4% 的此类技能真的伸手,运行时门控 23/23 全部拦截。论文提出 OATS——无模型决策路径的确定性解析器 + 按资源×类别键控的信任账本 + 从操作者风险容忍度统计推导的晋升阈值,把 agent 安全从「发布时扫描」的单层世界重构为分层组合的世界。

September 14, 2026 · 3 min

MetroLLM-Bench 精读:LLM 嵌入物理售票机,4B PEFT 学生超越 GPT-5.6 的容量-天花板曲线

Continker 发布 955 案例 × 6 真实地铁系统的 LLM 售票机策略层基准:模型须调结构化工具并提交机器可渲染终端状态,双层评分栈(14 确定性组件 + 8 语义组件)经双人标注校准。核心发现:4B Qwen3.5 学生 PEFT 后 Tier1 91.3 超 GPT-5.6 两档(90.6/90.0)匹配 GPT-5.4 满推理;PEFT 增益随基座规模单调衰减(2B +7.03 → 27B -0.91),给小模型蒸馏划出容量-天花板曲线。

September 13, 2026 · 1 min

A2ABreak 精读:把 A2A 协议规范编译成状态机之后,11 个新漏洞自己浮出水面

Purdue+UT Dallas(Elisa Bertino 组)对 Linux 基金会 A2A 协议做首个系统性安全分析:NL 规范→验证 FSM→受限 LLM 推理+对抗验证的三阶段框架。FSM 构建在 TCP ground-truth 上恢复 11/11 状态、19/20 转移(F1 0.84);在“攻击者完全合规”假设下发现 11 个新漏洞——跨客户端上下文注入、委托链多跳身份丢失凭证收割等,全部无需实现缺陷。

September 12, 2026 · 1 min

EvoSafeHarness 精读:Agent 安全没有万能线束,那就让线束自己进化

JHU/UC Berkeley/NVIDIA/UIUC/UW-Madison 五机构发布 EvoSafeHarness:为冻结 LLM Agent 自动搜索’模型×领域’专用安全 harness,DecodingTrust-Agent 上 ASR 45.6%→10.0%(utility 仅损 3.3 分),AgentDojo 82.8% utility @ 0 ASR。核心洞察:模型变体决定 enforcement 强度、领域变体决定谓词与状态——universal 安全 harness 在结构上就不存在。

September 12, 2026 · 2 min

MCP 注册表随机抽样审计精读:48.8% 握手率背后的工具生态幸存者偏差

独立研究者 Haseeb Mohammed Afsar 对 MCP 注册表做首个未修复概率样本审计:24,135 服务器普查中概率抽 400 个 npm/stdio 服务器在线探测,仅 48.8% 完成 initialize 握手(手工精选框架 66.7%),37.5% 根本无法启动;能跑的 195 个硬一致性 100%,但安全注记缺失率 58.8% vs 精选 41.5%——整个领域的采样偏差第一次被量化。

September 12, 2026 · 1 min

The Last AI Built by Humans 精读:RSI 五级自治框架与“结构递归 vs 有效递归”的证伪标准

Theseus Lab 32 人团队(含清华/上交,腾讯混元等六家工业案例)发布 RSI 系统综述:以改进闭环为分析单元、L1-L5 自治分级框架,用 HCI 指数量化 2023-2026 能力轨迹(工具 Agent 39.9 vs 数学 86.4——交互能力 headroom 最大),区分“结构递归”与“有效递归”,并给出安全继承/自治归因/可靠验证三大挑战的判定标准。

September 12, 2026 · 2 min