SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC、KUKA、上海交大与浙大合作的SemaPLC提出验证门控的agent harness:生成逻辑必须嵌入既有工业PLC项目、通过编译,并在真实运行时与金轨迹比对正确才算完成。凭借仅日志确认的检查可判定完成、编辑使旧判定失效、每检查限两次重试三条完成纪律,它在117任务功能轨上七模型全部夺魁(均值72.6%),在65任务项目轨上动态行为分达52.2,远超基线的22.4~31.4。层消融揭示:静态分相近的方法在运行时剧烈分层——执行才是检验控制逻辑的忠实标尺。

August 24, 2026 · 3 min

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

SWE-bench Science 由上海创新研究院与复旦大学联合提出,是一个仓库级科学软件工程基准:119 个任务、98 个真实 GitHub 仓库、覆盖 20 个科学领域,通过证据链协议将公有测试与私有科学断言物理隔离,并把任务分为 Issue 驱动、专家探索、工程集成三种范式。八个前沿 coding agent 横评中最高 Pass@1 仅 47.90%(Claude-Opus-5),而同配置公开分高达 96.64%,暴露出「表面修复」问题。论文还人工归因出四类失败机制,并用 91 任务配对消融证明科学知识注入并非普遍有益——错位信息反而诱发锚定。

August 24, 2026 · 4 min

What Makes Software Issue Resolution Tasks Difficult for Agents? 精读

这篇 ESEM 2026 论文回答一个基准测试长期回避的问题:对编码智能体而言,一个 issue 修复任务到底难在哪里、难度可否预知?作者在 CoderForge-Preview 的 45,769 个任务、1,553 个仓库上,用补丁、仓库、提示词三组共 54 个确定性静态特征预测智能体成功率,AUC 达 0.863、可解释 41% 的通过率方差。消融发现补丁碎片化与仓库规模几乎承载全部难度信号,而提示词的语言特征只有在中等难度区间才浮现(进入 top-5 贡献者占 70.3%),呈现清晰的分层结构。本精读覆盖其动机、特征体系、实验设计、根源解释与可迁移灵感。

August 24, 2026 · 3 min

两天十万Star:DeepSeek Harness 的开放逻辑,与它想要驯服的模型-脚手架-算力飞轮

围绕 DeepSeek Harness 发布后两天破十万 Star 的现象,三位从业者从「一切皆插件」的架构设计、模型与 Harness 的深度协同、极简模式与缓存命中率的技术原理,聊到程序员岗位转型、开源生态与国产算力差距。核心判断:Harness 是 AI 时代的脚手架,插件化+开源让社区共建成本降到极低,模型与脚手架会互相塑造,而程序员的护城河正从写代码转向定义需求与验收结果。

August 24, 2026 · 2 min

A Jagged Frontier: 代码Agent对语义保持变换的锯齿鲁棒性 精读

当代码库被改写成语义等价的形式——控制流重写、死代码注入、标识符重命名——修 bug 的代码 Agent 还靠得住吗?Colorado State、Microsoft、UIUC 与 CMU 四方合作,用一套随机变体采样器对 2 个 Agent 框架 × 4 个前沿模型 × 54 个 SWE-bench 实例做了首个仓库级 Agent 鲁棒性系统评估:多数配置出现小幅退化(最大平均 6.7 个百分点,16 个配置中 6 个统计显著),但更扎心的发现是「锯齿前沿」——没有任何模型鲁棒性排名能跨框架、跨基准保持稳定,Qwen 在一个框架下最鲁棒、换一个框架反而最脆弱;更简单的框架反而更皮实;即使 solve 率不掉,token 成本最多也要多花 22.9%。本精读覆盖其 14 种语义保持变换的设计、非反馈采样的下界逻辑、配对实验统计方法,以及锯齿现象背后的机制因果链。

August 23, 2026 · 9 min

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review 精读

康奈尔与斯坦福的两位研究者提出 Adversarial Review(AR):主编码 Agent 冻结工件后,reviewer 评审、critic 以结构化分歧审计这份评审,收敛后才允许修改代码。AR 在 LiveCodeBench 上以三个 Agent 取得 87% 最高通过率,胜过五 Agent 的 MARS;在 SWE-PRBench 上先暴露「伪共识」失败模式——Agent 为一致而一致,再用一次 prompt 迭代把分歧显式化即取得最高 F1 0.533;在 SWE-bench Verified 上以纯文本 SKILL.md 协议达到 75.2%。本精读拆解其构造式方法、三基准证据链,以及「分歧必须最小、结构化、有证据」的设计哲学。

August 23, 2026 · 7 min

Agent如何发现、阅读与书写技术文档:行为实证研究 精读

北大团队用557个真实Agent编码会话的94,813个事件与33,097个Agent PR的69万条文件变更,首次系统测量了编码Agent与技术文档的真实交互。四大发现颠覆行业直觉:60.5%的文档交互指向AGENTS.md等Agent自有工件而非经典技术文档;读文档→写代码的关联在数据上未获解析;零次显式文档验证;文档产出速率达咨询的0.87倍却始终滞后于代码。论文据此提出双瓣循环模型,并指出「可操作性」「可验证性」两大agent-friendly文档假设缺乏行为支撑。

August 23, 2026 · 4 min

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees 精读

当 Agent 技能库膨胀到成千上万份文档,往上下文装哪几份技能直接决定任务成败与 token 账单。清华交叉信息研究院 Longbo Huang 组首次把「技能选择」形式化为硬 token 预算下最大化「单调次模收益减线性上下文惩罚」,并提出多项式算法 BPS,证明该问题首个双准则(1−1/e, 1)近似保证,收益系数多项式时间最优。目标函数从执行记录拟合,拟合误差可证转移到有界选择regret。在污染受控 BigCodeBench 变体上,BPS 达 0.73 实测成功率,对已发布路由器、检索器与执行器自选的 0.20–0.52 全面胜出,且比最强路由器省 28% token。本精读拆解其形式化、BPS 算法、预算对齐插值证明,以及「上下文价值是集合级而非单体可打分」的核心洞察。

August 23, 2026 · 6 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

深度精读 USTC+上海AI Lab+复旦合作的 FACET 论文——面向终端 agent 训练的任务合成框架。论文指出多阶段任务合成的两大失败根源:源信息逐步丢失与任务制品间漂移,提出三阶段方案:71K 技能库构建、五维情景重构、以及以’共享可执行状态’为核心的环境先行接地,按 I→S→V 顺序让指令/解法/验证器共享同一真实容器状态。基于 6078 个任务(每任务 22.77 项可执行检查)、仅 1.2K SFT 轨迹,即让 Qwen3.5-27B 在 Terminal-Bench 2.1 上提升 6.75 分,距 397B 巨兽仅差 1.49 分而参数少约 15 倍。

August 22, 2026 · 4 min

Repo0: Design-Driven Zero-to-All Code Generation 精读

现有代码生成系统大多假设仓库架构已经设计好,只负责往里填代码。Repo0(上海交通大学 + 重庆大学,2026年8月)直面「零到全」生成:从一句自然语言需求出发,构建整个软件项目,同时推断功能与架构。它的核心是把软件设计从「一次性静态蓝图」变成「持续结构演化过程」——用需求 DAG + 组件 DAG + 对齐关系构成的双 DAG 架构状态,在内聚/耦合等模块化度量引导下,通过 split/merge/revise/add/save 五种结构动作迭代演化至收敛,再由收敛架构引导测试驱动开发生成。在 RepoCraft 六个真实仓库 × GPT-5 mini 与 DeepSeek V3.2 双骨干上,Repo0 全部设置 Functionality Coverage 与 Pass Rate 最高,相比最强基线 RPG,Pass Rate 最高提升 29.74 个百分点。本精读覆盖问题定义、双 DAG 机制、五种结构动作、跨模型互评设计、消融证据与通用灵感。

August 22, 2026 · 5 min