Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution 精读

深度精读普渡大学 arXiv 2026 论文 ARTIC:自然语言工作流虽然给智能体提供了软件式接口,但数据依赖隐式、长分支指令难跟随,执行不可靠。ARTIC 把 NL 工作流编译为每步声明读写工件、约束门控产出、显式控制转移的形态,用约束优化精化高风险步骤,再以局部义务分解加场景干跑验证忠实性。在 11 个真实领域 488 个问题上,任务解决率较原始文本工作流提升 28 个百分点,跨模型执行一致性提升 32 个百分点,重复执行一致性提升 56 个百分点。

August 25, 2026 · 2 min

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning (NFV) 精读

NFV(Microsoft Research,单作者 Shuvendu K. Lahiri)让 AI Agent 当形式验证语言的前端:Python 开发者用自然语言问’这个函数对不对’,Agent 把程序与规范翻译到 Dafny,由成熟验证器逐条机器检查,证明可查、缺陷有 witness。在 206 条数据集上 57.3% 的条目给出机器检查证明 @92.2% 精度——而 LLM-as-judge 直接判定的精度只有 72% 且无 artifact;无纪律的’LLM+验证器自由证明’更是 98% 的正确程序和错误程序都被’证明’(精度 50%)。关键机制是’无证明即弃权’与 staged discipline(溯源标签+冻结翻译堵死为证明而改代码的捷径)。

August 25, 2026 · 2 min

Prime Agent: A Self-Improving RLM Harness 精读

Prime Agent(Prime Intellect × Princeton × MIT)用一个持久 IPython REPL + 递归子 Agent 的抽象,证明同一模型仅更换 harness 即可把 ARC-AGI-3 成绩从 30.2% 推到 95.5%、超过人类专家基线 95.4%。本精读拆解其两层核心抽象——Recursive Language Model(把上下文当变量、子 Agent 委派当函数调用)与 Continual Harness(把 harness 自身状态变成可 CRUD、可在线自我改进的数据),并解释为什么’harness 表达力’是被严重低估的能力放大器。

August 25, 2026 · 3 min

Repo2Skill-Evo: Repository Skills Go Stale in Silence 精读

Repo2Skill-Evo(字节跳动 × 北京大学 × 北京交通大学)提出并评测了一个此前无人命名的问题:‘仓库技能静默失效’——仓库版本升级后,从旧版蒸馏的 Agent 技能不报任何错、继续被加载检索,但内容已全面过时。基准要求 Agent 依据官方 release patch 维护技能集(删掉过时内容),用人工逐行验证的 12,217 行’黄金过时行集’做删除式指标:6 个前沿模型全部不及格,最强的 Claude-opus-4.6 也只有 69.7% F1,85/105 个版本转换低于 0.65 的 Easy 阈值。

August 25, 2026 · 2 min

Signal or Noise? A Benchmark Study of Agent Skills in Web Development 精读

Signal or Noise(百度 NLP)用字节长度匹配对照(±5% 的无关 Skill 控制组)证明:向编码 Agent 注入匹配的 WebDev Skill 平均是负收益——4 个模型 ΔPass@2 全负(-1.3~-4.2pp),token 开销却 +72%~394%。更深一层,负效应有两种机制:Sonnet/Qwen 是’长度分心’(该缩短 prompt),GPT-5.1/DeepSeek 是’内容误导’(该审查内容),需要相反对策;且 Skill 效用的跨模型相关性近零(|r|≤0.12)——Skill 是 (Skill,项目,模型) 三元组属性,不是可移植资产。

August 25, 2026 · 2 min

SkillAlchemy: Open-World Agent Skill Creation 精读

SkillAlchemy(北航 × 山东大学 × 西北工业大学)把开放世界技能创建形式化为’来源接地的程序准入’问题:用配对对比探针发现隐式需求(改这个因子会不会改变程序行为?),对候选程序做 General/Scoped/Exclude 三态准入,再按公共技能语法编译技能包。结果:自动创建的技能在 SkillsBench v1.1 全量 87 任务上拿到 55.8%,首次与人工策划技能(54.4%)持平,且对来源注入攻击零传播——12 个恶意 payload 无一被提升进技能。

August 25, 2026 · 2 min

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? 精读

SWE Refactor Bench(Naver’s Lab × Einsia.AI × 清华)命名并防御了行为评测的 Blindness 盲区:迁移任务的起点测试本来就全绿,‘原样交回’的空 diff 可以骗过任何行为测试。该基准用 20 个真实开源项目(86.7 万行代码)+ 三阶段协议(迁移审计否决门 + 130,118 条固定检查 + 6 个对抗验证 Agent)证明:8 个前沿模型 520 个 run 中仅 5.4% 通过全部关卡,最强 claude-opus-5 也只拿 47/100——‘迁移完成’与’行为保持’是两种独立能力。

August 25, 2026 · 2 min

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels 精读

这篇 ICLR 2027 论文(阿里 Amap × 南京大学)用结构因果模型(SCAE)把编码 Agent 的’过程评测’拆成三个被混用的层次,并给出三个可检验的颠覆性结论:下一动作由’执行出处’(provenance,模型刚看到什么)而非代码图结构决定(top-3 0.326 vs 0.058);不确定性属于任务而非步骤(190 个步骤级因果效应 0 个通过 FDR);全轨迹 LLM judge 存在系统性 collider 偏置——judge 能看到下游步骤时,归责位置系统性后移 +0.537。‘过程分数测的是语义相关性,不是认证的因果贡献。’

August 25, 2026 · 2 min

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation 精读

为什么最强的编码 Agent 一进专业仓库就失灵?北京大学团队把根因锁定在「隐性知识」——那些只存在于开发者脑中、从不写进文档的业务规则、接口契约与操作约定。它们潜伏在开发实践之下、沿代码依赖图分散传播、且 Agent 根本不知道自己缺什么,三重性质让一切检索式方案天然失效。PRAXIS 给出四阶段闭环:让 Agent 在目标仓库里真实写代码暴露行为差异、蒸馏为带触发条件的结构化四元组、锚定到依赖图上双向传播与去重仲裁、并在任务初始化与工具交互时主动注入,支持在线演化。KoCo-Bench 四域平均 Pass@1 达 32.06%,较次优基线相对提升 16.7%,且随实践积累持续上涨。

August 24, 2026 · 5 min

Repo0: Design-Driven Zero-to-All Code Generation 精读

上海交通大学(7 人主导)联合重庆大学的论文 Repo0 聚焦『从零到整仓』代码生成:仅凭自然语言需求从零构建整个软件仓库,必须同时推断功能与架构。核心创新是把一次性静态图规划改造成连续结构演化——维护『需求级 DAG+组件级 DAG+多对多对齐』的 Dual-DAG 架构状态,用内聚度低于 2/3 触发拆分、耦合度(Jaccard)高于 0.7 触发合并、图割提供拆分证据,迭代至结构收敛后再进入 TDD 代码生成。在 RepoCraft 六仓库、GPT-5 mini 与 DeepSeek V3.2 双骨干的全部设置下均取得最高功能覆盖率与通过率,requests 覆盖率达 100%,较最强基线 RPG 覆盖率最高提升 20.08 个百分点、通过率最高提升 29.74 个百分点;消融证明结构演化、双图分离与依赖序生成缺一不可。

August 24, 2026 · 4 min