Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution 精读

深度精读普渡大学 arXiv 2026 论文 ARTIC:自然语言工作流虽然给智能体提供了软件式接口,但数据依赖隐式、长分支指令难跟随,执行不可靠。ARTIC 把 NL 工作流编译为每步声明读写工件、约束门控产出、显式控制转移的形态,用约束优化精化高风险步骤,再以局部义务分解加场景干跑验证忠实性。在 11 个真实领域 488 个问题上,任务解决率较原始文本工作流提升 28 个百分点,跨模型执行一致性提升 32 个百分点,重复执行一致性提升 56 个百分点。

August 25, 2026 · 2 min

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning (NFV) 精读

NFV(Microsoft Research,单作者 Shuvendu K. Lahiri)让 AI Agent 当形式验证语言的前端:Python 开发者用自然语言问’这个函数对不对’,Agent 把程序与规范翻译到 Dafny,由成熟验证器逐条机器检查,证明可查、缺陷有 witness。在 206 条数据集上 57.3% 的条目给出机器检查证明 @92.2% 精度——而 LLM-as-judge 直接判定的精度只有 72% 且无 artifact;无纪律的’LLM+验证器自由证明’更是 98% 的正确程序和错误程序都被’证明’(精度 50%)。关键机制是’无证明即弃权’与 staged discipline(溯源标签+冻结翻译堵死为证明而改代码的捷径)。

August 25, 2026 · 2 min

Prime Agent: A Self-Improving RLM Harness 精读

Prime Agent(Prime Intellect × Princeton × MIT)用一个持久 IPython REPL + 递归子 Agent 的抽象,证明同一模型仅更换 harness 即可把 ARC-AGI-3 成绩从 30.2% 推到 95.5%、超过人类专家基线 95.4%。本精读拆解其两层核心抽象——Recursive Language Model(把上下文当变量、子 Agent 委派当函数调用)与 Continual Harness(把 harness 自身状态变成可 CRUD、可在线自我改进的数据),并解释为什么’harness 表达力’是被严重低估的能力放大器。

August 25, 2026 · 3 min

Repo2Skill-Evo: Repository Skills Go Stale in Silence 精读

Repo2Skill-Evo(字节跳动 × 北京大学 × 北京交通大学)提出并评测了一个此前无人命名的问题:‘仓库技能静默失效’——仓库版本升级后,从旧版蒸馏的 Agent 技能不报任何错、继续被加载检索,但内容已全面过时。基准要求 Agent 依据官方 release patch 维护技能集(删掉过时内容),用人工逐行验证的 12,217 行’黄金过时行集’做删除式指标:6 个前沿模型全部不及格,最强的 Claude-opus-4.6 也只有 69.7% F1,85/105 个版本转换低于 0.65 的 Easy 阈值。

August 25, 2026 · 2 min

Signal or Noise? A Benchmark Study of Agent Skills in Web Development 精读

Signal or Noise(百度 NLP)用字节长度匹配对照(±5% 的无关 Skill 控制组)证明:向编码 Agent 注入匹配的 WebDev Skill 平均是负收益——4 个模型 ΔPass@2 全负(-1.3~-4.2pp),token 开销却 +72%~394%。更深一层,负效应有两种机制:Sonnet/Qwen 是’长度分心’(该缩短 prompt),GPT-5.1/DeepSeek 是’内容误导’(该审查内容),需要相反对策;且 Skill 效用的跨模型相关性近零(|r|≤0.12)——Skill 是 (Skill,项目,模型) 三元组属性,不是可移植资产。

August 25, 2026 · 2 min

SkillAlchemy: Open-World Agent Skill Creation 精读

SkillAlchemy(北航 × 山东大学 × 西北工业大学)把开放世界技能创建形式化为’来源接地的程序准入’问题:用配对对比探针发现隐式需求(改这个因子会不会改变程序行为?),对候选程序做 General/Scoped/Exclude 三态准入,再按公共技能语法编译技能包。结果:自动创建的技能在 SkillsBench v1.1 全量 87 任务上拿到 55.8%,首次与人工策划技能(54.4%)持平,且对来源注入攻击零传播——12 个恶意 payload 无一被提升进技能。

August 25, 2026 · 2 min

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? 精读

SWE Refactor Bench(Naver’s Lab × Einsia.AI × 清华)命名并防御了行为评测的 Blindness 盲区:迁移任务的起点测试本来就全绿,‘原样交回’的空 diff 可以骗过任何行为测试。该基准用 20 个真实开源项目(86.7 万行代码)+ 三阶段协议(迁移审计否决门 + 130,118 条固定检查 + 6 个对抗验证 Agent)证明:8 个前沿模型 520 个 run 中仅 5.4% 通过全部关卡,最强 claude-opus-5 也只拿 47/100——‘迁移完成’与’行为保持’是两种独立能力。

August 25, 2026 · 2 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

Task-CoEvolve(东京大学)把 harness 优化中被忽视的’评估侧’变成优化变量:每次迭代在哪些验证任务上评估候选 harness?方差加权采样把预算集中到’候选结果会分歧’的判别性任务上(>70% 的任务池处于全对/全错两个极端、毫无判别力且分布随优化漂移),配 Horvitz-Thompson 式包含概率校正消除子集偏差。结果:20% 评估预算匹配全量搜索(49.3% vs 48.6%),Terminal-Bench 2.1 上 token 评估成本直降 80%,7% 预算用 1/16 样本逼近全量。

August 25, 2026 · 1 min

The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search (Ascp) 精读

Ascp(北京大学 × 腾讯)为生成式搜索建立了’上下文分配定律’:同预算下窄窗多轮(k=2 检索×T=12 轮生成)比宽窗单轮(k=24×T=1)的 portfolio recall 高 0.144,T:1→12 带来 16.8-20.5pp 提升,且验证到 32B 规模。其测量工具是因果留一(LOO)探针——teacher-forced 反事实消融直接测量每篇文档对生成文本的因果利用率,在 same-query 硬负例下 AUC 0.876,而 embedding 相似度坍缩到 0.484(随机水平)。相关性代理测的是’话题相关’,不是’真被用了’。

August 25, 2026 · 2 min

The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models 精读

这篇来自 VIDRAFT AI Research(韩国)的论文证明:‘看 mask’这个全行业默认的因果性检查,在混合架构时代完全失效——192 次注入故障中 mask 检查 0/192 发现,而两次前向传播的前缀不变性审计 192/192 精确定位到泄漏层。更重磅的是实际战果:在两个已发布模型(Zamba2-1.2B 与 Nemotron-H-8B)中挖出真实因果泄漏——chunk 边界处未来信息泄漏进当前表示,缺陷源于同一段三行代码(inter-chunk 递归 reduce 求和轴错误),两行修复后泄漏精确归零。方法只需两次前向、无梯度,135M 模型 CPU 上半秒。

August 25, 2026 · 2 min