SkillAlchemy: Open-World Agent Skill Creation 精读

SkillAlchemy(北航 × 山东大学 × 西北工业大学)把开放世界技能创建形式化为’来源接地的程序准入’问题:用配对对比探针发现隐式需求(改这个因子会不会改变程序行为?),对候选程序做 General/Scoped/Exclude 三态准入,再按公共技能语法编译技能包。结果:自动创建的技能在 SkillsBench v1.1 全量 87 任务上拿到 55.8%,首次与人工策划技能(54.4%)持平,且对来源注入攻击零传播——12 个恶意 payload 无一被提升进技能。

August 25, 2026 · 2 min

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? 精读

SWE Refactor Bench(Naver’s Lab × Einsia.AI × 清华)命名并防御了行为评测的 Blindness 盲区:迁移任务的起点测试本来就全绿,‘原样交回’的空 diff 可以骗过任何行为测试。该基准用 20 个真实开源项目(86.7 万行代码)+ 三阶段协议(迁移审计否决门 + 130,118 条固定检查 + 6 个对抗验证 Agent)证明:8 个前沿模型 520 个 run 中仅 5.4% 通过全部关卡,最强 claude-opus-5 也只拿 47/100——‘迁移完成’与’行为保持’是两种独立能力。

August 25, 2026 · 2 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

Task-CoEvolve(东京大学)把 harness 优化中被忽视的’评估侧’变成优化变量:每次迭代在哪些验证任务上评估候选 harness?方差加权采样把预算集中到’候选结果会分歧’的判别性任务上(>70% 的任务池处于全对/全错两个极端、毫无判别力且分布随优化漂移),配 Horvitz-Thompson 式包含概率校正消除子集偏差。结果:20% 评估预算匹配全量搜索(49.3% vs 48.6%),Terminal-Bench 2.1 上 token 评估成本直降 80%,7% 预算用 1/16 样本逼近全量。

August 25, 2026 · 1 min

The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search (Ascp) 精读

Ascp(北京大学 × 腾讯)为生成式搜索建立了’上下文分配定律’:同预算下窄窗多轮(k=2 检索×T=12 轮生成)比宽窗单轮(k=24×T=1)的 portfolio recall 高 0.144,T:1→12 带来 16.8-20.5pp 提升,且验证到 32B 规模。其测量工具是因果留一(LOO)探针——teacher-forced 反事实消融直接测量每篇文档对生成文本的因果利用率,在 same-query 硬负例下 AUC 0.876,而 embedding 相似度坍缩到 0.484(随机水平)。相关性代理测的是’话题相关’,不是’真被用了’。

August 25, 2026 · 2 min

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels 精读

这篇 ICLR 2027 论文(阿里 Amap × 南京大学)用结构因果模型(SCAE)把编码 Agent 的’过程评测’拆成三个被混用的层次,并给出三个可检验的颠覆性结论:下一动作由’执行出处’(provenance,模型刚看到什么)而非代码图结构决定(top-3 0.326 vs 0.058);不确定性属于任务而非步骤(190 个步骤级因果效应 0 个通过 FDR);全轨迹 LLM judge 存在系统性 collider 偏置——judge 能看到下游步骤时,归责位置系统性后移 +0.537。‘过程分数测的是语义相关性,不是认证的因果贡献。’

August 25, 2026 · 2 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

Naver Labs、Einsia.AI 与清华大学推出 AI4AI-Bench:冻结 10 个真实研究仓库,覆盖 SFT、agentic RL、蒸馏、奖励建模、DPO、扩散 RL、遗忘、图扩散、权重平均与剪枝十族算法,测评 agent 能否改写仓库训练算法本身。agent 在单块 B300 用 4 小时改代码;提交后源码从零训练 12 小时,由冻结评估器打分,σ 坐标统一指标(0.1 为原算法,1.0 为最优)。负结果:290 格平均 0.166,最强系统 Claude Opus 5 仅 0.250;触及学习层者平均 0.226,远高于只动运行层的 0.126。

August 24, 2026 · 4 min

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读

Co-RL 提出无标签多智能体强化学习框架:多个不共享参数的异构模型对同一道无标签题目各自采样回答,每个 agent 的奖励取决于其回答是否命中指定同伴的多数投票伪标签,从而把监督信号从『自己批改自己』换成『同伴互相批改』。理论证明自奖励是自我确认动态,正确率低于一半必然收敛到零;而跨智能体监督把正确收敛的吸引域扩大到两者正确率之和大于一。实验上文本七基准平均提升 3.0-8.6%,多模态四基准提升 2.3-7.2%,多个设置下甚至超过使用真值标签的 GRPO,也无需 LLM 裁判。

August 24, 2026 · 4 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

EnvHarness 把 agent harness 的思路搬到环境侧:不改一行底层代码,只在 reset/step 标准接口外包裹可插拔组件(Stage 改初始态、Contract 重写交互、Chain 串联环境),把静态人工环境改造成针对目标策略弱点的定制训练场,且 100% 继承原环境可信 verifier。配套 EnvRigger 自动化闭环从 rollout 诊断策略缺陷、写组件、用新鲜 rollout 验证。五个基准四领域全面超越原始环境与领域专用生成管线:held-out 最高提升 9.0 分、步数省 9.8%,并支撑 RL 共同进化。

August 24, 2026 · 3 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

FACET 由中国科学技术大学、上海人工智能实验室与复旦大学联合提出,直面从异构 agent 技能合成可验证终端任务的两大难题:多阶段生成中源信息被过早压缩、以及指令/环境/参考解/验证器四件套各自为政导致的跨工件不一致。其三阶段框架先收 71,341 个技能建场景-技能库,再以五维表示代理式重建场景以恢复跨技能依赖与中间状态,最后先构建并修复 Docker 环境,把实现容器态作为三者共享接地,并按失败溯源定向修复。最终产出 6,078 个验证任务,平均 22.77 项可执行测试居各数据集之首;仅用 1.2K 轨迹做 SFT,Qwen3.5-4B/9B/27B 在 Terminal-Bench 2.1 分别提升 7.12/8.24/6.75 分,27B 距大它约 15 倍的 397B 模型仅 1.49 分。

August 24, 2026 · 4 min

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills 精读

FlowEvo 提出一个免训练框架,让工作流与可执行技能在推理期共进化:它把验证通过的成功轨迹在线编译成带接口与回放测试的技能存入持久库,经直接执行、技能条件化生成与动态生成三路分层路由加以复用,并用对比效用机制抑制持续负迁移的技能。在 GPT-4o-mini 骨干上,FlowEvo 于 ALFWorld、HumanEval、MBPP、GSM8K、MATH-500 五个全量基准全面超越八个基线,ALFWorld 达 85.6%(超最强基线 26.4 点)且每任务 token 约为基线的三分之一,跨十种骨干模型 49/50 项对比胜出。

August 24, 2026 · 3 min