LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks 精读

LongWoF-Bench(EvoMap × 清华大学,778 个机器可验证长工作流任务)回答了一个技能资产化的核心问题:什么样的’经验’才值得复用?对照实验给出干净答案——‘验证器确认的执行经验’(Gene)在 7 个消费模型上稳定超越静态技能文档 8.7~15.5pp 且 token 更省;而没有经过验证器确认的’参考蒸馏’经验反而全面落后。经验的有效性来自’经过端到端验证的失败与修正信息’,而非表示形式。

August 25, 2026 · 2 min

Prime Agent: A Self-Improving RLM Harness 精读

Prime Agent(Prime Intellect × Princeton × MIT)用一个持久 IPython REPL + 递归子 Agent 的抽象,证明同一模型仅更换 harness 即可把 ARC-AGI-3 成绩从 30.2% 推到 95.5%、超过人类专家基线 95.4%。本精读拆解其两层核心抽象——Recursive Language Model(把上下文当变量、子 Agent 委派当函数调用)与 Continual Harness(把 harness 自身状态变成可 CRUD、可在线自我改进的数据),并解释为什么’harness 表达力’是被严重低估的能力放大器。

August 25, 2026 · 3 min

SkillAlchemy: Open-World Agent Skill Creation 精读

SkillAlchemy(北航 × 山东大学 × 西北工业大学)把开放世界技能创建形式化为’来源接地的程序准入’问题:用配对对比探针发现隐式需求(改这个因子会不会改变程序行为?),对候选程序做 General/Scoped/Exclude 三态准入,再按公共技能语法编译技能包。结果:自动创建的技能在 SkillsBench v1.1 全量 87 任务上拿到 55.8%,首次与人工策划技能(54.4%)持平,且对来源注入攻击零传播——12 个恶意 payload 无一被提升进技能。

August 25, 2026 · 2 min

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills 精读

FlowEvo 提出一个免训练框架,让工作流与可执行技能在推理期共进化:它把验证通过的成功轨迹在线编译成带接口与回放测试的技能存入持久库,经直接执行、技能条件化生成与动态生成三路分层路由加以复用,并用对比效用机制抑制持续负迁移的技能。在 GPT-4o-mini 骨干上,FlowEvo 于 ALFWorld、HumanEval、MBPP、GSM8K、MATH-500 五个全量基准全面超越八个基线,ALFWorld 达 85.6%(超最强基线 26.4 点)且每任务 token 约为基线的三分之一,跨十种骨干模型 49/50 项对比胜出。

August 24, 2026 · 3 min

SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

SPADE 由九所高校联合提出,让单一 LLM 在自我对弈中同时扮演 Environment Designer 与 Reasoning Agent 两个角色:前者以 Python 代码生成带 reset/step 接口的完整可执行 MDP 训练环境与特权提示,后者解题学习。Designer 的奖励是提示前后的回报差(hint-based regret),能持续瞄准学习前沿,配合预训练语料接地与环境记忆防止坍缩。30B 模型在 8 个 held-out 基准平均 58.3(较 base +8.1),工具使用基准 ACEBench-Agent +13.9,验证了环境设计本身可学习这一迈向开放式自提升的关键一步。

August 24, 2026 · 5 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

东京大学团队提出Task-CoEvolve,让验证任务集与harness共进化:用方差加权采样把评估预算聚焦在候选harness分歧最大的能力前沿任务上,再用Horvitz-Thompson/Hájek类估计器从采样子集无偏还原全量分数。在Terminal-Bench 2.1上仅用20%预算就逼近全量搜索(均值51.7 vs 52.8),整体搜索成本降67-80%;文本分类7%预算接近全量、20%预算反超。本精读覆盖背景、定位、方法机制、实验证据、效果根源因果链、必要知识反推与通用灵感九个部分。

August 23, 2026 · 6 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

深度精读 EnvHarness——与 Agent Harness 对称的环境侧革命:不改环境本身,在交互接口上包装一层可编程插件(Stage/Contract/Chain 三类组件),把静态冻结环境重塑为针对当前策略弱点的定制化训练场。EnvRigger 自动化引擎通过 Observe→Diagnose→Write→Validate 四阶段循环,自动诊断策略缺陷并生成验证过的组件,在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBench 五大基准上全面超越原环境与领域特定生成器,环境规模化收益持续未饱和。

August 22, 2026 · 4 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

NUS 与牛津团队提出 OmniScientist——一个全生命周期感知驱动的全模态跨学科 AI 科学家。论文诊断现有系统的通病:workflow-complete 却 evidence-incomplete——数据经由人选择的文本/代码/标签/摘要进入 agent,科学上决定性的空间、时序、跨通道、程序性关系在接口处丢失。框架由感知层加三个自主 agent(ideation/experiment/writeup)组成,外层是确定性管线,配以 idea/rigour/claim 三重代码化检查(OpenAlex 先行检索、统计校正、数值溯源)。36 个真实数据案例覆盖 5 学科族与 4 类证据模态,Claude Sonnet 5 在全部案例完成『原始数据→编译 PDF』全流程,综合均分 6.3/10;配对盲评中感知版全 7 维占优、直接胜率 85%。机制分析显示感知系统把研究问题锚定在原始观测独有属性上——这是文本接口系统原则上无法到达的假设空间。

August 20, 2026 · 5 min

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification 精读

Salesforce AI Research对记忆式自改进agent做系统性重评测,揭露被忽视的可靠性问题:多次运行量化显示叠加自改进循环后71%的情形方差增大、同实验最好最差运行差可达10个百分点;默认任务顺序构成隐式课程——按默认顺序+1.5%改进,随机打乱后反而-4.5%。人工检查记忆提出欠规约(underspecification)假说:agent在缺乏清晰规约时生成’看似合理但不可用’的记忆(如纯浏览器环境推荐API用法),rubric与环境反馈注入可部分收窄退化。

August 20, 2026 · 1 min

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution 精读

上海交通大学顾晓东组提出SkillForge——面向项目特定issue解决的自蒸馏框架。核心洞察是冷启动问题:agent在特定仓库上缺乏项目知识,历史驱动方法依赖过往issue信号、在线方法每题付出昂贵探索成本。SkillForge反其道行之:主动重新实现仓库中带测试覆盖的核心功能来合成项目特定issue,解决后把经验蒸馏为实体锚定技能。SWE-bench Verified上DeepSeek-V3.2达72.2%(+5.8超基线,超最强对手+3.0),GPT-5-mini 60.6%(+5.6),SWE-bench Pro上同样领先,单issue成本仅$0.069-0.087。

August 20, 2026 · 2 min