JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution 精读

Agent 的能力从来不只取决于模型权重,还取决于包裹模型的执行脚手架(harness)。LV-NUS Lab 提出 JIT-Agent,训练一个 27B 的「harness 智能模型」,在推理时为任意现成 agentic LLM 即时合成任务自适应的 harness,并能修复与在线演化。DeepSeek-V4-Flash 配上它即可在 DeepSearchQA 反超 GPT-5.6 达 9.1 分,同时成本比所有固定 harness 平均低 36%。本精读拆解其四模块 harness 协议、三阶段训练流水线与 Evo-GDPO 目标,并解释「按任务实例即时生成脚手架」为什么在机制上必然优于单一固定脚手架。

August 27, 2026 · 4 min

Meta^n: Recursive Self-Improvement through Emergent Depth 精读

Meta^n(明尼苏达大学 × 首尔国立大学)针对自我改进系统『实现元深度只有约 2』的天花板,提出固定元操作 Ω 对自身输入递归:Ω 读下层栈的全任务执行轨迹+产生它们的代码栈,写出下一层(策略性预处理器+可调用辅助函数库),深度由收敛决定而非预先设定,进化档案在层链空间搜索。8 个基准族 × 2 骨干上至少一个估计器全面领先先前自改进 agent,ARC-AGI-2 held-out 上唯一非零(0.331 vs OpenEvolve 0.003);消融显示递归本身贡献 +0.131,其中层间条件化占约 72%;深度角色自发涌现——回滚角色在深度 2 恰为零、深度 3 出现 55%。

August 27, 2026 · 3 min

Praxist: From Experimental Artifacts to Solution Lineages 精读

自主 R&D Agent 已经会写代码、跑实验、改工件,但多数系统把每次尝试当作近乎独立的事件——日志记下了「发生了什么」,却没建立「哪个设计元素带来了提升、证据是否经受住验证、如何与其他元素重组」。长周期研究于是反复重学同样的教训。Sapient Intelligence 联合南洋理工、清华、CMU、UPenn 的 PRAXIST 提出「证据继承」:把可复现工件与评估结果转化为类型化的发现(正/负/诊断/不确定/程序性)、四车道 frontier(confirmed/candidate/diagnostic/validation)与世代议程,失败与诊断成为一等证据。MLE-bench 全 75 题拿下 60 枚奖牌(49 金),花费 3,054 美元——约为 Claude Code+Opus 4.8 基线(38,370 美元、55 枚、34 金)的十二分之一;火箭着陆案例从 4.03% 起步做到 12,288/12,288 满分。

August 27, 2026 · 4 min

Recuris: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 精读

Recuris(NUS × Stanford × Oxford × Princeton)把递归自我改进从『改模型/改智能体』收缩到『只演化外置记忆控制层』:工作记忆维护经检查器验证的任务状态并按需调用技能,跨任务的固定 Meta-Agent 读结构化轨迹、把失败归因到 E/W/ρ/C 四组件之一并只修补被归因组件,经修复源任务且不回退开发集的验证门才准入。在 4 个长程基准 × 10 个模型上 35/37 完成的模型-基准对成功率提升,GPT-5.6 Sol +17.8、Claude Opus 5 +15.6、最长任务 +32.2 分,六类长程失败模式下降 20–86%;机制上证明长程失败是执行问题而非检索问题,技能价值是『调用条件性』的,结构化轨迹使故障定位从 13.0% 提升到 64.8%。

August 27, 2026 · 3 min

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents 精读

RL 训练的 LLM Agent 大多是’健忘’的:每个 episode 从零开始,过往经验无法沉淀。阿里高德(AMAP)团队提出的 SkillForge 让技能库在训练中持续进化——prompt 只注入紧凑技能目录,agent 用 <skill_call> 标签按需调用,每次调用成为轨迹中可观测、可归因的离散事件,GRPO 因此能同时优化环境动作与技能调用决策;证据驱动的技能验证(EMA 成功率+使用次数计算欠效分数)让低效技能被 reflexion 及时改写,多路径归纳从成功/失败/对比三通道合成新技能。在 ALFWorld/WebShop/AppWorld 三基准上全面超越 SkillRL(AppWorld SGC 近 3 倍),且 4B 小模型进化出的技能库迁移到 30B 模型能反超其自进化库——技能存的是可迁移知识而非模型私有产物。

August 27, 2026 · 4 min

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments 精读

深度精读 ServiceNow 与 Mila 的企业环境 harness 进化研究——在模型权重完全冻结的前提下,用分层搜索自动进化面向特定企业环境的 agent harness(提示词/工具接口/skills/MCP/子agent/执行循环)。通过按基线失败模式分层采样构建紧凑进化池、proposer 可见搜索集与隐藏选择集分离、test-flip 门控 + 严格爬山接受,在 ITBench SRE / EnterpriseOps-Gym ITSM / AutomationBench Finance 三个基准上较默认 harness 提升 20-35 个百分点,且冻结迁移到 Qwen/GPT 全系列模型仍有效。21 个被接受 patch 归结为三类修复:接口修复、环境约定显式化、压缩搜索的操作知识。

August 27, 2026 · 4 min

SwarmWorld: Stigmergic technological evolution in societies of language-model agents 精读

去中心化的同质 LLM Agent 群落,能在没有预设角色、配方与技术目录的条件下,仅靠共享一个可被改造的物理世界,构建出功能性的技术生态并超越同计算量的独立搜索吗?MIT 的 SwarmWorld 给出受控答案:Agent 只获局部观测并提主张,确定性模拟器独自判定后果(提议-后果分离);评估时移除全部 Agent、冻结世界克隆 8 份施加未见扰动。结果是「有界群体优势」:共享世界在组合韧性、验证发明数上几乎全面超越逐端点 best-of-N 独立包络(发明 5.75–7.00 vs 2.75),但最强单件仍属独立搜索(0.3488 vs 0.2380);约 95% 的技术采纳始于物理观察而非直接交流——共享物理基底而非通信本身才是群体能力的主要来源。

August 27, 2026 · 3 min

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale 精读

深度精读 Meridian Intelligence 与 UMass Amherst 合作的 AgentMercury 论文——从高层业务场景合成 4,783 个可执行业务环境的框架。文章拆解其世界与任务分离设计、PLANET 构造流程与确定性 SQL 验证机制,解读 Qwen3.5-4B 在 EnterpriseOps-Gym 提升 27.6%、AIME26 提升 10.1 分的域外迁移证据,以及构造轨迹微调让环境作者成功率从 3.3% 跃升至 83.3% 的闭环实验,回答一个核心问题:出题人本身能否被训练出题。

August 25, 2026 · 4 min

AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization 精读

深度精读 AUSO 论文——中科大 × UNSW × 国科大 × 西交利物浦跨国合作提出的动作级统一技能优化框架。从技能角色随策略演化而变化的洞察出发,拆解任务级路由的噪声困境与轨迹内技能效应异质性问题,详解三阶段渐进优化(师从内化 → 结果探索 → 双上下文动作级利用)、JSD 信息增益信号与不确定性门控的设计逻辑,结合 ALFWorld / WebShop / SearchQA 三基准与五组件消融的证据链,反推出干预粒度下沉、生命周期感知训练、双上下文自对照三条通用性灵感。

August 25, 2026 · 4 min

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces 精读

AutoSaddler(Microsoft × POSTECH × KAIST × 南方科技大学)把 Agent harness(提示词/工具/中间件)的优化形式化为离线 mini-batch 学习问题:深度诊断 Agent 读执行轨迹定位根因、生成结构化 patch(Prompt/Tool/Middleware 三类九子型)、Reflection 提炼经验存入 EvoDAG 进化图、泛化感知选择防过拟合。GAIA2 +9.0pp、SWE-Bench Pro +9.6pp、Terminal-Bench 2.0 +10.0pp 全面超越人工与自动基线,且学习轨迹只需最强基线的 1/10。

August 25, 2026 · 2 min