Apodex 1.1: Scaling Agentic Intelligence for Complex Work 精读

Apodex 1.1(Apodex Team)提出’双扩展面’范式:把任务环境构建(Environment Scaling)与多智能体协调(Agentic Coordination Scaling)确立为与模型规模并列的两个扩展维度。Agent Team 架构把任务分解、异步委派、非对称验证、重规划训练进模型策略,在 GDPVal 拿到 78.8 win rate、IMO-2026 数学超金牌线、SWE-bench Verified 77.7%,且全部开源(含 35B mini 版权重)。本精读重点拆解其’正向便宜、逆向昂贵’的验证器设计与 Agent Team 协调增益的机制来源。

August 25, 2026 · 2 min

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces 精读

AutoSaddler(Microsoft × POSTECH × KAIST × 南方科技大学)把 Agent harness(提示词/工具/中间件)的优化形式化为离线 mini-batch 学习问题:深度诊断 Agent 读执行轨迹定位根因、生成结构化 patch(Prompt/Tool/Middleware 三类九子型)、Reflection 提炼经验存入 EvoDAG 进化图、泛化感知选择防过拟合。GAIA2 +9.0pp、SWE-Bench Pro +9.6pp、Terminal-Bench 2.0 +10.0pp 全面超越人工与自动基线,且学习轨迹只需最强基线的 1/10。

August 25, 2026 · 2 min

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills 精读

NVIDIA 提出 ACES,把 Agent 技能从「扫描文档」推进到「活体配对评测」:同一任务在有技能/无技能两种条件下运行,唯一变量是目标技能是否可用,六指标差值即 Skill Lift。145 个技能上结构分与 LLM 评分相关性仅 Spearman ρ=0.14,94.5% 通过结构门槛的技能与活体 Lift 相关性近零(-0.018);947 个配对案例显示平均复合 Skill Lift 为 0.2134,其中技能执行 +0.33、行为检查 +0.30 等过程指标贡献最大,且负 Lift 可区分「从未发现」与「发现但误用」两类失败——这是文档扫描永远看不到的信号。

August 25, 2026 · 3 min

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents 精读

深度精读 UIUC×Meta AI 合作论文 EvoHarness-RL(已被 LLA@COLM 2026 接收):把长程智能体对外部 harness(记忆、工具、状态跟踪)的访问从提示词硬编码变成可学习的策略决策。通过 BPE 三态抽象(Belief/Progress/Experience)与四个元动作(track/commit/recall/note),配合教师轨迹 SFT 与代价感知 GRPO 两阶段训练,Qwen3-8B 在 ALFWorld 上从 ReAct 的 47.9% 跃升至 96.9%,逼近 Claude Opus 4.5;训练中还揭示“harness 退火”与“harness 演化”两个动力学过程。

August 25, 2026 · 5 min

Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution 精读

深度精读普渡大学 arXiv 2026 论文 ARTIC:自然语言工作流虽然给智能体提供了软件式接口,但数据依赖隐式、长分支指令难跟随,执行不可靠。ARTIC 把 NL 工作流编译为每步声明读写工件、约束门控产出、显式控制转移的形态,用约束优化精化高风险步骤,再以局部义务分解加场景干跑验证忠实性。在 11 个真实领域 488 个问题上,任务解决率较原始文本工作流提升 28 个百分点,跨模型执行一致性提升 32 个百分点,重复执行一致性提升 56 个百分点。

August 25, 2026 · 2 min

Prime Agent: A Self-Improving RLM Harness 精读

Prime Agent(Prime Intellect × Princeton × MIT)用一个持久 IPython REPL + 递归子 Agent 的抽象,证明同一模型仅更换 harness 即可把 ARC-AGI-3 成绩从 30.2% 推到 95.5%、超过人类专家基线 95.4%。本精读拆解其两层核心抽象——Recursive Language Model(把上下文当变量、子 Agent 委派当函数调用)与 Continual Harness(把 harness 自身状态变成可 CRUD、可在线自我改进的数据),并解释为什么’harness 表达力’是被严重低估的能力放大器。

August 25, 2026 · 3 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

Task-CoEvolve(东京大学)把 harness 优化中被忽视的’评估侧’变成优化变量:每次迭代在哪些验证任务上评估候选 harness?方差加权采样把预算集中到’候选结果会分歧’的判别性任务上(>70% 的任务池处于全对/全错两个极端、毫无判别力且分布随优化漂移),配 Horvitz-Thompson 式包含概率校正消除子集偏差。结果:20% 评估预算匹配全量搜索(49.3% vs 48.6%),Terminal-Bench 2.1 上 token 评估成本直降 80%,7% 预算用 1/16 样本逼近全量。

August 25, 2026 · 1 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

EnvHarness 把 agent harness 的思路搬到环境侧:不改一行底层代码,只在 reset/step 标准接口外包裹可插拔组件(Stage 改初始态、Contract 重写交互、Chain 串联环境),把静态人工环境改造成针对目标策略弱点的定制训练场,且 100% 继承原环境可信 verifier。配套 EnvRigger 自动化闭环从 rollout 诊断策略缺陷、写组件、用新鲜 rollout 验证。五个基准四领域全面超越原始环境与领域专用生成管线:held-out 最高提升 9.0 分、步数省 9.8%,并支撑 RL 共同进化。

August 24, 2026 · 3 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

FACET 由中国科学技术大学、上海人工智能实验室与复旦大学联合提出,直面从异构 agent 技能合成可验证终端任务的两大难题:多阶段生成中源信息被过早压缩、以及指令/环境/参考解/验证器四件套各自为政导致的跨工件不一致。其三阶段框架先收 71,341 个技能建场景-技能库,再以五维表示代理式重建场景以恢复跨技能依赖与中间状态,最后先构建并修复 Docker 环境,把实现容器态作为三者共享接地,并按失败溯源定向修复。最终产出 6,078 个验证任务,平均 22.77 项可执行测试居各数据集之首;仅用 1.2K 轨迹做 SFT,Qwen3.5-4B/9B/27B 在 Terminal-Bench 2.1 分别提升 7.12/8.24/6.75 分,27B 距大它约 15 倍的 397B 模型仅 1.49 分。

August 24, 2026 · 4 min

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC、KUKA、上海交大与浙大合作的SemaPLC提出验证门控的agent harness:生成逻辑必须嵌入既有工业PLC项目、通过编译,并在真实运行时与金轨迹比对正确才算完成。凭借仅日志确认的检查可判定完成、编辑使旧判定失效、每检查限两次重试三条完成纪律,它在117任务功能轨上七模型全部夺魁(均值72.6%),在65任务项目轨上动态行为分达52.2,远超基线的22.4~31.4。层消融揭示:静态分相近的方法在运行时剧烈分层——执行才是检验控制逻辑的忠实标尺。

August 24, 2026 · 3 min