AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design 精读

把一篇20页论文变成一张合格学术海报,需要上百次工具调用、多轮排版修订与视觉验证——这是典型的长时程智能体设计任务。本文精读美团联合多家高校的 AutoDesign:它不直接训练模型,而是让一个元harness优化器引导 code agent 基于 rollout 反馈递归自改进 harness,经 7 天演化沉淀出可复用、可迁移的学习型 DesignHarness。在自建的 PosterBench 百篇论文基准上,AutoDesign 以 78.32 分超过商业系统 Claude Design 7.45 分,盲测人类偏好 BT 值 64.0% 位列第一;给 7 个模型配置挂载该 harness,平均分从 54.99 提升到 67.39。本精读重点拆解其双层优化循环、五组件 harness 结构,并用因果链解释’学习型 harness 为什么弱模型受益更大’。

August 15, 2026 · 3 min

DarwinX: Evolving Agent Harnesses Through Natural Selection 精读

LLM Agent 的能力不只取决于模型权重,还取决于包裹模型的 Harness(提示词、工具、技能、控制流)。Salesforce AI Research 的 DarwinX 在完全冻结模型权重的前提下,把 Agent 自进化重构为对 Harness 种群的“自然选择”:preserve-and-extend 契约只接纳“净增益为正且回退有界”的变体,树状 archive 保留多条谱系供跨谱系重组,失败/教师/自采三种证据共用同一编辑接口,适应度完全来自 benchmark 自带 verifier。四个基准平均提升约 17 分:Terminal-Bench 2.1 达 83.2%,WebArena-Infinity 从 43.5% 跃升至 93.0%,且零适应迁移到 SWE-bench Verified 达 84.2%。本精读逐部分拆解其机制,并建立“方法差异→机制变化→指标提升”的因果链。

August 15, 2026 · 5 min

How Can Rhetoric Reward-Hack AI Reviewers? 精读

当 AI 开始审稿,会不会写“彩虹屁”比做得好不好更重要?马里兰大学等四校团队用 120 篇 ICLR 2026 投稿构造 4200 篇修辞改写稿、收集 42396 条 AI 评审,系统量化了“只改措辞、不改内容”对评审分的因果影响:证据框架最能提分(最高 +0.93)、新颖性立场最能降分(最低 −0.73),低分稿越改越高、高分稿反而越改越低。本精读按九部分结构拆解其实验设计、因果链与可推广灵感。

August 15, 2026 · 4 min

Massive Activations in Hybrid Linear Attention Large Language Models 精读

混合线性注意力(HLA)LLM 用少量全注意力层搭配大量线性注意力层来兼顾长上下文与效率,但巨量激活(Massive Activations)在其中如何表现此前几乎无人研究。本精读覆盖首个系统性分析工作:论文发现两种与架构严格对齐的激活形态——注意力前尖峰(PAS)与尖峰间平台(ISP),在 5 种线性架构、6 种混合配置、5 个数据域、1.2B–397B 的 12 个开源检查点上高度复现,Sink-spike 对齐率高达 99.4%–100%;并提出统一的「写入-汇聚-抵消」生命周期机制:MA 的抵消时机决定形态——快速抵消形成 PAS,延迟抵消形成 ISP,全注意力极限下恢复传统 LLM 的稳定 MA。门控实验的不对称效应进一步印证全注意力层是组织 MA 动力学的核心节点。

August 15, 2026 · 5 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

当 AI 科学家已经能跑完“构思-实验-写作”全流程时,下一个瓶颈是什么?NUS 与牛津的 OmniScientist 给出的答案是:证据。现有系统只让智能体看到文本、代码和预计算的数字摘要,而图像里的形态、信号里的时序、跨通道的不一致这些科学上决定性的关系在接口处就丢失了。本文构建了一个感知层 + 3 个 ReAct 智能体 + 确定性管线的全模态全学科 AI 科学家,用代码强制执行新颖性、统计严谨性与数值溯源检查,在 36 个真实数据案例上全部完成从原始数据到可编译论文的全流程;配对消融显示直接感知在全部 7 个评审维度上优于“盲测”变体,正面交锋胜率 85%。本精读逐层拆解其感知分层、三重检查机制与因果链分析。

August 15, 2026 · 3 min

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 精读

可交互世界模型(如 Genie 3)正在爆发式涌现,但“每个模型用自家基准自测”使得跨模型公平比较几乎不可能——固定动作序列在不同模型上会走出完全不同的轨迹。PlayWorld 提出 Agent-as-Player 范式:让多模态 Agent 像人类玩家一样,为指定的长时程目标(转一圈看环境是否一致、走进水里看有没有涟漪)主动探索交互,再用四维度 VQA 体系打分。171 个人工标注场景、9 个世界模型的大规模评测显示:最高的 Genie 3 Overall 也只有 2.12/5,且所有模型在“视野外演化”“洞察演化”两类长时程状态维持维度上普遍不超过 2 分——“能演、但不能持续演化”是当前公认瓶颈。本精读覆盖其动机、方法、实验证据与因果链根源解释。

August 15, 2026 · 3 min

QuoteBench: How Matched Scores Can Hide Command-Path Failures 精读

LLM 编码 agent 的 Bash 命令在到达终端前,往往要经历序列化、包装、重新解析等“生成-执行边界”。QuoteBench 用 2×2 交叉设计(生成契约 × 执行传输)加固定回复重放证明:同一个回复只是多过一层解析器,成功率就暴跌 55.4–73.2 个百分点;而一句“你的命令会被嵌套进 bash -c 双引号”的边界披露,能让 6/8 配置恢复 30.4–60.7 点。GPT-5.6-sol 表面仅 -3.6 点的匹配分差,实际是 -64.3 点传输损伤与 +60.7 点模型补偿的合力。本精读覆盖其 56 任务 14 家族的构造、四格交叉的因果解耦机制、最终状态验证器设计,以及“评测五要素报告规范”的普适启示。

August 15, 2026 · 4 min

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models 精读

SKILLER 提出语言级强化学习框架:用强模型(GPT-5.4)兼任 actor 与 critic,把小模型智能体系统当作环境,官方验证器提供标量奖励与文本诊断,全部 RL 信号经由自然语言传播,优化变量是技能文本本身而非模型权重。在五个基准上,9B/4B 小模型配 SKILLER 技能全面超越闭源 Manus 与开源技能生成方法,SWE-Skills-Bench 上超人类技能 30.8 分,且零样本迁移到 GAIA/EarthBench 仍保持领先。本精读覆盖其背景脉络、语言级 RL 形式化、actor-critic 机制、消融因果链与可推广灵感。

August 15, 2026 · 5 min

Thought-Level Beam Search for Reasoning 精读

测试时算力扩展是大推理模型性能的主引擎,但并行采样极度浪费、减法剪枝又让GPU挨饿,核心问题已从“花多少算力”变成“把算力花在哪”。本文提出思维级束搜索 Gambit:用轻量评分器探测步骤边界隐状态,周期性剪除劣迹并立即从高分前缀分支,以零和交换维持固定容量活跃池,同时保持硬件满载。在 5 个基准 × 3 个模型上严格支配 SC、Slim-SC、DeepConf、STEP 四大基线:HMMT-24 最高 +6.7%,token 消耗较并行采样最高降 68.5%,吞吐超 2 倍,管理开销仅 0.97%。本精读覆盖其问题形式化、方法细节、实验证据与因果链根源分析。

August 15, 2026 · 3 min

Vero: Can AI Agents Build Formally Verified Software Repositories? 精读

AI agent 能写出“保证正确”的软件仓库吗?UC Berkeley Dawn Song 组牵头推出 Vero——首个仓库级“实现+证明”联合合成基准:43 个多模块 Lean 4 仓库、743 个 API、2705 条规格,并首创让 agent 形式化证明“基准本身有错”的审计机制。最强配置 GPT-5.5 (xhigh) + Codex 仅完全解决 27/43,仍有 10 个实例、219 条规格抵抗全部 8 个配置。本精读覆盖其基准构建、反作弊协议、审计机制与失败模式的因果分析。

August 15, 2026 · 3 min