SkillShapley: 技能步级Shapley归因 精读

深度精读北航与山东大学合作的 SkillShapley——首个面向 LLM Agent 技能的步级归因框架。它把 skill.md 的语义步骤视为合作博弈中的『玩家』,保留子集视为『联盟』,benchmark 成功率视为收益函数,用 Shapley 值量化每一步的真实贡献。针对『每个新联盟都要真实跑一遍 LLM agent』的高昂配置成本,BAES 用『warmup 锚点覆盖 + cache 感知自适应采集』两阶段策略,在同预算下产出远多于蒙特卡洛采样的可复用边际证据(99 配置预算下 206 条 vs 130 条)。案例研究给出一条朴素的技能写作启示:高价值步骤是连接任务条件与可执行决策的『程序性桥梁』,而背景解释性文本往往贡献为负。

August 16, 2026 · 3 min

A Programming Paradigm for Spatiotemporal Composability 精读

北大与 DeepSeek-AI 合作的 88 页长文,为「插件系统、自进化 Agent Harness」这类动态组合软件给出了第一个完整的编程范式级形式化基础:把经典效应系统提升为可逆效应、把协同效应系统提升为响应式协同效应,统一成一个递归上下文类型,再配上动态组合演算与全套元理论(保持性、恢复精确性、活性、合流性),实现为 Cordis 元框架并在 Koishi(4000+ 社区插件)上验证。本文按背景、定位、问题、解法、评估、根源解释、知识反推、通用灵感八个层面完整拆解。

August 15, 2026 · 5 min

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 精读

交互式世界模型要同时做到“记得住、答得快、跑得久”,但三者天然冲突。Alaya-EVOKE 给出了一个系统级解法:把持久记忆外部化为按相机位姿索引的世界状态库,让去噪器上下文有界;同时把“教师”本身当作设计变量,用稀疏注意力改造出能看 30 秒的长视野教师,再经 DMD 蒸馏出三步、无 CFG 的学生模型。结果是:WBench 导航拆分三组指标全第一、VBench-2.0 总分 66.77 登顶(超过 Veo 3),单卡 H200 上每 1.5 秒内容只需 2.11 秒生成,并且能连续跑一个多小时不崩。本精读面向初学者,拆解其三大机制、实验证据与效果优势的因果链。

August 15, 2026 · 3 min

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design 精读

把一篇20页论文变成一张合格学术海报,需要上百次工具调用、多轮排版修订与视觉验证——这是典型的长时程智能体设计任务。本文精读美团联合多家高校的 AutoDesign:它不直接训练模型,而是让一个元harness优化器引导 code agent 基于 rollout 反馈递归自改进 harness,经 7 天演化沉淀出可复用、可迁移的学习型 DesignHarness。在自建的 PosterBench 百篇论文基准上,AutoDesign 以 78.32 分超过商业系统 Claude Design 7.45 分,盲测人类偏好 BT 值 64.0% 位列第一;给 7 个模型配置挂载该 harness,平均分从 54.99 提升到 67.39。本精读重点拆解其双层优化循环、五组件 harness 结构,并用因果链解释’学习型 harness 为什么弱模型受益更大’。

August 15, 2026 · 3 min

DarwinX: Evolving Agent Harnesses Through Natural Selection 精读

LLM Agent 的能力不只取决于模型权重,还取决于包裹模型的 Harness(提示词、工具、技能、控制流)。Salesforce AI Research 的 DarwinX 在完全冻结模型权重的前提下,把 Agent 自进化重构为对 Harness 种群的“自然选择”:preserve-and-extend 契约只接纳“净增益为正且回退有界”的变体,树状 archive 保留多条谱系供跨谱系重组,失败/教师/自采三种证据共用同一编辑接口,适应度完全来自 benchmark 自带 verifier。四个基准平均提升约 17 分:Terminal-Bench 2.1 达 83.2%,WebArena-Infinity 从 43.5% 跃升至 93.0%,且零适应迁移到 SWE-bench Verified 达 84.2%。本精读逐部分拆解其机制,并建立“方法差异→机制变化→指标提升”的因果链。

August 15, 2026 · 5 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

当 AI 科学家已经能跑完“构思-实验-写作”全流程时,下一个瓶颈是什么?NUS 与牛津的 OmniScientist 给出的答案是:证据。现有系统只让智能体看到文本、代码和预计算的数字摘要,而图像里的形态、信号里的时序、跨通道的不一致这些科学上决定性的关系在接口处就丢失了。本文构建了一个感知层 + 3 个 ReAct 智能体 + 确定性管线的全模态全学科 AI 科学家,用代码强制执行新颖性、统计严谨性与数值溯源检查,在 36 个真实数据案例上全部完成从原始数据到可编译论文的全流程;配对消融显示直接感知在全部 7 个评审维度上优于“盲测”变体,正面交锋胜率 85%。本精读逐层拆解其感知分层、三重检查机制与因果链分析。

August 15, 2026 · 3 min

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 精读

可交互世界模型(如 Genie 3)正在爆发式涌现,但“每个模型用自家基准自测”使得跨模型公平比较几乎不可能——固定动作序列在不同模型上会走出完全不同的轨迹。PlayWorld 提出 Agent-as-Player 范式:让多模态 Agent 像人类玩家一样,为指定的长时程目标(转一圈看环境是否一致、走进水里看有没有涟漪)主动探索交互,再用四维度 VQA 体系打分。171 个人工标注场景、9 个世界模型的大规模评测显示:最高的 Genie 3 Overall 也只有 2.12/5,且所有模型在“视野外演化”“洞察演化”两类长时程状态维持维度上普遍不超过 2 分——“能演、但不能持续演化”是当前公认瓶颈。本精读覆盖其动机、方法、实验证据与因果链根源解释。

August 15, 2026 · 3 min

QuoteBench: How Matched Scores Can Hide Command-Path Failures 精读

LLM 编码 agent 的 Bash 命令在到达终端前,往往要经历序列化、包装、重新解析等“生成-执行边界”。QuoteBench 用 2×2 交叉设计(生成契约 × 执行传输)加固定回复重放证明:同一个回复只是多过一层解析器,成功率就暴跌 55.4–73.2 个百分点;而一句“你的命令会被嵌套进 bash -c 双引号”的边界披露,能让 6/8 配置恢复 30.4–60.7 点。GPT-5.6-sol 表面仅 -3.6 点的匹配分差,实际是 -64.3 点传输损伤与 +60.7 点模型补偿的合力。本精读覆盖其 56 任务 14 家族的构造、四格交叉的因果解耦机制、最终状态验证器设计,以及“评测五要素报告规范”的普适启示。

August 15, 2026 · 4 min

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models 精读

SKILLER 提出语言级强化学习框架:用强模型(GPT-5.4)兼任 actor 与 critic,把小模型智能体系统当作环境,官方验证器提供标量奖励与文本诊断,全部 RL 信号经由自然语言传播,优化变量是技能文本本身而非模型权重。在五个基准上,9B/4B 小模型配 SKILLER 技能全面超越闭源 Manus 与开源技能生成方法,SWE-Skills-Bench 上超人类技能 30.8 分,且零样本迁移到 GAIA/EarthBench 仍保持领先。本精读覆盖其背景脉络、语言级 RL 形式化、actor-critic 机制、消融因果链与可推广灵感。

August 15, 2026 · 5 min

Thought-Level Beam Search for Reasoning 精读

测试时算力扩展是大推理模型性能的主引擎,但并行采样极度浪费、减法剪枝又让GPU挨饿,核心问题已从“花多少算力”变成“把算力花在哪”。本文提出思维级束搜索 Gambit:用轻量评分器探测步骤边界隐状态,周期性剪除劣迹并立即从高分前缀分支,以零和交换维持固定容量活跃池,同时保持硬件满载。在 5 个基准 × 3 个模型上严格支配 SC、Slim-SC、DeepConf、STEP 四大基线:HMMT-24 最高 +6.7%,token 消耗较并行采样最高降 68.5%,吞吐超 2 倍,管理开销仅 0.97%。本精读覆盖其问题形式化、方法细节、实验证据与因果链根源分析。

August 15, 2026 · 3 min