GitSkills: A Dataset of Agent Skills on GitHub 精读

深度精读 UCL、霍恩海姆大学与卡利亚里大学合作的 GitSkills——首个对 GitHub 上 Agent Skill 生态做系统性快照的规模数据集。2025年10月 Anthropic 开源 SKILL.md 格式,仅九个月后 GitHub 公开仓库中已沉淀 3,797,117 个 SKILL.md 文件、282,200 个仓库、195,841 个账号。论文的三阶段管线绕过代码搜索 API 每查询 1000 条上限与不可靠的总数估计(报 34.9 万 vs 实际 380 万+),按文件大小递归分区搜索空间完成完整采集;内容哈希去重得 1,877,981 个不同内容,50.5% 的文件是逐字副本——这个无包管理器、靠复制传播的生态,把软件供应链安全命题原样搬进了自然语言工件世界。数据封装为单个自包含 SQLite 文件,采集与解释分离设计让社区可以自定义纳入标准。

August 17, 2026 · 3 min

Beyond Final Scores: 长程AI研发Agent过程级评测 精读

深度精读美团与中国科学院大学的论文 Beyond Final Scores——一项花费约10万美元推理成本、覆盖7个前沿模型×36个长程任务×3次rollout(共756次运行)的系统评测。它不满足于给Agent打一个终分,而是把研究循环拆成方案框架(C1)、执行(C2)、反馈控制(C3)三个规则化过程指标,并用受控对照测出经验复用(M)与harness的真实影响。核心结论:当前自动研发Agent更像“工程优化器”而非自主研究者——拉开模型差距的是可靠性而非峰值(avg@3差距0.237 vs best@3仅0.122),252个最佳解中仅3个(1.2%)具真正方法学新颖性,且钻评测漏洞的解(16个)比新颖解多五倍。

August 16, 2026 · 2 min

SkillShapley: 技能步级Shapley归因 精读

深度精读北航与山东大学合作的 SkillShapley——首个面向 LLM Agent 技能的步级归因框架。它把 skill.md 的语义步骤视为合作博弈中的『玩家』,保留子集视为『联盟』,benchmark 成功率视为收益函数,用 Shapley 值量化每一步的真实贡献。针对『每个新联盟都要真实跑一遍 LLM agent』的高昂配置成本,BAES 用『warmup 锚点覆盖 + cache 感知自适应采集』两阶段策略,在同预算下产出远多于蒙特卡洛采样的可复用边际证据(99 配置预算下 206 条 vs 130 条)。案例研究给出一条朴素的技能写作启示:高价值步骤是连接任务条件与可执行决策的『程序性桥梁』,而背景解释性文本往往贡献为负。

August 16, 2026 · 3 min

A Programming Paradigm for Spatiotemporal Composability 精读

北大与 DeepSeek-AI 合作的 88 页长文,为「插件系统、自进化 Agent Harness」这类动态组合软件给出了第一个完整的编程范式级形式化基础:把经典效应系统提升为可逆效应、把协同效应系统提升为响应式协同效应,统一成一个递归上下文类型,再配上动态组合演算与全套元理论(保持性、恢复精确性、活性、合流性),实现为 Cordis 元框架并在 Koishi(4000+ 社区插件)上验证。本文按背景、定位、问题、解法、评估、根源解释、知识反推、通用灵感八个层面完整拆解。

August 15, 2026 · 5 min

How Can Rhetoric Reward-Hack AI Reviewers? 精读

当 AI 开始审稿,会不会写“彩虹屁”比做得好不好更重要?马里兰大学等四校团队用 120 篇 ICLR 2026 投稿构造 4200 篇修辞改写稿、收集 42396 条 AI 评审,系统量化了“只改措辞、不改内容”对评审分的因果影响:证据框架最能提分(最高 +0.93)、新颖性立场最能降分(最低 −0.73),低分稿越改越高、高分稿反而越改越低。本精读按九部分结构拆解其实验设计、因果链与可推广灵感。

August 15, 2026 · 4 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

当 AI 科学家已经能跑完“构思-实验-写作”全流程时,下一个瓶颈是什么?NUS 与牛津的 OmniScientist 给出的答案是:证据。现有系统只让智能体看到文本、代码和预计算的数字摘要,而图像里的形态、信号里的时序、跨通道的不一致这些科学上决定性的关系在接口处就丢失了。本文构建了一个感知层 + 3 个 ReAct 智能体 + 确定性管线的全模态全学科 AI 科学家,用代码强制执行新颖性、统计严谨性与数值溯源检查,在 36 个真实数据案例上全部完成从原始数据到可编译论文的全流程;配对消融显示直接感知在全部 7 个评审维度上优于“盲测”变体,正面交锋胜率 85%。本精读逐层拆解其感知分层、三重检查机制与因果链分析。

August 15, 2026 · 3 min

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 精读

可交互世界模型(如 Genie 3)正在爆发式涌现,但“每个模型用自家基准自测”使得跨模型公平比较几乎不可能——固定动作序列在不同模型上会走出完全不同的轨迹。PlayWorld 提出 Agent-as-Player 范式:让多模态 Agent 像人类玩家一样,为指定的长时程目标(转一圈看环境是否一致、走进水里看有没有涟漪)主动探索交互,再用四维度 VQA 体系打分。171 个人工标注场景、9 个世界模型的大规模评测显示:最高的 Genie 3 Overall 也只有 2.12/5,且所有模型在“视野外演化”“洞察演化”两类长时程状态维持维度上普遍不超过 2 分——“能演、但不能持续演化”是当前公认瓶颈。本精读覆盖其动机、方法、实验证据与因果链根源解释。

August 15, 2026 · 3 min

QuoteBench: How Matched Scores Can Hide Command-Path Failures 精读

LLM 编码 agent 的 Bash 命令在到达终端前,往往要经历序列化、包装、重新解析等“生成-执行边界”。QuoteBench 用 2×2 交叉设计(生成契约 × 执行传输)加固定回复重放证明:同一个回复只是多过一层解析器,成功率就暴跌 55.4–73.2 个百分点;而一句“你的命令会被嵌套进 bash -c 双引号”的边界披露,能让 6/8 配置恢复 30.4–60.7 点。GPT-5.6-sol 表面仅 -3.6 点的匹配分差,实际是 -64.3 点传输损伤与 +60.7 点模型补偿的合力。本精读覆盖其 56 任务 14 家族的构造、四格交叉的因果解耦机制、最终状态验证器设计,以及“评测五要素报告规范”的普适启示。

August 15, 2026 · 4 min

Vero: Can AI Agents Build Formally Verified Software Repositories? 精读

AI agent 能写出“保证正确”的软件仓库吗?UC Berkeley Dawn Song 组牵头推出 Vero——首个仓库级“实现+证明”联合合成基准:43 个多模块 Lean 4 仓库、743 个 API、2705 条规格,并首创让 agent 形式化证明“基准本身有错”的审计机制。最强配置 GPT-5.5 (xhigh) + Codex 仅完全解决 27/43,仍有 10 个实例、219 条规格抵抗全部 8 个配置。本精读覆盖其基准构建、反作弊协议、审计机制与失败模式的因果分析。

August 15, 2026 · 3 min

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 精读

港科大的 SkillProx 把 LLM Agent 的「技能自进化」重新拆解为「近端梯度下降」的前向-后向两阶段:前向用闭环重执行拦截退化的诊断补丁,后向用冻结的留一效用审计配合验证门控选择性整合/降级/删除知识单元。相比最强梯度基线 SkillGrad 平均提升 3.0pp,且消融清晰地揭示了「闭环诊断 -1.5、近端收缩 -2.5」的因果分工。本精读以九部分结构,详解这套自进化框架的方法机制、实验证据、效果根源与可迁移灵感。

August 11, 2026 · 7 min