Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents 精读

这篇来自华为与华中科技大学的 empirical study 首次系统地把 LLM Agent 的失败归因到「被加载的 Skill」上。作者借鉴差分测试思想,构建配对执行(有 Skill vs 无 Skill / 语义匹配 Skill),在 SkillsBench 与 SWE-Skills-Bench 上确认了 307 个技能诱导失败(125 功能失败 + 182 效率回归),并开发分类法驱动的 SkillTriage 归因工具。最反直觉的发现:看似相关的 Skill 比不相关 Skill 更有害——它让 Agent 错误实现或漏掉任务必需元素;效率回归的最大来源不是提示长度,而是「过度程序」(过度验证 67 例、重实现管道 30 例)。

August 12, 2026 · 7 min

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses 精读

Salesforce AI Research 联合 Notre Dame、UIUC(Heng Ji)提出强到弱推理时脚手架(Strong-to-Weak Scaffolding):用强 builder 模型为弱 target 模型自动构建推理时 harness,无需任何参数更新即可在四个 Theory-of-Mind 基准(3900 项)上将 GPT-5.4-mini 从 0.488 提升到 0.912(+0.423)。机制分析表明增益主要来自把不稳定的自然语言推理卸载为确定性代码(r=0.72),而非更长推理链或更多采样。这是对传统训练时蒸馏的一条互补路线,也直接印证了 harness 工程作为独立工程对象的价值。

August 12, 2026 · 9 min

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI 精读

Bang Liu 团队 38 页范式论文,提出继 Digital Agents(数字状态)和 Embodied Agents(物理状态)之后的第三种 Agentic AI 行动基底——Combodied Agents(以人的演化状态为核心)。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架,并把’保留并增强人类 agency’首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。

August 12, 2026 · 6 min

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents 精读

ByteDance Seed 团队提出的 Harness-IF 把「编程 Agent 是否真的在遵守指令」这件事第一次变成了可量化、可归因的规则级测量问题。它构造了 642 条原子规则的库,实例化出 60 个多轮编程任务,在 5 个可配置的「指令表面」(系统提示/工具描述/技能描述/项目文件/用户指令)上分别打分;更重要的是,它用 Against-Prior Accuracy(AP-Acc)把「模型本来就是这么做」的巧合从「真正遵从指令」中剥离出来——12 个前沿模型无一例外都在反先验规则上表现更差,平均落差 5.81 分。配套的 E0 冲突实验还揭示了一个反直觉结论:表面优先级并不服从提示深度,SP/PF/UI 同居首位,而工具描述和技能描述垫底。这篇精读从背景、定位、问题、解法、证据、根源、知识反推到通用灵感,完整拆解这项与 Harness 评估方向高度相关的工作。

August 12, 2026 · 9 min

SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure 精读

深度精读阿里+浙大+杜克联合提出的 SkillZip——首个无需任务回放(evaluation-free)的 Agent 技能压缩方法。它把’自进化积累的技能’视为一份带类型签名的契约,用’解释一次,引用多次’的直觉统一了规则共享、作用域提升、工作流复用与例外编码,形式化为一个带硬覆盖约束的类型化最小描述长度(MDL)目标。实验显示:平均压缩 31.2%,性能甚至略超未压缩技能,压缩速度比最强基线 SkillReducer 快 3.5 倍,且零次任务 rollout。

August 12, 2026 · 6 min

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning 精读

深度精读 Pathway 公司的 BDH-CQ(Dragon Hatchling 架构家族)——一种用 150M 参数挑战 ARC-AGI-1 的后 Transformer 序列模型。它抛弃了主流大模型’生成自然语言思维链’的推理范式,转而在高维潜在空间中迭代计算 R 次,把每次推理成本压到 0.85 GPU-秒、约 0.0007 美元,却能在 ARC-AGI-1 公共集上拿下 29.5% pass@2,比 GPT-5.6 Luna(Low) 便宜约 57 倍。本文用通俗类比讲透’潜在推理’、‘循环记忆’与’低秩通信’的本质,并解释为什么这套结构在’抽象推理流体智力’基准上能弯道超车大它三个数量级的模型。

August 11, 2026 · 9 min

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读

当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。

August 11, 2026 · 9 min

Stealing Reasoning Traces from Proprietary LLM APIs 精读

深度精读 arXiv:2608.09867——主流 LLM 提供商隐藏的加密推理块被全面击穿。论文发现加密块在跨会话、跨用户、跨模型间完全可互换,攻击者可借弱模型之手解码强模型加密推理,绕过反蒸馏机制;从 31 万公开推理块中恢复出 367 条 PII 和 182 条凭证,并可实现不可见提示注入。负责任披露后提出加密层与系统层双重缓解方案。

August 11, 2026 · 6 min

「模型能力已经够了,要卷就卷 Infra」|对话戴冠兰:从 Cloudflare 到 Runta,为十亿个 Agent 造执行底座

Runta 创始人戴冠兰(前 Cloudflare/Kong 核心)在十字路口播客中提出核心判断:模型能力爬坡已放缓,真正制约 Agent 落地的是执行层基础设施。Runta 刚完成 2000 万美元种子轮(a16z 领投,Jeff Dean、李飞飞天使),定位是为 Agent 打造确定性执行底座——在概率性大模型之上加入隔离、权限、审计和热迁移等系统能力,让企业敢于把生产权限交给智能体。文章梳理了 Token Maximizing 到 Minimizing 的反转、Agent 安全必然爆发的逻辑、以及公有云和基模厂商为何难以抢占这一赛道。

August 10, 2026 · 2 min

特修斯之船:Kimi K3如何把Transformer的零件全部换掉,还能逼近前沿

月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。

August 6, 2026 · 1 min