SkillSeam: Six Principles for Auditing Agent Skill Collections 精读

一堆合格技能不等于一个可靠系统——技能在集合的’接缝’处失败:程序竞争注意力、别名重复加载、边界模糊。SkillSeam 提出六原则审计框架(持久梯度/系统连贯/机制门控/正交覆盖/触发流/粒度纪律),每条原则映射到失效机制→最强可观测信号→受控扰动测试。关键发现:破坏持久层级后 loaded-skill tokens +59.5% 而准确率不降——成本病在准确率病之前出现,准确率导向的评测对集合级架构债不敏感。本精读覆盖’按失效机制预测的信道评估’方法论与成本先行的预警价值。

September 16, 2026 · 2 min

Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science 精读

语言模型能产出看似合理的短证明,但在长程研究问题(不确定且相互依赖的决策序列)上不可靠——短证明能力与长程研究能力之间存在结构断层。Stellar Colosseum(CMU×Google Research)给出 model-agnostic 的多 Agent harness:策略探索后 readiness gate 决定何时分解、证明计划表示为 section 级相互依赖子问题、verifier 反馈路由回受影响部分;并行候选生成+定向证伪+重叠随机采样树聚合。已在数学与理论计算机科学问题上产出实际研究进展。本精读覆盖’长程=决策序列管理’的问题重构、readiness gate 的推理分配经济学与树聚合的抗噪声机制。

September 16, 2026 · 2 min

SWEADV × VLoc Bench:Agent 安全评测双警报 精读

两篇同日论文从攻防两端敲响 Agent 安全警钟。SWEADV(Columbia×GMU×York):750 对抗 issue 描述攻击 APR Agent——恶意描述诱导’功能正确但不安全’的修复,攻击成功率 48.5-54.0% 近基线双倍,且 LLM-judge 检测精度降 16.6%、guided prompt 仅 62.3% 精度。VLoc Bench(CMU×Cisco×Foundation AI×Yale):把安全评测从’能否检测/修复’前移到’能否定位’——500 真实漏洞 × 290 仓库 × 147 CWE,Claude 系因 500 任务 $600+ 评测成本缺席。本精读合并解读攻击面转移与任务前置化两条安全评测新轴线。

September 16, 2026 · 2 min

The Router Within: Eliciting Native Skill Routing from a Frozen LLM(Gavel)精读

部署的 harness 把所有 skill 元数据预加载进上下文(注意力稀释+库规模受限),检索管线把选择移出上下文但也移出了模型能力。Gavel 证明冻结 LLM 的前向传播已携带路由信号——两个线性映射(唯一被训练的参数)读出任务与各 skill 的 mid-layer 状态,对紧凑 per-skill bank 打分完成全库路由,skill 文本不进上下文。本精读覆盖’模型已隐式知道该用什么’的探针证据、线性读出的参数效率与路由内部化对库规模扩展的意义。

September 16, 2026 · 2 min

Using Agentic AI for Contextualized and Multifaceted Code Review at Ericsson 精读

AI 编码 Agent 让代码生产提速后,评审成为新瓶颈——但现有 LLM 评审方法缺乏项目特定上下文且少有工业验证。Ericsson 与 Blekinge 理工按 Design Science Research 流程合作:多智能体 + 项目特定上下文知识,跨可读性/可维护性等四维度识别代码变更反模式。200+ 识别问题全部由 Ericsson 开发者人工验证:96% 识别正确、69% 被评’重要’。本精读覆盖工业实证方法论(DSR)、项目上下文注入的机制与’开发者认可度’作为工业评审 Agent 的黄金指标。

September 16, 2026 · 2 min

When Agents Slow Down: Elo-per-token 分析与 Agent 测试时策略 精读

Agent 在测试时的’减速’行为——更多 token 换来多少真实能力提升?本文提出 Elo-per-token 度量:以独立采样为理论参照(Elo 随 log compute 线性增长),定义 scaling inflection point(边际 Elo 增益跌至参照线的每会话预算)。4 个通用 Agent × 4 个开放基准、单会话最高 1 亿 token 的实验给出反直觉发现:AtCoder Heuristic Contest 上 Agent 超越历史最强人类选手的超线性提升是持续学习的证据——减速之后仍有巨大 headroom。本精读覆盖测试时 scaling 的度量学、独立采样参照的设计逻辑与’持续学习 vs 收益递减’的分界证据。

September 16, 2026 · 2 min

AMDKernelVault: Large-Scale Datasets and Agentic Training for AMD GPU Kernel Optimization 精读

AMD 开源 HIP/Triton 内核优化语料与 agentic 训练框架:HIPKernelGen/TritonKernelGen 管线把 PyTorch 参考实现转为 HIP/Triton 内核、在 ROCm 下编译验证、上硬件延迟剖析——产出 62,153 个执行验证 HIP 内核 + 2,377 条 ROCm 库 QA + 39,893 个 Triton 内核。演示价值:Qwen3-8B 经 SFT+执行感知 RL 后在 PyTorch→HIP 达 34.0% Pass@1、TritonBench-G 33.2% Corr@3、ROCmBench 41.94% Corr@3——打破 CUDA/NVIDIA 中心主义的开放生态基建。

September 15, 2026 · 2 min

Beyond Top-k Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents 精读

Virginia Tech 提出 DSR:当技能注册表达到数万级,top-k 独立排序会返回功能冗余的技能集合浪费上下文预算。DSR 用行列式点过程(DPP)把路由从’排序问题’升维为’集合选择问题’,核心创新 query-residual 多样性核先扣除技能表示中与查询对齐的成分再算冗余——在 80K 技能池的 SkillRouter benchmark 上 recall 与 full coverage 双升,多技能查询增益最大。

September 15, 2026 · 2 min

COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization 精读

港中文深圳团队把 agent 技能优化重构为’动态候选空间上的预算受限序贯优化’:contextual bandit 优先级评分决定评估哪个候选(exploit 历史得分 + explore 不确定性),证据驱动的进化只做有界精炼不做全局重写。结果:6 个 benchmark × 3 模型平均提升 13.1/26.9/22.5pp,相对 SkillOpt 总成本砍 55-58%,每 benchmark 只用 50 个优化样本,且对 harness 更换鲁棒。

September 15, 2026 · 2 min

GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents 精读

Amazon 的评测效度清算之作:persona 驱动 LLM 用户模拟器 + LLM-as-judge 这道廉价’离线发布门禁’被 GAUGE 协议全面体检——盲评面板判’满意’的会话 57.5% 实际任务失败(ρ=−0.147);能力相近的强 agent 对比中门禁 31% 选出奖励更低的一方;满意度阈值放行失败率 48-60% 的 agent。结论:门禁’human-validated yet mis-anchored’(人觉得准但锚错了构念),并给出 calibrate-then-trust 补救节奏。附同日 TraceJudgeBench 对照:去偏 prompt 在压偏差的同时损坏分辨率。

September 15, 2026 · 2 min