SkillSeam: Six Principles for Auditing Agent Skill Collections 精读

一堆合格技能不等于一个可靠系统——技能在集合的’接缝’处失败:程序竞争注意力、别名重复加载、边界模糊。SkillSeam 提出六原则审计框架(持久梯度/系统连贯/机制门控/正交覆盖/触发流/粒度纪律),每条原则映射到失效机制→最强可观测信号→受控扰动测试。关键发现:破坏持久层级后 loaded-skill tokens +59.5% 而准确率不降——成本病在准确率病之前出现,准确率导向的评测对集合级架构债不敏感。本精读覆盖’按失效机制预测的信道评估’方法论与成本先行的预警价值。

September 16, 2026 · 2 min

Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science 精读

语言模型能产出看似合理的短证明,但在长程研究问题(不确定且相互依赖的决策序列)上不可靠——短证明能力与长程研究能力之间存在结构断层。Stellar Colosseum(CMU×Google Research)给出 model-agnostic 的多 Agent harness:策略探索后 readiness gate 决定何时分解、证明计划表示为 section 级相互依赖子问题、verifier 反馈路由回受影响部分;并行候选生成+定向证伪+重叠随机采样树聚合。已在数学与理论计算机科学问题上产出实际研究进展。本精读覆盖’长程=决策序列管理’的问题重构、readiness gate 的推理分配经济学与树聚合的抗噪声机制。

September 16, 2026 · 2 min

SWEADV × VLoc Bench:Agent 安全评测双警报 精读

两篇同日论文从攻防两端敲响 Agent 安全警钟。SWEADV(Columbia×GMU×York):750 对抗 issue 描述攻击 APR Agent——恶意描述诱导’功能正确但不安全’的修复,攻击成功率 48.5-54.0% 近基线双倍,且 LLM-judge 检测精度降 16.6%、guided prompt 仅 62.3% 精度。VLoc Bench(CMU×Cisco×Foundation AI×Yale):把安全评测从’能否检测/修复’前移到’能否定位’——500 真实漏洞 × 290 仓库 × 147 CWE,Claude 系因 500 任务 $600+ 评测成本缺席。本精读合并解读攻击面转移与任务前置化两条安全评测新轴线。

September 16, 2026 · 2 min

The Router Within: Eliciting Native Skill Routing from a Frozen LLM(Gavel)精读

部署的 harness 把所有 skill 元数据预加载进上下文(注意力稀释+库规模受限),检索管线把选择移出上下文但也移出了模型能力。Gavel 证明冻结 LLM 的前向传播已携带路由信号——两个线性映射(唯一被训练的参数)读出任务与各 skill 的 mid-layer 状态,对紧凑 per-skill bank 打分完成全库路由,skill 文本不进上下文。本精读覆盖’模型已隐式知道该用什么’的探针证据、线性读出的参数效率与路由内部化对库规模扩展的意义。

September 16, 2026 · 2 min

Thought without systematicity? Evaluating Reasoning Models on Rule Induction Tasks 精读

人类认知的核心特征 systematicity(系统性)——理解一个概念蕴含理解其变体。推理模型具备吗?普林斯顿(Brenden Lake 组)用规则归纳任务的同构变体(重组/替换)测试:能正确解决原任务的模型,常在同构变体上失败——表面正确掩盖了系统性缺失。这一发现对’benchmark 分数=认知能力’的解读划出硬边界:模型可能记住了解法而非掌握规则。本精读覆盖同构变体方法学、系统性缺失的证据结构与对推理评测的连锁含义。

September 16, 2026 · 1 min

Using Agentic AI for Contextualized and Multifaceted Code Review at Ericsson 精读

AI 编码 Agent 让代码生产提速后,评审成为新瓶颈——但现有 LLM 评审方法缺乏项目特定上下文且少有工业验证。Ericsson 与 Blekinge 理工按 Design Science Research 流程合作:多智能体 + 项目特定上下文知识,跨可读性/可维护性等四维度识别代码变更反模式。200+ 识别问题全部由 Ericsson 开发者人工验证:96% 识别正确、69% 被评’重要’。本精读覆盖工业实证方法论(DSR)、项目上下文注入的机制与’开发者认可度’作为工业评审 Agent 的黄金指标。

September 16, 2026 · 2 min

When Agents Slow Down: Elo-per-token 分析与 Agent 测试时策略 精读

Agent 在测试时的’减速’行为——更多 token 换来多少真实能力提升?本文提出 Elo-per-token 度量:以独立采样为理论参照(Elo 随 log compute 线性增长),定义 scaling inflection point(边际 Elo 增益跌至参照线的每会话预算)。4 个通用 Agent × 4 个开放基准、单会话最高 1 亿 token 的实验给出反直觉发现:AtCoder Heuristic Contest 上 Agent 超越历史最强人类选手的超线性提升是持续学习的证据——减速之后仍有巨大 headroom。本精读覆盖测试时 scaling 的度量学、独立采样参照的设计逻辑与’持续学习 vs 收益递减’的分界证据。

September 16, 2026 · 2 min

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 精读

ZGCM-1 技术报告解读:中关村人工智能研究院 + DeepSeek-AI 系作者的全开放高效基座——7B-8B 级 14 个推理基准平均第一(AIME 2026 = 75.0%、MATH-500 = 97.1%、HMMT 2025 = 70.4%),Agentic Search 与大数量级前沿模型竞争。配方亮点:混合 RL + Agent-SFT(verifier-successful 15,748 轨迹子集)与 AI-Native R&D——用 30B token 代理模型做混合物搜索,把配方探索成本降一个量级后再全量训练。本精读按’开放配方’口径解读其训练经济学与开放科学价值。

September 16, 2026 · 1 min

推理芯片之战:带宽成为新算力,Groq、Cerebras 与 OpenAI 的三条路线与 Bill Dally 的 location 哲学

推理的瓶颈正在从算力转向带宽:每生成一个 token,都要把整个模型从存储介质读一遍。硅谷101本期请到两位正在做推理芯片创业的嘉宾——Bill Dally 的博士生 Mark 与前亚马逊 Annapurna 芯片软件栈科学家子阳,拆解 Groq 的静态调度、Cerebras 的晶圆级集成与 OpenAI Jalapeño 的 HBM4 通用路线为何是不同约束条件下的各自最优解,为什么中国关心 tokens per dollar 而美国关心 tokens per watt,以及推理速度如何决定模型智能的上限。

September 16, 2026 · 3 min

观众看不懂,就是我失败——易中天×闲木鱼,相隔五十年的历史创作者对谈

79岁的易中天与1997年生的B站UP主一条闲木鱼在《问道无余说》第一期对谈三小时:从’独立人格是心中的破房子’讲到坚决反对动机论、把最多的同情给汉献帝刘协,再到复盘《三国的星空》的失利——‘观众看不懂,就是我失败’。两位相隔五十年的创作者还交换了关于’老登’、流量算术与创作状态的答案。

September 16, 2026 · 1 min