The Router Within: Eliciting Native Skill Routing from a Frozen LLM(Gavel)精读

部署的 harness 把所有 skill 元数据预加载进上下文(注意力稀释+库规模受限),检索管线把选择移出上下文但也移出了模型能力。Gavel 证明冻结 LLM 的前向传播已携带路由信号——两个线性映射(唯一被训练的参数)读出任务与各 skill 的 mid-layer 状态,对紧凑 per-skill bank 打分完成全库路由,skill 文本不进上下文。本精读覆盖’模型已隐式知道该用什么’的探针证据、线性读出的参数效率与路由内部化对库规模扩展的意义。

September 16, 2026 · 2 min

Thought without systematicity? Evaluating Reasoning Models on Rule Induction Tasks 精读

人类认知的核心特征 systematicity(系统性)——理解一个概念蕴含理解其变体。推理模型具备吗?普林斯顿(Brenden Lake 组)用规则归纳任务的同构变体(重组/替换)测试:能正确解决原任务的模型,常在同构变体上失败——表面正确掩盖了系统性缺失。这一发现对’benchmark 分数=认知能力’的解读划出硬边界:模型可能记住了解法而非掌握规则。本精读覆盖同构变体方法学、系统性缺失的证据结构与对推理评测的连锁含义。

September 16, 2026 · 1 min

Using Agentic AI for Contextualized and Multifaceted Code Review at Ericsson 精读

AI 编码 Agent 让代码生产提速后,评审成为新瓶颈——但现有 LLM 评审方法缺乏项目特定上下文且少有工业验证。Ericsson 与 Blekinge 理工按 Design Science Research 流程合作:多智能体 + 项目特定上下文知识,跨可读性/可维护性等四维度识别代码变更反模式。200+ 识别问题全部由 Ericsson 开发者人工验证:96% 识别正确、69% 被评’重要’。本精读覆盖工业实证方法论(DSR)、项目上下文注入的机制与’开发者认可度’作为工业评审 Agent 的黄金指标。

September 16, 2026 · 2 min

When Agents Slow Down: Elo-per-token 分析与 Agent 测试时策略 精读

Agent 在测试时的’减速’行为——更多 token 换来多少真实能力提升?本文提出 Elo-per-token 度量:以独立采样为理论参照(Elo 随 log compute 线性增长),定义 scaling inflection point(边际 Elo 增益跌至参照线的每会话预算)。4 个通用 Agent × 4 个开放基准、单会话最高 1 亿 token 的实验给出反直觉发现:AtCoder Heuristic Contest 上 Agent 超越历史最强人类选手的超线性提升是持续学习的证据——减速之后仍有巨大 headroom。本精读覆盖测试时 scaling 的度量学、独立采样参照的设计逻辑与’持续学习 vs 收益递减’的分界证据。

September 16, 2026 · 2 min

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 精读

ZGCM-1 技术报告解读:中关村人工智能研究院 + DeepSeek-AI 系作者的全开放高效基座——7B-8B 级 14 个推理基准平均第一(AIME 2026 = 75.0%、MATH-500 = 97.1%、HMMT 2025 = 70.4%),Agentic Search 与大数量级前沿模型竞争。配方亮点:混合 RL + Agent-SFT(verifier-successful 15,748 轨迹子集)与 AI-Native R&D——用 30B token 代理模型做混合物搜索,把配方探索成本降一个量级后再全量训练。本精读按’开放配方’口径解读其训练经济学与开放科学价值。

September 16, 2026 · 1 min

AMDKernelVault: Large-Scale Datasets and Agentic Training for AMD GPU Kernel Optimization 精读

AMD 开源 HIP/Triton 内核优化语料与 agentic 训练框架:HIPKernelGen/TritonKernelGen 管线把 PyTorch 参考实现转为 HIP/Triton 内核、在 ROCm 下编译验证、上硬件延迟剖析——产出 62,153 个执行验证 HIP 内核 + 2,377 条 ROCm 库 QA + 39,893 个 Triton 内核。演示价值:Qwen3-8B 经 SFT+执行感知 RL 后在 PyTorch→HIP 达 34.0% Pass@1、TritonBench-G 33.2% Corr@3、ROCmBench 41.94% Corr@3——打破 CUDA/NVIDIA 中心主义的开放生态基建。

September 15, 2026 · 2 min

Beyond Top-k Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents 精读

Virginia Tech 提出 DSR:当技能注册表达到数万级,top-k 独立排序会返回功能冗余的技能集合浪费上下文预算。DSR 用行列式点过程(DPP)把路由从’排序问题’升维为’集合选择问题’,核心创新 query-residual 多样性核先扣除技能表示中与查询对齐的成分再算冗余——在 80K 技能池的 SkillRouter benchmark 上 recall 与 full coverage 双升,多技能查询增益最大。

September 15, 2026 · 2 min

COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization 精读

港中文深圳团队把 agent 技能优化重构为’动态候选空间上的预算受限序贯优化’:contextual bandit 优先级评分决定评估哪个候选(exploit 历史得分 + explore 不确定性),证据驱动的进化只做有界精炼不做全局重写。结果:6 个 benchmark × 3 模型平均提升 13.1/26.9/22.5pp,相对 SkillOpt 总成本砍 55-58%,每 benchmark 只用 50 个优化样本,且对 harness 更换鲁棒。

September 15, 2026 · 2 min

DataFlex-RL: An Evaluation Platform for RLVR Data Policies 精读

北大×UCAS 等机构的 RLVR 数据政策评测平台:13 配置 × 12 匹配种子 × Qwen2.5-7B 在 12 个数学/逻辑/科学 benchmark 上的受控对比发现——均匀 GRPO 已提升 7.76 分后,无任何选择/重加权方法的配对 95% CI 排除零;三种自适应混合均不优于固定等权。更警醒的是评测敏感性:math-heavy 摘要与均衡摘要的排名负相关(ρ=−0.33)。‘数据工程很重要’的流行叙事在受控条件下未被支持。

September 15, 2026 · 1 min

EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning 精读

复旦大学针对开放 RL 的奖励系统自进化框架 EvoRS:rubric 奖励与 policy 构成动态反馈回路——policy 优化当前奖励时,初始有用的奖励系统会因 reward hacking 或区分度退化而失效。EvoRS 把奖励系统表示为可执行 Reward-DAG,agentic designer 从 on-policy rollout 与奖励轨迹更新它。写作/角色扮演任务上三种 judge 下质量最佳,超固定奖励 policy 2.107/4.767 分,reward hacking 与覆盖失败双降。

September 15, 2026 · 2 min