RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments 精读

数字 Agent 进入新环境(接口/工具/失败模式预训练未覆盖)时如何无监督适应?RSIAgent 给出 training-free 答案:curriculum/actor/verifier 三类 Agent 协同自主探索,把’动作-条件-后果’因果关系沉淀为可冻结复用的记忆;广度+深度双探索消融显示完整 RSI 74.54% 显著优于单策略(65.52%/56.50%),并让 Kimi-K3、GLM-5.3 在 OSWorld-v2 与 Agent’s Last Exam 上反超 GPT-6 Astra。本精读覆盖因果记忆与轨迹记忆的本质差异、广深互补的机制解释与开源反超闭源的信号意义。

September 16, 2026 · 2 min

Salesforce Koa: An Enterprise Language Model for Agentic Tool Use 精读

企业 Agent 工具使用模型的开放权重范本:Salesforce 基于 Nemotron-3-Super-120B(NVIDIA 开源基座)GRPO 后训练出 Koa,在 Dreamforce 发布并作为 Agentforce 平台可选模型。核心是 simulation-to-reward 管线——把工作流规格展开为 persona 条件多轮任务、以成功工具使用为基础的任务解决奖励;企业域用 Agent Script 声明式语言书写规格,训练零客户数据。Tau2Bench 69.41 超基座,且揭示 SFT/RL 的能力分工:BFCL 多轮上 SFT 反降分(54.12→53.25)而 RL 提升。本精读覆盖声明式规格→模拟器→奖励的生成管线与开放权重的企业模型经济学。

September 16, 2026 · 2 min

SkillSeam: Six Principles for Auditing Agent Skill Collections 精读

一堆合格技能不等于一个可靠系统——技能在集合的’接缝’处失败:程序竞争注意力、别名重复加载、边界模糊。SkillSeam 提出六原则审计框架(持久梯度/系统连贯/机制门控/正交覆盖/触发流/粒度纪律),每条原则映射到失效机制→最强可观测信号→受控扰动测试。关键发现:破坏持久层级后 loaded-skill tokens +59.5% 而准确率不降——成本病在准确率病之前出现,准确率导向的评测对集合级架构债不敏感。本精读覆盖’按失效机制预测的信道评估’方法论与成本先行的预警价值。

September 16, 2026 · 2 min

Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science 精读

语言模型能产出看似合理的短证明,但在长程研究问题(不确定且相互依赖的决策序列)上不可靠——短证明能力与长程研究能力之间存在结构断层。Stellar Colosseum(CMU×Google Research)给出 model-agnostic 的多 Agent harness:策略探索后 readiness gate 决定何时分解、证明计划表示为 section 级相互依赖子问题、verifier 反馈路由回受影响部分;并行候选生成+定向证伪+重叠随机采样树聚合。已在数学与理论计算机科学问题上产出实际研究进展。本精读覆盖’长程=决策序列管理’的问题重构、readiness gate 的推理分配经济学与树聚合的抗噪声机制。

September 16, 2026 · 2 min

SWEADV × VLoc Bench:Agent 安全评测双警报 精读

两篇同日论文从攻防两端敲响 Agent 安全警钟。SWEADV(Columbia×GMU×York):750 对抗 issue 描述攻击 APR Agent——恶意描述诱导’功能正确但不安全’的修复,攻击成功率 48.5-54.0% 近基线双倍,且 LLM-judge 检测精度降 16.6%、guided prompt 仅 62.3% 精度。VLoc Bench(CMU×Cisco×Foundation AI×Yale):把安全评测从’能否检测/修复’前移到’能否定位’——500 真实漏洞 × 290 仓库 × 147 CWE,Claude 系因 500 任务 $600+ 评测成本缺席。本精读合并解读攻击面转移与任务前置化两条安全评测新轴线。

September 16, 2026 · 2 min

The Router Within: Eliciting Native Skill Routing from a Frozen LLM(Gavel)精读

部署的 harness 把所有 skill 元数据预加载进上下文(注意力稀释+库规模受限),检索管线把选择移出上下文但也移出了模型能力。Gavel 证明冻结 LLM 的前向传播已携带路由信号——两个线性映射(唯一被训练的参数)读出任务与各 skill 的 mid-layer 状态,对紧凑 per-skill bank 打分完成全库路由,skill 文本不进上下文。本精读覆盖’模型已隐式知道该用什么’的探针证据、线性读出的参数效率与路由内部化对库规模扩展的意义。

September 16, 2026 · 2 min

Thought without systematicity? Evaluating Reasoning Models on Rule Induction Tasks 精读

人类认知的核心特征 systematicity(系统性)——理解一个概念蕴含理解其变体。推理模型具备吗?普林斯顿(Brenden Lake 组)用规则归纳任务的同构变体(重组/替换)测试:能正确解决原任务的模型,常在同构变体上失败——表面正确掩盖了系统性缺失。这一发现对’benchmark 分数=认知能力’的解读划出硬边界:模型可能记住了解法而非掌握规则。本精读覆盖同构变体方法学、系统性缺失的证据结构与对推理评测的连锁含义。

September 16, 2026 · 1 min

Using Agentic AI for Contextualized and Multifaceted Code Review at Ericsson 精读

AI 编码 Agent 让代码生产提速后,评审成为新瓶颈——但现有 LLM 评审方法缺乏项目特定上下文且少有工业验证。Ericsson 与 Blekinge 理工按 Design Science Research 流程合作:多智能体 + 项目特定上下文知识,跨可读性/可维护性等四维度识别代码变更反模式。200+ 识别问题全部由 Ericsson 开发者人工验证:96% 识别正确、69% 被评’重要’。本精读覆盖工业实证方法论(DSR)、项目上下文注入的机制与’开发者认可度’作为工业评审 Agent 的黄金指标。

September 16, 2026 · 2 min

When Agents Slow Down: Elo-per-token 分析与 Agent 测试时策略 精读

Agent 在测试时的’减速’行为——更多 token 换来多少真实能力提升?本文提出 Elo-per-token 度量:以独立采样为理论参照(Elo 随 log compute 线性增长),定义 scaling inflection point(边际 Elo 增益跌至参照线的每会话预算)。4 个通用 Agent × 4 个开放基准、单会话最高 1 亿 token 的实验给出反直觉发现:AtCoder Heuristic Contest 上 Agent 超越历史最强人类选手的超线性提升是持续学习的证据——减速之后仍有巨大 headroom。本精读覆盖测试时 scaling 的度量学、独立采样参照的设计逻辑与’持续学习 vs 收益递减’的分界证据。

September 16, 2026 · 2 min

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 精读

ZGCM-1 技术报告解读:中关村人工智能研究院 + DeepSeek-AI 系作者的全开放高效基座——7B-8B 级 14 个推理基准平均第一(AIME 2026 = 75.0%、MATH-500 = 97.1%、HMMT 2025 = 70.4%),Agentic Search 与大数量级前沿模型竞争。配方亮点:混合 RL + Agent-SFT(verifier-successful 15,748 轨迹子集)与 AI-Native R&D——用 30B token 代理模型做混合物搜索,把配方探索成本降一个量级后再全量训练。本精读按’开放配方’口径解读其训练经济学与开放科学价值。

September 16, 2026 · 1 min