Mo' Models, Mo' Problems × Co-Skill 精读:多智能体选型与边云技能演化双视角

两篇互补的 multi-agent 工程研究:NVIDIA×哥本哈根的 Mo’ Models 用 23 模型×3 科学基准证明 MAS 模型池’加模型常降性能’——oracle 潜力与实际达成存在鸿沟、同族池是唯一稳定正收益、准确模型解集高度嵌套(rM=0.931);哈工大的 Co-Skill 诊断边云 skill 演化的’盲通信’根因(上传 token 25-42% 是重复前缀),用前缀合并轨迹 trie+渐进 skill 树双向解盲,token 省 15.6-41.9%、成功率提升 25.8-76.4%。合读视角:多 agent 系统的两个新瓶颈——选谁进队(异构组合的聚合噪声)与怎么通信(协作双方的信息结构)。

September 17, 2026 · 2 min

OPEN-1B: A Fully Auditable Training Run 精读

开源 LLM 即使放出全部数据与配方,也因浮点非结合性无法逐位复现——你无法验证发布的 checkpoint 真是声明的配方训出来的。Gensyn 的 OPEN-1B 定义第四层透明度’完全可审计’:RepOps 跨硬件逐位复现算子(固定规约序、统一 FMA/次正规数约定、计数器式 RNG)、拓扑不变数据流(token 流=种子的纯函数)、确定性 butterfly all-reduce,多审计者各验若干步拼出全程、整跑收敛为单一哈希。代价是 MFU 从一个数量级掉到 5%——可验证性与速度的明码标价,以及首个该层级的开源 LLM 全套产物。

September 17, 2026 · 2 min

ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents 精读

ScienceBuddy 把’与研究者聊天’变成模型-线束双改进的燃料:研究者交互免费产出任务定义与评估 rubric,内层递归固定模型演化 harness(有界编辑+成对回归检查),外层递归固定 harness 做 rubric 奖励 GRPO——三周期后科学任务准确率 42.2%→73.3%,纯 harness 演化即可 +20pp(权重冻结),纯模型 RL 覆盖率 +19.5pp。Recursive-in-Recursive 范式为 RSI 提供了’两条改进通道各自可评估、互为条件’的工程化路径,并作为可下载的科研产品发布。

September 17, 2026 · 3 min

Spurious Tool Use: When RL Agents Learn the Wrong Reason to Act 精读

RL 训练的 agent 调用工具的理由可能是错的:UW+UCSD+Stanford 团队构造受控环境注入与工具强相关但因果无关的线索,发现反事实评估下伪工具调用率最高暴涨 +39.2%——而且捷径只在 agent 已可靠掌握该工具时形成(任务能力是捷径的前提)、语义对齐线索放大效应(对齐 +39.2% vs 交换 ≤3.5%)。反直觉结论:提升能力的 RL 同时放大捷径易感性,标准任务奖励不足以产生鲁棒工具策略;LLM 裁判的’工具必要性’密集奖励可有效压制且不损准确率。

September 17, 2026 · 2 min

State of Thought Enables Endogenous Reasoning 精读

测试时推理的现有范式要么给模型套外部推理程序(CoT/Plan-and-Solve),要么暴力扩展搜索(Self-Consistency/MCTS)——控制信号都是外生的。NTU 提出 State of Thought(SoT):从模型内部信息传递提取紧凑动力学-几何状态,582 参数控制器在冻结 backbone 上按当前推理状态选择性激活历史推理支持——推理变成’证据上的状态条件化过程’。16 数据集×3 LLM:量化/通用/符号代码/长上下文推理平均提升 1.34×/1.62×/1.76×/2.51×,同时 token −62.6%、延迟 −44.6%;training-free 与 embedding-only 设定下仍保留 38.2%/36.5% 增益,证明内生状态信号真实存在且可低成本利用。

September 17, 2026 · 2 min

从背调被拒到 65k Star:Archify 作者的开源自证之路

鱼皮直播对谈 Archify 作者橙子(网名「也无风雨也雾晴」):一个高中辍学打过零工、参军退伍、专升本第一名考入重庆邮电大学的开发者,两次在大厂背调环节因学历被拒后,靠开源项目 Archify——AI 生成可验证架构图的 Agent Skill——登顶 GitHub Trending,目前 6.5 万 Star。对谈展开的不仅是逆袭故事,还有 AI 编程时代的真实体感:注意力被稀释、Skill 内化进模型、极简 Harness 的 token 经济学,以及开源作为普通人「第二简历」的机制。

September 17, 2026 · 2 min

大脑归基模,小脑归自己:24 岁首席科学家王家伟的具身下注

GPT-6 Astra 直接驱动机械臂刷屏、‘基模降维打击具身’之说盛行的当口,深朴智能首席科学家王家伟(24 岁,少年班—MSRA—DeepSeek—Seed 路径)给出分层答案:大脑已收敛给基模,实时可控的动作模型与场景数据闭环仍是创业公司的自留地。本文梳理他的数据性价比账、zero-shot 泛化信号与具身评估真空里的噪音辨别,并给出可迁移的判断框架。

September 17, 2026 · 2 min

【每日AI前沿追踪】2026年09月16日 核心技术与产业动态速递

9月15日双主线:RSI 工程学成熟日——Dream-RSI 把发现历史变成重放模拟器、RSIAgent 让开源模型反超 GPT-6 Astra、ModularRSI 攻克 harness 演化泛化性、HarnessBandit 首解多 harness RL 调度;skill 工程进入系统学阶段——SkillSeam 六原则审计集合接缝、Gavel 从冻结模型前向读出路由信号。产业侧减速辩论全面政治化(特朗普当众否决+纳德拉备忘录+奥巴马表态),Atria Dawn 744B 开源、Salesforce×NVIDIA Koa、Mozilla 报告中国开源差距缩至 4.4 个月。

September 16, 2026 · 10 min

AlgoEvo × MOSCOPT × SkillLift:Skill 优化三部曲 精读

三篇同日论文从三个角度推进 skill 优化。AlgoEvo(港城大):把算法发现 agentic 化——design skill hub 解耦范式知识与发现引擎,三层经验库(经验卡/经验树/跨任务固化)组织搜索轨迹,6 任务匹配或超越专用方法且评估数与 token 大减。MOSCOPT:skill 池+gating skill 联合优化——EditAdam 双态维护+三阶段交错更新,免梯度单调改进,突破’单模板优化’的协同缺失。SkillLift:稀疏 oracle→稠密 rubric 双层优化——冻结 rubric 作廉价代理引导 skill 修订,解耦搜索与 oracle 成本。本精读合并解读 skill 优化的三条进化路径:知识组织、多技能协同、评估降本。

September 16, 2026 · 2 min

Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents 精读

临床 Agent 的’执行差距’:急诊整班次模拟(CES)中 Agent 多能给出正确诊断(4.39/5)却无法完整及时执行关键动作(2.94/5/3.34/5)——诊断对但病人死的结构性失败。Asclepius 三件套:换班间用 trace 反馈重写操作手册的自进化 harness、高风险规程外置的临床技能库、按病人队列隔离的三个子 Agent。held-out 批次上 critical-action correctness +22%(p=0.024)且诊断精度保持。本精读覆盖执行差距的三失效模式操作化与’操作手册级’harness 演化的医疗安全意义。

September 16, 2026 · 2 min