Encoder-Free Scaling Laws × UMM-Reflection:统一多模态模型的架构与反思双问 精读

本精读合并解读两篇直指「统一多模态模型」根本问题的论文:腾讯 + CASIA + UCAS 的 Encoder-Free Scaling Laws 用两条架构共享同一 11 级稀疏 MoE 解码器阶梯(1.1B–44B 总参)与同数据同优化设置的受控对比,首次给出 encoder-free 与 encoder-based MLLM 的双向 scaling law——文本目标两架构前沿几乎重叠(γ 0.0973 vs 0.0979),多模态目标 encoder-free 当前更差但下降更快(γ 0.3778 vs 0.2998),外推交叉点 6.1×10²¹ FLOPs(比旗舰模型预训练算力低约三个数量级),分主题 STEM 最早追平、OCR/Caption 最晚,配注意力质量(0.217→0.645)+ 表征余弦 + 专家路由三层机制探针解释「视觉 token 先慢后骤降」的学习动力学;NTU + 上海交大 + 东京大学的 UMM-Reflection 则是首个对统一模型完整多轮反思轨迹做 RL 的工作——共享根采样(K=16 兄弟轨迹共用一张 detach 初始图,组优势只比反思策略不比首抽运气)+ 整轨迹单一优势同时更新文本头与流头,GenEval 从 0.71 升至 0.84(超 SFT +12.05 点)、条件修复率 20.59%→64.94% 翻三倍,换指令实验(48.4% vs 20.5%)与线性探针(AUC 0.804→0.815 几乎不动、失败图落入 pass 区 34%→62%)证明 RL 是在骨干已有修复分布中「选对的切片」而非创造新能力。一篇回答预训练的结构问题(要不要视觉编码器),一篇回答后训练的能力问题(会不会自我反思),合成统一模型路线的完整纵切面。

September 30, 2026 · 6 min

编码智能体规划、信任原生 Agent OS 与开源后训练配方:三篇系统论文精读

本篇合并精读三篇系统方向论文。其一《Coding Agents for Generalized TAMP》:现成编码智能体在 28 个环境、98,000 次评估回合中合成可跨实例泛化的程序化策略,平均成功率反超手工 TAMP planner(95%/82% vs 47%),决策速度毫秒级,为具身规划给出「合成时搜索、测试时零 LLM」的新范式。其二《AgentKernel》:提出首个以安全为第一设计约束的智能体操作系统,用身份、感知、认知、执行四支柱加 eBPF 强制执行与污点格传播,把「能否信任智能体」改写为「能否约束智能体」。其三《Rufus-Air》:Amazon 在公开 GLM-4.5-Air-Base 上给出 8 阶段全开源后训练配方,9.01M 样本 SFT 加多阶段 RL,IFBench 76.9 对官方 33.6,并沉淀出「SFT 是能力构建、难度过滤即课程、奖励可靠性定序、基础设施是配方一部分」四条可迁移结论。

September 26, 2026 · 8 min

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression 精读

DeepSeek-V4.1-Flash 用三件武器把长上下文智能体的部署成本打下来:CED 非对称架构让 prefill 只激活 8B 参数(decode 16B),CSA2 跨层 KV 复用 + FP4 量化把全局 KV 缓存压到 890 字节/token(较 V1 降 437 倍),SWA Bounded Replay 把持久化缓存再压到 1/8。在 Codeforces 3348→3471、DeepSWE v1.1 达 74.2% 的同时,45T token 多模态预训练完全开源。本文拆解其架构因果链与’智能体负载第一性’的设计哲学。

September 19, 2026 · 3 min

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence 精读

Stable AI 与清华大学联合发布 LimiX-2,用「上下文机制网络(CMN)」范式重新定义表格基础模型:预训练目标从 PFN 的『预测指定标签列』改为 CCMM 的『对任意掩码列做联合分布建模』,让每个样本内所有列都成为监督源。在 TabArena 上以 Elo 1935 领先第二名 TabFM+ 117 分、参数量却只有对方四分之一,还意外获得了因果骨架恢复能力。本精读拆解其『从预测标签到建模机制』的范式转移、SCM 合成数据引擎设计,以及这一思路对结构化数据智能的普适意义。

September 18, 2026 · 3 min

SSD-LLaMA 精读:单张 RTX 5090 跑万亿参数 MoE 的 SSD 原生推理系统

港科大联合中科院深圳先进院、南科大发布 SSD-LLaMA:面向万亿参数 MoE 的 SSD 原生本地推理系统——SSD I/O 流水线优化专家投递、SSD-RAM-VRAM 三层存储动态驻留、CPU-GPU 均衡混合执行,保证每个选中专家无剪枝无替换。三大前沿 MoE 家族上 prefill 提速 1.52–4.19×、decode 提速 2.10–15.58×,单张 RTX 5090+32GB RAM 实现万亿模型 >1 token/s。本精读拆解『把带宽受限问题转化为层次调度问题』的系统设计。

September 18, 2026 · 2 min

OPEN-1B: A Fully Auditable Training Run 精读

开源 LLM 即使放出全部数据与配方,也因浮点非结合性无法逐位复现——你无法验证发布的 checkpoint 真是声明的配方训出来的。Gensyn 的 OPEN-1B 定义第四层透明度’完全可审计’:RepOps 跨硬件逐位复现算子(固定规约序、统一 FMA/次正规数约定、计数器式 RNG)、拓扑不变数据流(token 流=种子的纯函数)、确定性 butterfly all-reduce,多审计者各验若干步拼出全程、整跑收敛为单一哈希。代价是 MFU 从一个数量级掉到 5%——可验证性与速度的明码标价,以及首个该层级的开源 LLM 全套产物。

September 17, 2026 · 2 min

Atria Dawn: The Dawn of Agentic Superintelligence 精读

上海人工智能实验室发布 744B MoE 开源 Agent 基座 Atria Dawn Preview:以 Verifiable Experience Pipeline 把训练信号锚定在可执行环境与外部可验证结果上,16 基准中 5 个登顶(Terminal-Bench 2.1 = 90.2、SWE-bench Pro = 74.7);更独特的是把自身 769 条任务记录的 R&D 过程作为人机协作案例研究——1/3 任务被人类评为无 AI 不可行。本精读覆盖可验证经验管线的设计逻辑、五榜登顶的机制根源、以及模型报告与 HAI 研究双重身份的方法论价值。

September 16, 2026 · 2 min

Salesforce Koa: An Enterprise Language Model for Agentic Tool Use 精读

企业 Agent 工具使用模型的开放权重范本:Salesforce 基于 Nemotron-3-Super-120B(NVIDIA 开源基座)GRPO 后训练出 Koa,在 Dreamforce 发布并作为 Agentforce 平台可选模型。核心是 simulation-to-reward 管线——把工作流规格展开为 persona 条件多轮任务、以成功工具使用为基础的任务解决奖励;企业域用 Agent Script 声明式语言书写规格,训练零客户数据。Tau2Bench 69.41 超基座,且揭示 SFT/RL 的能力分工:BFCL 多轮上 SFT 反降分(54.12→53.25)而 RL 提升。本精读覆盖声明式规格→模拟器→奖励的生成管线与开放权重的企业模型经济学。

September 16, 2026 · 2 min

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 精读

ZGCM-1 技术报告解读:中关村人工智能研究院 + DeepSeek-AI 系作者的全开放高效基座——7B-8B 级 14 个推理基准平均第一(AIME 2026 = 75.0%、MATH-500 = 97.1%、HMMT 2025 = 70.4%),Agentic Search 与大数量级前沿模型竞争。配方亮点:混合 RL + Agent-SFT(verifier-successful 15,748 轨迹子集)与 AI-Native R&D——用 30B token 代理模型做混合物搜索,把配方探索成本降一个量级后再全量训练。本精读按’开放配方’口径解读其训练经济学与开放科学价值。

September 16, 2026 · 1 min

Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work 精读

Accio-Lab 的开放 35B-A3B co-work 模型技术报告:基于 Qwen3.6-35B-A3B 再训练,核心主张是成本效率路线——日常 co-work 的多数步骤(状态追踪/协调/恢复/跟进)不需要前沿级推理,执行接地的数据与环境(可重放长时程轨迹+多 harness 采集)+ 分阶段后训练,在 12 个 benchmark 四能力域上做到同规模最强、部分任务比肩 GPT-5.6 Sol 级大模型,价格协议明示的性价比优势。

September 15, 2026 · 2 min