Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 精读

Transformer的知识(FFN)与推理(Self-Attention)逐层绑定,模型只能靠冗长CoT弥补深层知识无法回传浅层的缺陷。上海AI Lab提出Mobius架构:全局共享的Memory(FFN知识向量库)+多个Reasoner(Self-Attention)以隐状态为载体反复查询知识库,原生获得反向残差连接与动态隐推理两大能力。7B从零训练以62.6%数据达到Transformer同等MMLU(1.6倍数据效率),Intern-S2-Mobius-35B持续预训练后MMLU Pro 89.05超Qwen3.5的85.31,端到端推理加速近4倍、输出token缩短1.2–5倍。本文拆解其知识-推理解耦机制、两大原生能力的因果链,并展望自进化、世界模型与软硬件协同四个延伸方向。

August 18, 2026 · 1 min

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 精读

把长上下文推理教师的能力蒸馏给异分词器短上下文学生,会遭遇token错位、长度爆炸与训练崩溃三重障碍。上海AI Lab SU-01团队提出SimpleOPD:在共享文本空间对齐——学生用自己分词器生成、教师用自家分词器评估同一文本,仅对占据完全相同文本跨度的token配对监督;配合终止token优势屏蔽+学生参考KL损失,截断率降至近零。Intern-S2-Preview在ProofBench从34.0提升至55.2(+21.2分),超越Gemini-2.5-Pro,跨Qwen/Intern/GLM/Gemma四大家族全部正向增益。本文拆解其对齐机制、稳定性因果链与长度爆炸的根因解释。

August 18, 2026 · 1 min

蒸馏风暴:门槛、灰色地带与一份没人愿意签字的竞赛规则

《晚点聊》编辑部红浩与曼奇复盘"蒸馏"这一没人愿意公开谈论的技术竞赛:典型蒸馏是有门槛的"抄答案",含账号运营、数据管线、防中转站反被坑等系统工程;张一鸣为何禁止字节蒸馏——“只能逼近不能超越"加上组织激励代价;Anthropic如何用行为指纹识别2880万次"史上最大规模蒸馏攻击”;学生能否超越教师仍是开放问题;以及比蒸馏更大的问题——智能供需错配下"够用了"的模型正在改写定价逻辑。

August 18, 2026 · 2 min

Full-bandwidth transformer 精读

Full-bandwidth transformer(微软+JHU+普林斯顿,含 John Langford)指出自回归 Transformer 的垂直反馈通道极窄:步间只回传一个采样 token(至多 log2|V| 比特),顶层隐状态被直接丢弃。论文提出潜反馈解码(latent feedback decoding),用门控线性单元把上一步顶层隐状态与 token 嵌入融合后回灌输入端,配合多 pass 训练目标、渐进调度与 prefix mixin,在 1B 模型 400B token 预训练中验证:Math500 超越 1T token 标准基线、GSM8K 指令调优后 71.8 逼近 1T 基线、约 2 倍数据效率、base 模型推理链显著变短且精度不降,每 token 推理开销不到 1%。本精读覆盖带宽视角的动机、可达集理论、训练配方、实验因果链与可推广灵感。

August 16, 2026 · 5 min

从DeepSeek到Kimi K3,中国开源模型如何逼出黄仁勋的'开源联盟'

DeepSeek V4 Pro登场,中国开源模型连续逼近前沿能力,迫使黄仁勋牵头组建美国"开放安全AI联盟",Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI"开源"到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别,以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。

August 13, 2026 · 1 min

DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds 精读

深度精读华为加拿大软件卓越中心与女王大学的 DCAS 论文——首个系统揭示开源 CLI Agent 存在’scaffold 锁定’现象的工作。论文发现:在 OpenHands 单一 scaffold 下微调的模型,迁移到其他 scaffold 时性能可从 52.6% 暴跌至 8.4%。通过提出 DCAS 后端替换拦截层和区分显式/隐式规划两种形式,论文给出了一条从 scaffold 制品到模型能力的可行迁移路径,仅用 576 条规划感知轨迹即可让模型在非训练 scaffold 上一致提升。

August 11, 2026 · 9 min

「模型能力已经够了,要卷就卷 Infra」|对话戴冠兰:从 Cloudflare 到 Runta,为十亿个 Agent 造执行底座

Runta 创始人戴冠兰(前 Cloudflare/Kong 核心)在十字路口播客中提出核心判断:模型能力爬坡已放缓,真正制约 Agent 落地的是执行层基础设施。Runta 刚完成 2000 万美元种子轮(a16z 领投,Jeff Dean、李飞飞天使),定位是为 Agent 打造确定性执行底座——在概率性大模型之上加入隔离、权限、审计和热迁移等系统能力,让企业敢于把生产权限交给智能体。文章梳理了 Token Maximizing 到 Minimizing 的反转、Agent 安全必然爆发的逻辑、以及公有云和基模厂商为何难以抢占这一赛道。

August 10, 2026 · 2 min

特修斯之船:Kimi K3如何把Transformer的零件全部换掉,还能逼近前沿

月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。

August 6, 2026 · 1 min

DiffusionGemma Technical Report 精读

自回归(AR)LLM 逐 token 解码是根本瓶颈——DiffusionGemma 把语言模型生成从’逐 token 预测’改成'256 token 块并行精炼’。基于 Gemma 4 MoE(3.8B 激活/25.2B 总参)微调,两阶段训练(SFT 教双向去噪 + RL+采样器蒸馏提升质量与效率)用不到原 AR 模型 10% 的训练 token 预算,实现单张 H100 上约 1500 tokens/秒、约 20 tokens/forward pass,确立速度-能力新帕累托前沿。它仍保留 thinking mode、多模态、长上下文,且能 AR 生成,为混合扩散-AR 解码铺路。本文从’扩散模型并行精炼 vs AR 顺序解码’的第一性原理,解释为什么这条路能打破 AR 的固有瓶颈。

August 5, 2026 · 1 min

Infra 的浪漫与 AI 平权:盛颖从 SGLang 到 RadixArk

SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk(1 亿美元种子轮)的完整路径。她提出 Infra 不应是 support 角色,而应成为产品本身;RadixArk 的使命不止于推理引擎,而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境,以及一位女性研究者在技术圈中的真实体验。

August 3, 2026 · 2 min