Rethinking On-Policy Distillation II: One Training Example 精读

on-policy 蒸馏到底需要多少数据?本文把实验推到’一条训练样本’的极限:单条查询即可驱动 OPD 持续改进数百步,覆盖全数据 OPD 71.5% 的状态空间;16 个语义多样查询覆盖 98.9% 并匹配全数据训练。提出状态覆盖率度量解释现象——OPD 是’数据过饱、算法饥饿’,瓶颈在步数效率而非数据规模。

September 7, 2026 · 2 min

Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM 精读

社区量化混合架构 LLM 时一致保留循环半区(Gated DeltaNet)的高精度,理由是’循环误差会累积’。Minima 直接把 NVFP4 W4A4 打满全部 496 个线性层:五任务平均仅 -0.52(种子噪声内),显存 17.5 GiB 最小、prefill 提速 14-19%。四重机制研究(块缩放局域化离群值→门控非线性压缩误差→delta-rule 主动遗忘→逐 token 代价被冲刷)解释了为什么直觉是错的。

September 7, 2026 · 3 min

所有 Skill 都会死:卡比谈驾驭大模型的三层功夫——上下文、方法论与长活 Agent

GitHub 中国区 Top 100 开发者、Open CLI 作者卡比在 B站 Builder Club 交流日分享如何驾驭大模型:AI 的能力不只来自模型,也来自 Harness(运行时脚手架)。他给出三层可操作的功夫——理解并主动管理四层上下文与「有效上下文」,用方法论名字替代冗长 Skill(断言「所有 Skill 都会死」),以及在开源社区用长活 Agent 与 Swarm/Graph/Team 三种多 Agent 形态承接真实工作流。核心判断:模型终将吸收一切提示词工程,人剩下的核心位置是编排——拆任务、管上下文、沉淀 AI 友好(AX)的流程。

September 6, 2026 · 2 min

OpenAI工程师赵迪:从Twitter到OpenAI的25年,Navi推理引擎、马斯克的“两周法则”,与写代码这件事的重新定义

OpenAI infra 工程师赵迪在访谈中回看了自己 25 年踩中每一个浪潮的职业路径:Oracle、摩根斯坦利、Salesforce、Netflix、Twitter/X,直到 2025 年加入 OpenAI。他在 Twitter 期间用 Rust 写的 Navi 推理引擎统一了全站推荐与广告的 serving,这套 batching、caching 的思路今天在 LLM 推理中依然成立。他近距离观察了马斯克“两周法则”式的极端管理,也解释了为什么 Codex 普及之后写代码这件事被重新定义、为什么模型的好坏没有统一标准、以及为什么“智能平权”的口号与“智能成为阶级工具”的现实可能同时为真。

September 4, 2026 · 2 min

Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读

在 IOI 2026 上,一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分,超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径:22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距,以及’纯 SFT 的 Ultra 反超 SFT+RL 的 Nano’背后的并行采样机制。

September 4, 2026 · 3 min

与曾鸣聊产业史观:公司会消亡,卓越必来自反共识,OpenAI与Anthropic大概率不是原生时代的大赢家

阿里前总参谋长曾鸣基于对三次工业革命与互联网产业史的系统性研究,提出AI产业化的三阶段框架:基础设施→应用大爆发→原生应用。2026年token共识标志着第一阶段成熟,OpenClaw热潮开启智能体第二阶段。他判断大模型公司是AI云公司而非下一个时代的赢家,第一阶段企业很难跨入第二阶段;公司作为工业时代的制度创新将走向衰亡,组织的基本单元将从岗位转向任务,战略制定从规划转向生成。对创业者而言,卓越必来自反共识,未来属于创造力而非知识储备。

September 3, 2026 · 1 min

具身智能的金钱游戏:钱很多、花得很少,IPO 成了主竞赛

晚点聊邀请《具身的金钱游戏》两位作者复盘具身智能行业:融资额屡创新高,但算力和数据这两个最需要花钱的地方投入寥寥;收入靠地方政府数采中心与制造业关联交易撑起,IPO 成为行业主竞赛。本文拆解数采中心合资模式、制造业"互买"闭环、Club Deal 攒局玩法,以及这场资本竞赛背后的技术不确定性与观察指标。

September 3, 2026 · 1 min

对话卷卷任立峰:从抖音从零到一到AI 3D,一个互联网人如何学当厂长,以及为什么基础模型吞噬不了制造业

十字路口Koji对话数美万物创始人卷卷任立峰:抖音从零到一的核心经验是判断基建变量(网络+硬件)与激发用户表达,他将其迁移到AI 3D与制造业交叉点。数美万物自研图生3D大模型,2048³商用级精度在文字几何还原上全球领先,但不停留在数字资产——真正的壁垒是拆件、加桩、摆盘、调参到T+7准时交付90-95%的制造落地管线。节目还讨论了多模态视频模型正在蚕食3D的游戏影视应用、3D打印农场同质化与创作者激励、Maker OS到制造业OS的两阶段愿景,以及一个前字节高管创业两年多交的学费:自尊心、交付时效优先于极致质量、负向管理。

September 3, 2026 · 1 min

A Formal Limitation on Learning Human Language From Textual Corpora 精读

纯文本训练的大语言模型到底能学到多少意义?这篇来自 Universitat Pompeu Fabra 与 ETH Zürich 的论文用信息论给出了严格答案:无论模型多大、数据多少,任何只看话语形式的系统恢复说话者意图的概率都存在不可逾越的上界。论文将语言使用建模为意义、语境、话语的联合分布,推导出由互信息刻画的意义恢复天花板,并在人工语言、中文零代词消解(天花板 0.93)与颜色指称(天花板 0.66)三类实验中验证了理论。本精读将拆解两大定理的证明思路、实验设计与这一结果对 LLM 语义能力争论的原理性回答。

August 31, 2026 · 4 min

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge 精读

深度精读清华大学、腾讯优图实验室与华威大学合作的 ElephantBench:一个包含 1,094 道题的闭书知识探针,专门诊断大模型参数记忆中的『认知近视』——记得主流记述却漏掉少数派记述。文章拆解其从低曝光语料挖掘自然冲突的图构建管线、C/P/F/K 四指标体系、32 个模型的评测结果(最强者完整回忆仅 52.4%),以及曝光不对称与记忆完整性的因果关联,并提炼可推广到数据策展与评测设计的通用灵感。

August 31, 2026 · 5 min