DSec(DeepSeek Elastic Compute): 面向规模化 Agentic 训练的可扩展沙盒基础设施 精读

DSec(DeepSeek-AI + 清华大学)提出一套面向规模化 Agentic RL 训练的可扩展沙盒基础设施。它用三大支柱解决「海量环境、高密度资源、按需镜像」的难题:可组合环境层(overlayfs + EROFS,把 O(mN) 镜像数降到 O(m))、高密度资源管理(virtio-pmem+DAX+DAMON+核调度,microVM 峰值内存降 40.2%)、3FS 按需镜像加载,并把 Agent 循环与可抢占 GPU 解耦以支持弹性训练。实测 8192 容器突发比 eager Docker 快 1.71×、磁盘写少 57%,规模达 300 万沙盒/日、峰值 38 万并发、>5000 个/秒创建。本文按九部分结构精读其架构、关键技术与实验,并通过外部检索交叉验证 serverless 沙盒(SAND/RunD)与 RL 训练基础设施(AgentGym/AgentScale)等相关工作。

September 23, 2026 · 5 min

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression 精读

DeepSeek-V4.1-Flash 用三件武器把长上下文智能体的部署成本打下来:CED 非对称架构让 prefill 只激活 8B 参数(decode 16B),CSA2 跨层 KV 复用 + FP4 量化把全局 KV 缓存压到 890 字节/token(较 V1 降 437 倍),SWA Bounded Replay 把持久化缓存再压到 1/8。在 Codeforces 3348→3471、DeepSWE v1.1 达 74.2% 的同时,45T token 多模态预训练完全开源。本文拆解其架构因果链与’智能体负载第一性’的设计哲学。

September 19, 2026 · 3 min

两天十万Star:DeepSeek Harness 的开放逻辑,与它想要驯服的模型-脚手架-算力飞轮

围绕 DeepSeek Harness 发布后两天破十万 Star 的现象,三位从业者从「一切皆插件」的架构设计、模型与 Harness 的深度协同、极简模式与缓存命中率的技术原理,聊到程序员岗位转型、开源生态与国产算力差距。核心判断:Harness 是 AI 时代的脚手架,插件化+开源让社区共建成本降到极低,模型与脚手架会互相塑造,而程序员的护城河正从写代码转向定义需求与验收结果。

August 24, 2026 · 2 min

Can Agent Memory Systems Track Evolving State? StateMemBench 精读

LLM Agent 走向跨会话长程任务后,记忆系统能否跟上不断被修订的世界状态?UIUC Jiawei Han 组把「状态追踪」从「事实回忆」中剥离:答案必须反映当前状态而非被取代的旧状态。论文先证明「状态漂移」在检索完美时仍是最大失败源,再发布 StateMemBench——234 个多会话场景、闭集三分评分,把漂移答案显式放入干扰池;随后提出显式追踪取代与依赖的 StateMem,在 DeepSeek-V4-Flash 上把准确率从 0.205 提到 0.363(1.8 倍),并以单次调用 Wrapper 给六个记忆后端带来 +32 到 +67 点提升。精读覆盖定义、构造、机制与根源解释。

August 23, 2026 · 7 min

三位AI博士的真话:Token比人便宜吗,泡沫何时破,以及就业市场的一线行情

三位背景互补的AI博士——在读多模态方向的“两两”、临毕业做医疗AI的“十四”、入工业界两年半的“罗克”——对谈近期AI大新闻与真实就业:Token与人力的成本真相、泡沫论的时间表、开源闭源之争与Anthropic为何遭恨、DeepSeek护城河的组织学解释,以及大厂、研究所、高校的薪资行情与“赛博土木”警告。三人难得达成的一条共识是:优秀的硕士并不比博士差,增量机会在AI加制造、医疗等落地场景。

August 20, 2026 · 2 min

蒸馏风暴:门槛、灰色地带与一份没人愿意签字的竞赛规则

《晚点聊》编辑部红浩与曼奇复盘"蒸馏"这一没人愿意公开谈论的技术竞赛:典型蒸馏是有门槛的"抄答案",含账号运营、数据管线、防中转站反被坑等系统工程;张一鸣为何禁止字节蒸馏——“只能逼近不能超越"加上组织激励代价;Anthropic如何用行为指纹识别2880万次"史上最大规模蒸馏攻击”;学生能否超越教师仍是开放问题;以及比蒸馏更大的问题——智能供需错配下"够用了"的模型正在改写定价逻辑。

August 18, 2026 · 2 min

A Programming Paradigm for Spatiotemporal Composability 精读

北大与 DeepSeek-AI 合作的 88 页长文,为「插件系统、自进化 Agent Harness」这类动态组合软件给出了第一个完整的编程范式级形式化基础:把经典效应系统提升为可逆效应、把协同效应系统提升为响应式协同效应,统一成一个递归上下文类型,再配上动态组合演算与全套元理论(保持性、恢复精确性、活性、合流性),实现为 Cordis 元框架并在 Koishi(4000+ 社区插件)上验证。本文按背景、定位、问题、解法、评估、根源解释、知识反推、通用灵感八个层面完整拆解。

August 15, 2026 · 5 min

从DeepSeek到Kimi K3,中国开源模型如何逼出黄仁勋的'开源联盟'

DeepSeek V4 Pro登场,中国开源模型连续逼近前沿能力,迫使黄仁勋牵头组建美国"开放安全AI联盟",Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI"开源"到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别,以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。

August 13, 2026 · 1 min

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读

当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。

August 11, 2026 · 9 min

何谓蒸馏?硅谷如何看中国开放模型逼近前沿

月之暗面K3开源权重发布震动硅谷,开源模型首次在多项能力上追平甚至超越最强闭源前沿模型。两位嘉宾——前Hugging Face开源生态负责人王铁镇和TinyFace联合创始人TJ——深度拆解了"蒸馏"争议的技术真相、中国开源模型为何成本更低、Kimi License商业模式对闭源实验室估值体系的冲击,以及开源模型安全之争的真正焦点。核心判断:没有开源,才是这个时代最不安全的事情。

August 1, 2026 · 1 min