DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds 精读

深度精读华为加拿大软件卓越中心与女王大学的 DCAS 论文——首个系统揭示开源 CLI Agent 存在’scaffold 锁定’现象的工作。论文发现:在 OpenHands 单一 scaffold 下微调的模型,迁移到其他 scaffold 时性能可从 52.6% 暴跌至 8.4%。通过提出 DCAS 后端替换拦截层和区分显式/隐式规划两种形式,论文给出了一条从 scaffold 制品到模型能力的可行迁移路径,仅用 576 条规划感知轨迹即可让模型在非训练 scaffold 上一致提升。

August 11, 2026 · 9 min

「模型能力已经够了,要卷就卷 Infra」|对话戴冠兰:从 Cloudflare 到 Runta,为十亿个 Agent 造执行底座

Runta 创始人戴冠兰(前 Cloudflare/Kong 核心)在十字路口播客中提出核心判断:模型能力爬坡已放缓,真正制约 Agent 落地的是执行层基础设施。Runta 刚完成 2000 万美元种子轮(a16z 领投,Jeff Dean、李飞飞天使),定位是为 Agent 打造确定性执行底座——在概率性大模型之上加入隔离、权限、审计和热迁移等系统能力,让企业敢于把生产权限交给智能体。文章梳理了 Token Maximizing 到 Minimizing 的反转、Agent 安全必然爆发的逻辑、以及公有云和基模厂商为何难以抢占这一赛道。

August 10, 2026 · 2 min

一片晶圆的赌局:Cerebras如何从 Scaling Law 的实验室走向千亿推理市场

硅谷101专访Cerebras早期投资人周南、前百度研究员Greg Diamos及产品高管Angela,复盘这家"晶圆级引擎"公司十年史。从百度三亿参数模型发现Scaling Law、2016年赌注式投资、良率工程突破,到G42订单、OpenAI两百亿美元推理合同、千亿市值IPO,文章梳理了Cerebras如何从一个物理学的疯狂赌注,变成推理时代绕开HBM与CoWoS瓶颈的差异化基础设施,以及上市后毛利率、供应链和客户自研芯片带来的真实风险。

August 7, 2026 · 1 min

特修斯之船:Kimi K3如何把Transformer的零件全部换掉,还能逼近前沿

月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。

August 6, 2026 · 1 min

Infra 的浪漫与 AI 平权:盛颖从 SGLang 到 RadixArk

SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk(1 亿美元种子轮)的完整路径。她提出 Infra 不应是 support 角色,而应成为产品本身;RadixArk 的使命不止于推理引擎,而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境,以及一位女性研究者在技术圈中的真实体验。

August 3, 2026 · 2 min

何谓蒸馏?硅谷如何看中国开放模型逼近前沿

月之暗面K3开源权重发布震动硅谷,开源模型首次在多项能力上追平甚至超越最强闭源前沿模型。两位嘉宾——前Hugging Face开源生态负责人王铁镇和TinyFace联合创始人TJ——深度拆解了"蒸馏"争议的技术真相、中国开源模型为何成本更低、Kimi License商业模式对闭源实验室估值体系的冲击,以及开源模型安全之争的真正焦点。核心判断:没有开源,才是这个时代最不安全的事情。

August 1, 2026 · 1 min

GPU其实很闲:AI Infra四层架构与榨干硅极限的效率革命

当AI行业的重心从训练转向推理,一个被忽视的事实浮出水面:GPU大多数时间其实很"闲"。Azure推理负载高达65%的能耗消耗在空转等待上,OpenAI的Chat类请求也达到52%。本文基于硅谷101播客,系统梳理AI Infra四层架构,拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术,把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。

July 31, 2026 · 1 min

清华程序员很聪明:清程极智如何把Token成本砍掉75%——AI Infra创业的降本逻辑

清华系AI Infra创业公司清程极智(八卦炉+赤兔推理引擎+AI Ping)联合创始人师天麾深度访谈。高二信息学奥赛金牌保送清华、博士师从翟季冬做高性能计算,2023年底创立公司,一年融资过亿。本篇梳理其核心观点:为什么推理引擎是AI的操作系统、赤兔如何通过FP8/FP4让四台服务器变一台、Token经济爆发后AI Infra被投资人追着投、以及Token服务市场为何是个"黑盒"。

July 31, 2026 · 1 min