Diffusion Reward Models × SOLO:成熟技术的首次规模化双案例 精读

同日两篇论文在各自领域做了同一件事:把一项被搁置多年的成熟技术,用一个机制创新首次推到现代规模。清华 thunlp+港中文+UIUC 的 Diffusion Reward Models(DRM,当日 Hugging Face 日榜 up=22)把扩散模型首次引入奖励建模——奖励从点估计变为条件密度估计 p(r|x,y),轻量 DiT 头无参数族假设地表示人类偏好的多峰结构(多峰率随标注分歧 37.6%→63.2%,Wasserstein 距离全表最低),同骨干同数据受控对比平均 66.2 vs ArmoRM 62.3(+3.9);中科院自动化所的 SOLO 把局部学习(local learning)首次推到十亿参数 LLM 预训练——用一个所有模块共享的终端 readout 只读副本打破 update locking,梯度对齐 cos 从 0.52 升至 0.70,流水线激活内存降近 p 倍、吞吐达 1F1B 的 1.44×。二者方法论同构:识别被搁置的旧技术、诊断其规模化障碍、用一个机制创新解锁,为「旧思想在新规模下复活」提供了可复用的模板。

September 30, 2026 · 9 min

MassAlloc Attention × DaRoPE:注意力计算分配与位置编码的双子星重构 精读

本精读合并解读两篇重构 Transformer 核心算子的论文:HKUST(GZ)×BAAI×巴黎西岱的 MassAlloc Attention(MALA)把稀疏注意力改写为「分布条件化的运行时计算分配」——保留全部 QK 打分,用 online-softmax 演化归一化因子做逐 tile 贡献比测试,跳过低贡献 tile 的 post-score 计算,同一容差 τ=1 统一前向/反向/prefill/解码,训练 FLOPs -23.1% 而 PPL 无损、关联回忆 89.67% 贴近 FullAttn(NSA 仅 22.61%);Meta AI 巴黎×Inria 的 DaRoPE(ICLR 2027)诊断出 RoPE 慢频带这一具体弱点,快带保序、慢带换成 sigmoid 有界的逐头内容坐标,外推免配置,K=256 键值回忆 30.5% vs 其他方法 ≤7.25%。二者共享同一哲学:不做一刀切裁剪,让算子自己知道「哪里重要」。

September 30, 2026 · 6 min

Skill2Env × QwenGyre × AgentPerfBench:智能体强化学习的数据、系统与推理三层基建 精读

同日挂出的三篇 arXiv 论文恰好拼出 Agent 强化学习的三层基础设施:数据层(AllSpark 的 Skill2Env 把「环境合成」从扩展覆盖升级为能力参数化——100 个带控制旋钮的难度模式+基于 solver 执行证据的迭代加难,1.5K 轨迹 SFT 换 7 基准 +8.4pt);系统层(阿里 Token Hub 牵头的 QwenGyre 用 cell 级弹性调度+轨迹树处理让 2.4T 旗舰模型的百万 token rollout 在线 RL 提速 1.78×,pass rate 52.48%→58.54%);推理层(帝国理工+剑桥+牛津的 AgentPerfBench 用 22 个负载画像+饱和扫描+NCU roofline 证明 chat→coding 的 TTFT 差 4.8×、操作强度差 46×,agentic 负载在并发爬升时吞吐崩塌 43–76% 而 chat 仍在扩张)。本文按九部分结构合并精读,并给出「Agent RL 全栈工程」的公共图景。

September 30, 2026 · 8 min

WeEnv: The Environment for Agentic Reinforcement Learning at WeChat 精读

腾讯微信 AI 提出 agentic RL 的「环境税」:环境初始化独占迭代时间 53.4%,比训练本身还慢。WeEnv 对环境做打包-初始化-供给的全生命周期管理——layer group 活页夹式组合把 39,471 个镜像缩到 133 个、按需拉取让环境 10.6 秒启动(E2B 要 150.6 秒)、弹性配额化解秒级 47 倍的资源突发。本精读覆盖动机量化、三大设计的机制因果链、与 E2B/AgentENV/SkyRL 的外部交叉验证,以及企业生产部署视角的通用启发。

September 29, 2026 · 6 min

Agent 越能干,越等不起:云栖2026「AI实时数据智能」论坛复盘——卡住生产级 Agent 的不是模型,是数据的实时性、语义与断点

2026 云栖「AI 实时数据智能」论坛复盘:六场演讲共答一个矛盾——Agent 任务从秒级问答变成长程执行后,卡住生产的不是模型,而是数据新鲜度、业务语义与任务断点。Kafka 流算湖一体收敛实时链路,SLS 沉淀轨迹资产,RocketMQ LiteTopic 支撑手脑分离,AgentBridge 以逻辑统一取代数据集中,震坤行与 Qoder 给出客户证词。

September 24, 2026 · 4 min

当互联网的主体不再是人:云栖2026云网络专场,网络为什么重新变成稀缺品

2026云栖大会云网络专场(9月24日)年度发布梳理:当AI相关流量超过公网流量一半,网络从"尽力而为的管道"重新变成确定性交付的稀缺品。本文从尾延时与推理性价比、用通信换计算、推理下沉边缘、Agent成为网络新主体、数据语言统一五条机制链,拆解英特尔、阿里云、网易互娱、小鹏汽车、Maxinsights、Megaport六方的一线说法,并给出可迁移的判断框架。

September 24, 2026 · 2 min

模型每2.8天更新一次、企业采购却要等半年:云栖2026百炼专场复盘——从 Model 到 Token,卡住企业的不再是模型本身

2026 云栖百炼专场复盘:信通院姜春宇给出「模型 2.8 天一更、任务时长每 7 个月翻倍」对撞「企业一采购就落后」,提出 AI 原生方法论;安克商渭清展示日均四千亿 token 的 DOM×Launch 实践;百炼于文渊拆解「今年 90% token 来自 Agent」;圆桌把价格 K 型分化、智能路由与算力卡点收敛为「从有模型到用好模型」。

September 24, 2026 · 4 min

真武是系统,不只是芯片:平头哥算力峰会上的超节点方法论

整理2026云栖大会平头哥算力峰会「云模之芯,共筑非凡」全场内容。平头哥副总裁李伟良梳理真武810E→M890→V900→J900的年度迭代节奏;阿里云王超给出「系统语义不在物理边界断裂」的真超节点判据;Kimi许欣然拆解100毫秒decode里的访存经济学;元戎启行曹通易与无界动力夏中谱讲物理AI的数据量级与快慢脑;圆桌与倚天CPU、磐脉920网卡两场把Agent时代的关键路径补完整。芯片竞争已从单卡指标转向系统协同。

September 24, 2026 · 1 min

Memory Compression for High-Fanout Agent Sandboxes (AgentZip) 精读

Agent 平台把每个动作都关进沙箱,而 RL 训练和并行推理让一个任务扇出几十个沙箱——内存(而非算力)成为并发上限。HKUST 的 AgentZip 是首个专为 Agent 沙箱设计的内存压缩系统:用模板增量、同类群字典、页内 RLE 三种编解码器榨取’近似相同’页面的冗余,用恢复期预取取代保守选页,把昂贵压缩搬进 LLM 思考的空闲窗口。实测沙箱内存最高降 8.7 倍(Linux 配置仅 2.1 倍),激进压缩的减速从 3.1 倍压到 1.40 倍。本精读逐页拆解其 How/What/When 三问重构与全部消融,并对照 DeltaBox、DroidSpeak 等同期系统工作交叉验证。

September 20, 2026 · 3 min

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression 精读

DeepSeek-V4.1-Flash 用三件武器把长上下文智能体的部署成本打下来:CED 非对称架构让 prefill 只激活 8B 参数(decode 16B),CSA2 跨层 KV 复用 + FP4 量化把全局 KV 缓存压到 890 字节/token(较 V1 降 437 倍),SWA Bounded Replay 把持久化缓存再压到 1/8。在 Codeforces 3348→3471、DeepSWE v1.1 达 74.2% 的同时,45T token 多模态预训练完全开源。本文拆解其架构因果链与’智能体负载第一性’的设计哲学。

September 19, 2026 · 3 min