Uno:扩散增强 LLM 的无损加速范式——AR 与扩散在同一架构内的参数解耦 精读

MBZUAI×Cerebras 等推出 Uno:在同一 Transformer 内解耦 AR 权重(质量)与 rank-128 LoRA 扩散适配器(速度),冻结 AR 后仅用 7B token 做块级单步扩散蒸馏,配合 Ψ-Spec 采样器做 AR 验证的拒绝采样,实现严格无损、全 batch 区间保持的至高 3× 加速。8B 模型 SWE-bench Verified 68.4%,系统吞吐 5733 toks/s 全面超越 EAGLE-3/DFlash 与闭源 Mercury 2。

September 9, 2026 · 3 min

【论文精读】Any-OPD:通过表示空间桥接实现异构流匹配模型的在策略蒸馏

京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题:用冻结DINOv2表示空间桥接不兼容的潜在空间,仅训练LoRA适配器,将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生,在多项指标上实现’学生超越教师’的奇迹。ImageReward提升是教师自身优势的近4倍。

August 5, 2026 · 4 min

AURORA-LM:连续潜在扩散语言模型精读

深度精读南京大学联合 HKUST 等校的 AURORA-LM:把文本生成从离散 token 推向连续潜在空间。它用 Query-based 编解码器构建高容量可解码潜在序列,用块因果扩散 Transformer 左到右生成块、块内并行去噪,靠噪声输入瓶颈、自轨迹一致性等创新,在 OpenWebText 和 XSum 上拿下所有连续/扩散语言模型最优,1B 参数版本超越更大的 Cola-DLM(1.8B),全程在昇腾 NPU 上完成。

August 5, 2026 · 2 min