AURORA-LM:连续潜在扩散语言模型精读
深度精读南京大学联合 HKUST 等校的 AURORA-LM:把文本生成从离散 token 推向连续潜在空间。它用 Query-based 编解码器构建高容量可解码潜在序列,用块因果扩散 Transformer 左到右生成块、块内并行去噪,靠噪声输入瓶颈、自轨迹一致性等创新,在 OpenWebText 和 XSum 上拿下所有连续/扩散语言模型最优,1B 参数版本超越更大的 Cola-DLM(1.8B),全程在昇腾 NPU 上完成。
深度精读南京大学联合 HKUST 等校的 AURORA-LM:把文本生成从离散 token 推向连续潜在空间。它用 Query-based 编解码器构建高容量可解码潜在序列,用块因果扩散 Transformer 左到右生成块、块内并行去噪,靠噪声输入瓶颈、自轨迹一致性等创新,在 OpenWebText 和 XSum 上拿下所有连续/扩散语言模型最优,1B 参数版本超越更大的 Cola-DLM(1.8B),全程在昇腾 NPU 上完成。