Diffusion Reward Models × SOLO:成熟技术的首次规模化双案例 精读
同日两篇论文在各自领域做了同一件事:把一项被搁置多年的成熟技术,用一个机制创新首次推到现代规模。清华 thunlp+港中文+UIUC 的 Diffusion Reward Models(DRM,当日 Hugging Face 日榜 up=22)把扩散模型首次引入奖励建模——奖励从点估计变为条件密度估计 p(r|x,y),轻量 DiT 头无参数族假设地表示人类偏好的多峰结构(多峰率随标注分歧 37.6%→63.2%,Wasserstein 距离全表最低),同骨干同数据受控对比平均 66.2 vs ArmoRM 62.3(+3.9);中科院自动化所的 SOLO 把局部学习(local learning)首次推到十亿参数 LLM 预训练——用一个所有模块共享的终端 readout 只读副本打破 update locking,梯度对齐 cos 从 0.52 升至 0.70,流水线激活内存降近 p 倍、吞吐达 1F1B 的 1.44×。二者方法论同构:识别被搁置的旧技术、诊断其规模化障碍、用一个机制创新解锁,为「旧思想在新规模下复活」提供了可复用的模板。