MoNe: Modular Neural Memory for Efficient Long Context Inference 精读
三星研究院提出MoNe——附加到任意冻结预训练Transformer上的模块化神经记忆,实现O(N)预处理+O(1)查询的长上下文推理。两阶段设计:测试时以固定分段读入上下文、快权重神经记忆网络做层局部梯度更新;推理时仅从查询token生成KV,不再重读任何上下文token。128K token时计算与峰值显存较ICL均降约80%(参数开销仅6.4%),RULER上S-NIAH 128K达0.96(ICL仅0.28、MK-NIAH上ICL完全归零而MoNe保持),且可泛化到骨干原生窗口远之外的长度。