ComPO 零阶偏好对齐 与 SpectralShift 线性注意力长上下文扩展 精读(二重奏)

两篇训练方法学论文合并精读。UC Berkeley×NYU×阿里达摩院的 ComPO 提出 LLM 偏好对齐的零阶范式:不在偏好对上直接优化可微损失,而是用 comparison oracle 提取方向信息——规避 DPO 类方法在低似然边际对上的 likelihood displacement 失效,五个模型家族上改进含长度控制胜率,并给出收敛与性能保证。人大高瓴×MSRA 的 SpectralShift 从转移矩阵谱视角重新审视 Gated DeltaNet 的长上下文扩展:慢谱带宽度决定长程检索、快衰减模式负责状态清理,重参数化 alpha 投影初始化+学习率缩放即可让 10B 模型 8K→128K 课程扩展持续增益(RULER 64K +4.2)。

September 18, 2026 · 2 min

SSD-LLaMA 精读:单张 RTX 5090 跑万亿参数 MoE 的 SSD 原生推理系统

港科大联合中科院深圳先进院、南科大发布 SSD-LLaMA:面向万亿参数 MoE 的 SSD 原生本地推理系统——SSD I/O 流水线优化专家投递、SSD-RAM-VRAM 三层存储动态驻留、CPU-GPU 均衡混合执行,保证每个选中专家无剪枝无替换。三大前沿 MoE 家族上 prefill 提速 1.52–4.19×、decode 提速 2.10–15.58×,单张 RTX 5090+32GB RAM 实现万亿模型 >1 token/s。本精读拆解『把带宽受限问题转化为层次调度问题』的系统设计。

September 18, 2026 · 2 min

Mo' Models, Mo' Problems × Co-Skill 精读:多智能体选型与边云技能演化双视角

两篇互补的 multi-agent 工程研究:NVIDIA×哥本哈根的 Mo’ Models 用 23 模型×3 科学基准证明 MAS 模型池’加模型常降性能’——oracle 潜力与实际达成存在鸿沟、同族池是唯一稳定正收益、准确模型解集高度嵌套(rM=0.931);哈工大的 Co-Skill 诊断边云 skill 演化的’盲通信’根因(上传 token 25-42% 是重复前缀),用前缀合并轨迹 trie+渐进 skill 树双向解盲,token 省 15.6-41.9%、成功率提升 25.8-76.4%。合读视角:多 agent 系统的两个新瓶颈——选谁进队(异构组合的聚合噪声)与怎么通信(协作双方的信息结构)。

September 17, 2026 · 2 min

OPEN-1B: A Fully Auditable Training Run 精读

开源 LLM 即使放出全部数据与配方,也因浮点非结合性无法逐位复现——你无法验证发布的 checkpoint 真是声明的配方训出来的。Gensyn 的 OPEN-1B 定义第四层透明度’完全可审计’:RepOps 跨硬件逐位复现算子(固定规约序、统一 FMA/次正规数约定、计数器式 RNG)、拓扑不变数据流(token 流=种子的纯函数)、确定性 butterfly all-reduce,多审计者各验若干步拼出全程、整跑收敛为单一哈希。代价是 MFU 从一个数量级掉到 5%——可验证性与速度的明码标价,以及首个该层级的开源 LLM 全套产物。

September 17, 2026 · 2 min

推理芯片之战:带宽成为新算力,Groq、Cerebras 与 OpenAI 的三条路线与 Bill Dally 的 location 哲学

推理的瓶颈正在从算力转向带宽:每生成一个 token,都要把整个模型从存储介质读一遍。硅谷101本期请到两位正在做推理芯片创业的嘉宾——Bill Dally 的博士生 Mark 与前亚马逊 Annapurna 芯片软件栈科学家子阳,拆解 Groq 的静态调度、Cerebras 的晶圆级集成与 OpenAI Jalapeño 的 HBM4 通用路线为何是不同约束条件下的各自最优解,为什么中国关心 tokens per dollar 而美国关心 tokens per watt,以及推理速度如何决定模型智能的上限。

September 16, 2026 · 3 min

AMDKernelVault: Large-Scale Datasets and Agentic Training for AMD GPU Kernel Optimization 精读

AMD 开源 HIP/Triton 内核优化语料与 agentic 训练框架:HIPKernelGen/TritonKernelGen 管线把 PyTorch 参考实现转为 HIP/Triton 内核、在 ROCm 下编译验证、上硬件延迟剖析——产出 62,153 个执行验证 HIP 内核 + 2,377 条 ROCm 库 QA + 39,893 个 Triton 内核。演示价值:Qwen3-8B 经 SFT+执行感知 RL 后在 PyTorch→HIP 达 34.0% Pass@1、TritonBench-G 33.2% Corr@3、ROCmBench 41.94% Corr@3——打破 CUDA/NVIDIA 中心主义的开放生态基建。

September 15, 2026 · 2 min

GLIE 精读:几何先验驱动的检索压缩——100 万页 258GB 到 1GB 的流形参数化

KAUST×Edge Hill 发现视觉文档检索的页面向量恰在单位球面上且集中在本征维度 5-6 的低维流形附近(三个编码器一致验证),据此提出 GLIE:k≪N 个向量既作轻量索引又作全页嵌入的再生基底——归一化质心免费 +0.093 nDCG@5,k=4 时 1040 字节/页 vs 未压缩 257.8KB,保留未压缩系统近 80% 性能(先前最佳 70%);415K 参数网络 3 GPU 分钟千页训练,骨干全程冻结。

September 13, 2026 · 1 min

X-AuT 精读:渐进剪枝+跨尺度蒸馏的语音编码器压缩,18→16 层错误率不降反升

小鹏汽车提出 X-AuT:短行为探针选择可恢复的层组合,渐进式剪枝 Qwen3-ASR-0.6B 音频塔 18→16→14 层,表征对齐+跨尺度蒸馏(教师强制+计划学生策略)+LoRA 恢复,解码器骨干全程冻结。18→16 层宏平均错误率 5.61%→5.27%(不降反升);14 层 5.75%、参数 -20.7%、车载加速器延迟 -21.4%;渐进剪枝 5.75% vs 直接剪枝 6.73%。

September 13, 2026 · 1 min

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference 精读

KV cache 压缩方法都用’最近的查询’预测未来注意力——本文发现长程推理中这个假设根本不成立:解码会不定期产生’思维重访令牌’(TRT),重新关注数千 token 之前的推理计划,而近期查询无法预知这次重访。关键观察是 TRT 对应的全局查询在嵌入空间聚成少数簇——只需为每簇维护一个’信标查询’(Continual FPS 在线选取),就能预判哪些 KV 将被重访。训练自由、无需改动架构:四个开源推理模型上内存最高压缩 5.8×、精度近全量、吞吐 +4.3×,对 RPC/R-KV 最高领先 31.7 个百分点。

September 10, 2026 · 2 min

Iris: Climbing to the Search Frontier — 开源搜索智能体的数据反构造与 SFT-RL 攀爬配方 精读

AllSpark 团队发布 Iris-mini/pro 两个开源搜索智能体(35B-A3B 与 397B-A17B):从网页超链接实体图反向构造多跳任务,把非答案实体改写为描述性引用以杜绝字符串匹配作弊;提出 SFT-RL climbing 交替训练——每轮 RL 把最难与最高效轨迹回流进下一轮 SFT。BrowseComp 88.6 / HLE 56.4,同参数段开源最强。本文精读其’不可作弊任务合成’与’爬坡式两阶段循环’的完整配方。

September 8, 2026 · 2 min