【论文精读】Any-OPD:通过表示空间桥接实现异构流匹配模型的在策略蒸馏

京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题:用冻结DINOv2表示空间桥接不兼容的潜在空间,仅训练LoRA适配器,将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生,在多项指标上实现’学生超越教师’的奇迹。ImageReward提升是教师自身优势的近4倍。

August 5, 2026 · 4 min

AURORA-LM:连续潜在扩散语言模型精读

深度精读南京大学联合 HKUST 等校的 AURORA-LM:把文本生成从离散 token 推向连续潜在空间。它用 Query-based 编解码器构建高容量可解码潜在序列,用块因果扩散 Transformer 左到右生成块、块内并行去噪,靠噪声输入瓶颈、自轨迹一致性等创新,在 OpenWebText 和 XSum 上拿下所有连续/扩散语言模型最优,1B 参数版本超越更大的 Cola-DLM(1.8B),全程在昇腾 NPU 上完成。

August 5, 2026 · 2 min

DiffusionGemma Technical Report 精读

自回归(AR)LLM 逐 token 解码是根本瓶颈——DiffusionGemma 把语言模型生成从’逐 token 预测’改成'256 token 块并行精炼’。基于 Gemma 4 MoE(3.8B 激活/25.2B 总参)微调,两阶段训练(SFT 教双向去噪 + RL+采样器蒸馏提升质量与效率)用不到原 AR 模型 10% 的训练 token 预算,实现单张 H100 上约 1500 tokens/秒、约 20 tokens/forward pass,确立速度-能力新帕累托前沿。它仍保留 thinking mode、多模态、长上下文,且能 AR 生成,为混合扩散-AR 解码铺路。本文从’扩散模型并行精炼 vs AR 顺序解码’的第一性原理,解释为什么这条路能打破 AR 的固有瓶颈。

August 5, 2026 · 1 min

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction 精读

腾讯发布多领域编码 Agent 基准 WorkBuddy Bench,覆盖代码、前端、办公、安全四大真实工作场景。其核心贡献在于从真实 commit/CVE/业务场景逆向工程出抗污染的口语化任务,并将任务目录、环境镜像、评估框架、测试与参考方案完全开源。跨模型排行榜显示没有任何单一模型通吃,开源权重模型 GLM-5.2 在安全子集双框架登顶,为可信代码评测体系的构建提供了新的方法论范式。

August 5, 2026 · 6 min

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 精读

上海 AI Lab 等机构联合提出 Video-DeepResearch(Video-DR),把多模态 Deep Research Agent 从静态图像推进到连续视频流。论文诊断出当前 Agent 的两大顽疾——模态偏见(回避视觉工具转向文本搜索)与参数知识泄露(靠内部记忆蒙答案而非真正调用工具),并设计解耦感知-探索流水线 + 阶段式工具解锁 + SFT+GRPO 两阶段训练予以破解。其 35B-A3B 模型以 64.0% 平均准确率刷新 VideoDR-Bench SOTA,超越 Claude-4.5-Sonnet 5.0 分、GPT-5 11.5 分;30B 变体也追平 Claude-4.5-Sonnet。本文从机制因果层面解释:为何一个激活参数仅 3B 的模型能在视频 Deep Research 任务上反超数十倍体量的顶级闭源模型。

August 5, 2026 · 3 min

Infra 的浪漫与 AI 平权:盛颖从 SGLang 到 RadixArk

SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk(1 亿美元种子轮)的完整路径。她提出 Infra 不应是 support 角色,而应成为产品本身;RadixArk 的使命不止于推理引擎,而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境,以及一位女性研究者在技术圈中的真实体验。

August 3, 2026 · 2 min

N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读

N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出,是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作(VTLA)基础模型。方法核心是三步训练配方:(1)在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验;(2)分阶段触觉通路集成,用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整;(3)ALTER——一种优势条件离线RL方法,将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务,在20任务仿真套件上平均成功率63.8%(最强baseline π0.5为44.0%),ALTER训练策略在3个长程真机任务上达到75-95%成功率。

August 3, 2026 · 3 min

Meta AI Proactive Memory Agent:记忆教练精读

Meta AI提出主动记忆智能体架构,用独立的’记忆教练’智能体在固定间隔审查行动智能体的近期步骤,更新结构化记忆库(私有状态/知识记忆/程序记忆),并决定是否注入定向提醒。核心创新在于’何时提醒’的策略决策——选择性干预优于全量检索。Terminal-Bench从38%提升至46%,tau2-Bench从55%提升至62%,超越Mem0生产记忆层。

August 2, 2026 · 2 min

PhiZero: A World Model Built Around Physical Language 精读

PhiZero由中科院自动化所提出,通过自监督学习从野外视频中提取紧凑离散的’物理语言’表示世界状态转移,采用’先推理后渲染’范式:自回归VLM先推理物理语言序列,再由扩散解码器渲染为视频。4秒33帧视频仅需256个离散符号(比Wan2.2 VAE压缩175倍),在Physics-IQ、PhyGround、WorldModelBench、IntPhys2四个基准上物理一致性全面超越Sora 2、Cosmos3等。

August 2, 2026 · 2 min

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation 精读

VideoCoCo由港中文Pheng-Ann Heng联合中国科学技术大学等26位作者提出,用可执行的Blender程序作为视频生成的过程级链式思维:编码智能体将文本提示合成为Blender代码,仿真引擎运行产生确定性时空草稿,生成式视频引擎通过草稿条件编辑转化为逼真视频。PhyGenBench从0.475提升至0.558,VBench-2.0从52.18提升至77.88。

August 2, 2026 · 2 min