WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models 精读
腾讯提出WorldCycle,利用可逆动作循环的物理对称性作为免标注自验证RL信号。通过空间闭合奖励和时间一致性奖励,将视频世界模型的状态返回漂移降低44%,复合动作准确率提升近4倍。核心突破在于:不需要任何ground-truth未来状态,物理可逆性本身就是密集监督信号。
腾讯提出WorldCycle,利用可逆动作循环的物理对称性作为免标注自验证RL信号。通过空间闭合奖励和时间一致性奖励,将视频世界模型的状态返回漂移降低44%,复合动作准确率提升近4倍。核心突破在于:不需要任何ground-truth未来状态,物理可逆性本身就是密集监督信号。
月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。
SpaceX独家中标Nvidia Vera Rubin太空AI算力计划、Anthropic自研芯片、Cloudflare开源Cloudflare OS、AURORA-LM连续潜在扩散语言模型突破、Video-DeepResearch多模态深度研究Agent超越Claude-4.5-Sonnet,以及PCSD Agent RL自蒸馏、TARL长期Agent记忆交易管理等重磅进展。
京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题:用冻结DINOv2表示空间桥接不兼容的潜在空间,仅训练LoRA适配器,将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生,在多项指标上实现’学生超越教师’的奇迹。ImageReward提升是教师自身优势的近4倍。
深度精读南京大学联合 HKUST 等校的 AURORA-LM:把文本生成从离散 token 推向连续潜在空间。它用 Query-based 编解码器构建高容量可解码潜在序列,用块因果扩散 Transformer 左到右生成块、块内并行去噪,靠噪声输入瓶颈、自轨迹一致性等创新,在 OpenWebText 和 XSum 上拿下所有连续/扩散语言模型最优,1B 参数版本超越更大的 Cola-DLM(1.8B),全程在昇腾 NPU 上完成。
On-policy 自蒸馏(OPSD)本该是 LLM 后训练的稳妥方法,但它会让模型越练越差——DAPD 首次诊断出根因是’特权幻觉’:训练时教师能看到参考答案,推理时学生看不到,学生却表现得像参考答案还在一样。DAPD 用双路径锚定(DPA)和双源锚定(DSA)在匹配信息可用性下对齐,让 Qwen3-4B 平均 +2.00,且关键的是——OPSD 增益在 8B 以上几乎消失,DAPD 在 32B 仍稳定 +2.78。本文从’信息不对称’的第一性原理出发,解释为什么改信号不如改结构。
自回归(AR)LLM 逐 token 解码是根本瓶颈——DiffusionGemma 把语言模型生成从’逐 token 预测’改成'256 token 块并行精炼’。基于 Gemma 4 MoE(3.8B 激活/25.2B 总参)微调,两阶段训练(SFT 教双向去噪 + RL+采样器蒸馏提升质量与效率)用不到原 AR 模型 10% 的训练 token 预算,实现单张 H100 上约 1500 tokens/秒、约 20 tokens/forward pass,确立速度-能力新帕累托前沿。它仍保留 thinking mode、多模态、长上下文,且能 AR 生成,为混合扩散-AR 解码铺路。本文从’扩散模型并行精炼 vs AR 顺序解码’的第一性原理,解释为什么这条路能打破 AR 的固有瓶颈。
Agent 部署后会积累大量失败轨迹,但它的行为通常固定不变——模型不更新,Harness(运行时框架)也不更新。Harness-R1 首次把’编辑可执行运行时’本身变成一个可被在线 RL 训练的能力:一个 9B 的’harness 工程师’模型从失败批次中生成可执行补丁,用冻结目标 Agent 重跑的真实成功率作为奖励。结果这个 9B 工程师反超 GLM-5.2、GPT-5.5、DeepSeek-V4-Pro 等所有更大的前沿模型编辑器;即便目标 Agent 微调后,工程师仍能再 +5.0pp。本文从’把脚手架变成可学习对象’的第一性原理,解释为什么小模型+真实结果奖励能赢过大模型+教师提议。
长程任务(long-horizon)是 Agent 走向真实世界的最后一块硬骨头。LongHorizon-Harness 把’执行-状态管理-完成评估’从一个不断增长的上下文里拆开,重构为 Manage-Execute-Audit(MEA)循环:Manager 只管状态不碰环境、Executor 每轮用新鲜上下文执行、Auditor 只读独立验证。这套架构让 Qwen 3.7-Plus 在 WeaveBench 上从 51.8% 跃升到 80.7%(近乎翻倍官方 SOTA),OSWorld 2.0 上把 Claude Opus 4.7 从 20.0% 提到 34.3%。本文从’状态-执行-审计’分离的第一性原理出发,解释为什么这套架构在难任务上收益更大、在更强模型上 token 反而更省。
Agent 技能(Skill)是可复用的程序性知识,但生成技能缺乏自然监督信号——技能好不好只能看它能不能帮 Agent 在下游任务上做得更好。Skill-α 把技能生成形式化为序列编辑过程(Create/Update/Merge/Prune/Noop),核心创新是’回滚奖励’:对每个编辑,用同一锚定查询在原始技能和编辑后技能上分别运行固定工作器,编辑后更优才给正奖励。GPT-4o 工作器下 CL-Bench +3.3 点、tau2-bench +6.7 点超越最强基线。本文从’技能价值只能由下游表现定义’的第一性原理,解释为什么回滚奖励是技能生成的正确监督信号。