World in World 精读:免训练控制视频世界模型的统一证据接口
西湖大学 AGI Lab 提出 World in World:training-free 推理时接口,把四类异构控制证据(源视频观测/目标视角投影/几何渲染/检索生成态)统一转为带相机与时间标注的干净视觉状态,经冻结视频世界模型的原生 self-attention 读入;对应路由器建立 token 对应关系,证据级 attention CFG(EWA)按通道独立调权。同一冻结骨干完成相机控制重渲染/长时程回访/人体动作迁移,重渲染全指标超 ReCamMaster 等训练方法(CLIP-Sim 92.5 vs 83.8)。