World in World 精读:免训练控制视频世界模型的统一证据接口

西湖大学 AGI Lab 提出 World in World:training-free 推理时接口,把四类异构控制证据(源视频观测/目标视角投影/几何渲染/检索生成态)统一转为带相机与时间标注的干净视觉状态,经冻结视频世界模型的原生 self-attention 读入;对应路由器建立 token 对应关系,证据级 attention CFG(EWA)按通道独立调权。同一冻结骨干完成相机控制重渲染/长时程回访/人体动作迁移,重渲染全指标超 ReCamMaster 等训练方法(CLIP-Sim 92.5 vs 83.8)。

September 13, 2026 · 1 min

X-AuT 精读:渐进剪枝+跨尺度蒸馏的语音编码器压缩,18→16 层错误率不降反升

小鹏汽车提出 X-AuT:短行为探针选择可恢复的层组合,渐进式剪枝 Qwen3-ASR-0.6B 音频塔 18→16→14 层,表征对齐+跨尺度蒸馏(教师强制+计划学生策略)+LoRA 恢复,解码器骨干全程冻结。18→16 层宏平均错误率 5.61%→5.27%(不降反升);14 层 5.75%、参数 -20.7%、车载加速器延迟 -21.4%;渐进剪枝 5.75% vs 直接剪枝 6.73%。

September 13, 2026 · 1 min

【每日AI前沿追踪】2026年09月12日 核心技术与产业动态速递

数据日2026-09-11:潜空间语言模型NCP-ArchPreview以51.3%算力追平OLMo-3引发架构范式讨论;EvoSafeHarness开启安全harness自动搜索时代(ASR 45.6%→10.0%);清华上交RSI综述定义L1-L5自治分级;MCP注册表审计揭露48.8%握手率真相;Agent技能检索合成数据反致20pp灾难遗忘;OpenAI三连发(Agents API/GPT-Live-1/金融版ChatGPT)与Anthropic威胁报告7家中国实验室蒸馏指控同日引爆产业圈。

September 12, 2026 · 9 min

A2ABreak 精读:把 A2A 协议规范编译成状态机之后,11 个新漏洞自己浮出水面

Purdue+UT Dallas(Elisa Bertino 组)对 Linux 基金会 A2A 协议做首个系统性安全分析:NL 规范→验证 FSM→受限 LLM 推理+对抗验证的三阶段框架。FSM 构建在 TCP ground-truth 上恢复 11/11 状态、19/20 转移(F1 0.84);在“攻击者完全合规”假设下发现 11 个新漏洞——跨客户端上下文注入、委托链多跳身份丢失凭证收割等,全部无需实现缺陷。

September 12, 2026 · 1 min

EvoSafeHarness 精读:Agent 安全没有万能线束,那就让线束自己进化

JHU/UC Berkeley/NVIDIA/UIUC/UW-Madison 五机构发布 EvoSafeHarness:为冻结 LLM Agent 自动搜索’模型×领域’专用安全 harness,DecodingTrust-Agent 上 ASR 45.6%→10.0%(utility 仅损 3.3 分),AgentDojo 82.8% utility @ 0 ASR。核心洞察:模型变体决定 enforcement 强度、领域变体决定谓词与状态——universal 安全 harness 在结构上就不存在。

September 12, 2026 · 2 min

GenV 精读:把 Z3 等价性判定蒸馏成语言模型的“第六感”

CWRU×AWS(实习合作)提出 GenV:把离线 Z3 等价 oracle 蒸馏为 reference-free 的连续等价分,专治 autoformalization 中“表面合法但语义错位”的欺骗性轨迹。GenV+HN 在 VPU 检测上 F1 0.832(process RM 仅 0.246),logit lens/SAE 机制分析证明信号真实存在于残差流而非捷径。

September 12, 2026 · 1 min

IdeaAMBIG 精读:从论文想法到能跑的代码之间,隔着 660 个“没人写的细节”

Yale×TUM×腾讯发布 IdeaAMBIG:660 个证据落地的“实现关键缺口”基准(163 个真实缺口来自可复现性报告与 GitHub issue + 497 个受控合成缺口),评测 LLM 能否发现科研想法规格中的缺失决策。13 个 LLM 最好者 Macro Defect Recovery 仅 9.6%——想法到实现的鸿沟被首次量化,且当前模型几乎看不见它。

September 12, 2026 · 1 min

Looped Flows 精读:把“想得更久”做进架构——循环流的局部训练之路

AITHYRA 访问研究者的 looped flows:状态化去噪器每步预测解并更新循环状态、ODE/SDE 步更新流状态,用局部训练目标绕开跨步反传的老大难。六个推理基准整体超先前 looped SOTA,ARC-AGI-1 58.8%、ARC-AGI-2 12.2%——循环模型在抽象推理上首次具备与主流推理范式对话的竞争力。

September 12, 2026 · 1 min

MCP 注册表随机抽样审计精读:48.8% 握手率背后的工具生态幸存者偏差

独立研究者 Haseeb Mohammed Afsar 对 MCP 注册表做首个未修复概率样本审计:24,135 服务器普查中概率抽 400 个 npm/stdio 服务器在线探测,仅 48.8% 完成 initialize 握手(手工精选框架 66.7%),37.5% 根本无法启动;能跑的 195 个硬一致性 100%,但安全注记缺失率 58.8% vs 精选 41.5%——整个领域的采样偏差第一次被量化。

September 12, 2026 · 1 min

NCP-ArchPreview 精读:当语言模型开始预测“概念”而不是 token

上海交大 Intern-NCP 团队发布 8.9B/5.73T tokens 的潜空间语言模型 NCP-ArchPreview:在 next-token prediction 之上引入 Next Concept Prediction 目标,仅用 51.3% 训练 tokens 追平 OLMo-3-7B 最终 loss,GSM8K +5.99 分,17M 参数 VQ 模块即可完成领域适配——迄今最大潜空间 LM 实证。

September 12, 2026 · 1 min