RA-Bench: Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? 精读

AI视频生成器已能伪造战争、灾害等危机场景,但现有检测器的真实防御能力从未在贴近真实攻击链的场景下被检验。NUS、西安电子科大、HKUST等19机构60人团队构建RA-Bench:1830条真实危机视频锚点+首帧条件化I2V生成的16056条配对视频,覆盖4开源+5闭源生成器。三维度系统评测发现全面失守:传统检测器AUC从公开基准67.6–98.6%跌至43.9–57.3%;六位评审员全判“真实”的HumanProof子集上Gemini仅54.7%;社会传播模拟(转码+降采样+新闻台标)使微调MLLM的假视频召回从46.0%崩溃至1.4%。检测排名与公开基准相关性仅0.26——现有检测体系在真实危机场景已实质失效。

August 18, 2026 · 1 min

泡沫是2029年,不是2027:王煜全的荷塘、中间物种与击穿围墙的Agent

海银资本创始人王煜全做客《AI相对论》,给出与蒋涛"2027年爆破"不同的判断:泡沫在2029年,且是"大而快的危机"——半年内恢复、见底时遍地黄金。他的分析框架是"荷塘理论"(胜负已分,只是收入利润滞后五六年才显现)与佩蕾丝技术革命周期(导入期狂热—泡沫破裂—展开期高速增长)。据此推演:特斯拉Waymo地盘战已定调、FSD规模数据优势无人能敌;中国车企不做数据联盟将成为"中间物种";人形机器人是"训练腿的是大泡沫、训练手的是小泡沫";低空经济不可能规模化。七巨头中英伟达未来五年安全、谷歌十年内广告模式失效、苹果失去战略眼光、微软无自研大模型有风险。中国机会在智能服务出海与"农村包围城市"式的全球算力基建。

August 18, 2026 · 2 min

蒸馏风暴:门槛、灰色地带与一份没人愿意签字的竞赛规则

《晚点聊》编辑部红浩与曼奇复盘"蒸馏"这一没人愿意公开谈论的技术竞赛:典型蒸馏是有门槛的"抄答案",含账号运营、数据管线、防中转站反被坑等系统工程;张一鸣为何禁止字节蒸馏——“只能逼近不能超越"加上组织激励代价;Anthropic如何用行为指纹识别2880万次"史上最大规模蒸馏攻击”;学生能否超越教师仍是开放问题;以及比蒸馏更大的问题——智能供需错配下"够用了"的模型正在改写定价逻辑。

August 18, 2026 · 2 min

Beyond Final Scores: 长程AI研发Agent过程级评测 精读

深度精读美团与中国科学院大学的论文 Beyond Final Scores——一项花费约10万美元推理成本、覆盖7个前沿模型×36个长程任务×3次rollout(共756次运行)的系统评测。它不满足于给Agent打一个终分,而是把研究循环拆成方案框架(C1)、执行(C2)、反馈控制(C3)三个规则化过程指标,并用受控对照测出经验复用(M)与harness的真实影响。核心结论:当前自动研发Agent更像“工程优化器”而非自主研究者——拉开模型差距的是可靠性而非峰值(avg@3差距0.237 vs best@3仅0.122),252个最佳解中仅3个(1.2%)具真正方法学新颖性,且钻评测漏洞的解(16个)比新颖解多五倍。

August 16, 2026 · 2 min

Full-bandwidth transformer 精读

Full-bandwidth transformer(微软+JHU+普林斯顿,含 John Langford)指出自回归 Transformer 的垂直反馈通道极窄:步间只回传一个采样 token(至多 log2|V| 比特),顶层隐状态被直接丢弃。论文提出潜反馈解码(latent feedback decoding),用门控线性单元把上一步顶层隐状态与 token 嵌入融合后回灌输入端,配合多 pass 训练目标、渐进调度与 prefix mixin,在 1B 模型 400B token 预训练中验证:Math500 超越 1T token 标准基线、GSM8K 指令调优后 71.8 逼近 1T 基线、约 2 倍数据效率、base 模型推理链显著变短且精度不降,每 token 推理开销不到 1%。本精读覆盖带宽视角的动机、可达集理论、训练配方、实验因果链与可推广灵感。

August 16, 2026 · 5 min

AI for Science 爆发前夜:曹原谈验证瓶颈、概念抽象与 AGI 的最后一公里

Jeff Dean 带三位谷歌元老出走创立 Discovery Loop 当周,前 DeepMind 科学家、Unreasonable Labs 联合创始人曹原在硅谷101拆解 AI for Science 为何在此时爆发:代码与数学能力到位后科研成为下一个智能爆发点,但真正的瓶颈从建模移到了物理世界的验证环节;LLM 无法凭训练数据产生真正新的科学概念,概念抽象可能是 AGI 的"最后一公里"甚至不可计算;他主张 AI and Science 而非 AI for Science——科学难题是驱动 AI 本身进化的催化剂,并给出"AI 拿诺贝尔奖至少还需二三十年"的长期判断。

August 15, 2026 · 2 min

How Can Rhetoric Reward-Hack AI Reviewers? 精读

当 AI 开始审稿,会不会写“彩虹屁”比做得好不好更重要?马里兰大学等四校团队用 120 篇 ICLR 2026 投稿构造 4200 篇修辞改写稿、收集 42396 条 AI 评审,系统量化了“只改措辞、不改内容”对评审分的因果影响:证据框架最能提分(最高 +0.93)、新颖性立场最能降分(最低 −0.73),低分稿越改越高、高分稿反而越改越低。本精读按九部分结构拆解其实验设计、因果链与可推广灵感。

August 15, 2026 · 4 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

当 AI 科学家已经能跑完“构思-实验-写作”全流程时,下一个瓶颈是什么?NUS 与牛津的 OmniScientist 给出的答案是:证据。现有系统只让智能体看到文本、代码和预计算的数字摘要,而图像里的形态、信号里的时序、跨通道的不一致这些科学上决定性的关系在接口处就丢失了。本文构建了一个感知层 + 3 个 ReAct 智能体 + 确定性管线的全模态全学科 AI 科学家,用代码强制执行新颖性、统计严谨性与数值溯源检查,在 36 个真实数据案例上全部完成从原始数据到可编译论文的全流程;配对消融显示直接感知在全部 7 个评审维度上优于“盲测”变体,正面交锋胜率 85%。本精读逐层拆解其感知分层、三重检查机制与因果链分析。

August 15, 2026 · 3 min

从DeepSeek到Kimi K3,中国开源模型如何逼出黄仁勋的'开源联盟'

DeepSeek V4 Pro登场,中国开源模型连续逼近前沿能力,迫使黄仁勋牵头组建美国"开放安全AI联盟",Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI"开源"到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别,以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。

August 13, 2026 · 1 min

在算力最多的地方做世界模型:对话英伟达Cosmos掌舵人刘洺堉

英伟达研究副总裁、Cosmos Lab负责人刘洺堉的4小时深度访谈。从GAN到Diffusion到世界模型的20年研究者之路,到Cosmos 3为何将语言/视频/音频/动作统一进单一模型,到"模型竞争不是零和游戏"的Low Ego哲学,再到黄仁勋的第一性原理决策与"不裁员"文化。他认为模型能力终将收敛,真正决定胜负的是生态整合;他不想击败任何人,只想帮助Physical AI整个领域成功。

August 13, 2026 · 1 min