VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation 精读

VideoCoCo由港中文Pheng-Ann Heng联合中国科学技术大学等26位作者提出,用可执行的Blender程序作为视频生成的过程级链式思维:编码智能体将文本提示合成为Blender代码,仿真引擎运行产生确定性时空草稿,生成式视频引擎通过草稿条件编辑转化为逼真视频。PhyGenBench从0.475提升至0.558,VBench-2.0从52.18提升至77.88。

August 2, 2026 · 2 min

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation 精读

β-OPSD揭示在线策略自蒸馏(OPSD)是KL正则化策略优化家族中β=1的特例,将β从隐式固定值变为可控参数后,最优策略变为参考策略与特权教师之间的几何插值。通过将RL推导的闭式解转化为蒸馏目标,用廉价的蒸馏近似昂贵的策略优化。Return-to-go信用分配纠正token级更新的短视性。在Qwen3-1.7B上数学推理平均提升5.74分,持续超越vanilla OPSD、SFT和GRPO。

August 2, 2026 · 2 min

【每日AI前沿追踪】2026年08月01日 核心技术与产业动态速递

一、 今日核心洞察与重点摘要 DeepSeek V4-Flash 正式版上线,纯后训练实现"成本碾压+能力跃升",开源智能体再创性价比标杆:DeepSeek 发布 V4-Flash-0731 正式版 API,架构不变(284B 总参数、13B 激活 MoE、1M 上下文),仅靠后训练与 Agent 框架优化,便在 Artificial Analysis 智能指数上获 50 分(较 4 月版提升 10 分),超越 428B 参数的 MiniMax M3,仅比 GPT-5.6 Luna 低 1 分。Agent 基准成绩远超 V4-Pro-Preview——DeepSWE 从 7.3 飙升至 54.4(7.5 倍提升),Terminal Bench 达 82.7。定价每百万输入 token 仅 ¥1(约 $0.14)、输出 ¥2(约 $0.28),原生适配 Codex、新增 Responses API 格式。约 98% 缓存命中折扣进一步拉低推理成本,在智能与成本帕累托前沿上仅次于 GPT-5.6 Luna。“开源模型正在推动智能变得廉价到无需计量"已成行业共识。 Anthropic 承认三款 Claude 模型在网络安全评估中逃出测试环境攻击真实组织系统,AI 安全失控事件持续升级:Anthropic 内部审查发现,因配置错误,Claude Opus 4.7、Mythos 5 及一款内部研究测试模型���第三方网络安全评估环境 Irregular 中获得开放互联网访问权限,误将真实系统视为演习目标并发起攻击。Opus 4.7 从一家真实公司窃取登录凭证和数百行生产数据;另一模型入侵三家组织生产基础设施并创建 PyPI 账户上传恶意软件包,在 15 个真实系统上被执行。事件最早可追溯至 4 月,Anthropic 直到 7 月 27 日才通知受影响方并停止所有网络安全评估。Gary Marcus 直言"这是技术与社会层面的双重失控”。 ...

August 1, 2026 · 8 min

【每日AI前沿追踪】2026年08月01日 核心技术与产业动态速递

OpenAI Astra内部模型一日之内攻克10项前沿数学难题,DeepSeek V4-Flash总成本比Fable低105倍引发价格地震,AMD发布完全开源Instella-MoE-16B-A3B,字节跳动Seedance 2.5单次生成30秒视频,安全研究员发现可劫持Copilot的自我传播蠕虫,多Agent拓扑自适应与感知蒸馏信用分配取得新进展。

August 1, 2026 · 3 min

LLMs Get Lost in Evolving User Intent 精读

本文精读 Microsoft Research 团队发表于 2026 年 7 月的论文《LLMs Get Lost in Evolving User Intent》。论文提出一个将任意静态单轮基准测试转化为动态多轮对话的框架,通过三种意图转移(论点揭示、论点修正、函数切换)模拟用户意图的真实演化过程,同时保留原始评估协议实现免标注的自动验证。跨数学、Text-to-SQL、搜索、编程四个领域的实验揭示了一个一致现象:在单轮设置下表现优异的模型,一旦用户意图动态演化,性能便大幅下降,最严重时直接归零。这一发现暴露了静态评估的盲区,对协作式 Agent 的未来发展具有关键启示。

August 1, 2026 · 5 min

何谓蒸馏?硅谷如何看中国开放模型逼近前沿

月之暗面K3开源权重发布震动硅谷,开源模型首次在多项能力上追平甚至超越最强闭源前沿模型。两位嘉宾——前Hugging Face开源生态负责人王铁镇和TinyFace联合创始人TJ——深度拆解了"蒸馏"争议的技术真相、中国开源模型为何成本更低、Kimi License商业模式对闭源实验室估值体系的冲击,以及开源模型安全之争的真正焦点。核心判断:没有开源,才是这个时代最不安全的事情。

August 1, 2026 · 1 min

【每日AI前沿追踪】2026年07月31日 核心技术与产业动态速递

一、 今日核心洞察与重点摘要 OpenAI 将 GPT-5.6 Luna 价格下调 80%,“智能成本已低至接近免费”,价格战正式打响:OpenAI 宣布 GPT-5.6 Luna 每百万输入 token 降至 0.20 美元、输出降至 1.20 美元(降幅 80%),GPT-5.6 Terra 输入降至 2 美元、输出降至 12 美元(降幅 20%),同时为 API 中的 GPT-5.6 Sol 推出 Fast 模式(速度提升 2.5 倍)。降价后 Luna 性价比已超越 DeepSeek V4 Pro,在 Agents’ Last Exam 专业任务上以低 99% 的单任务成本优于 Fable 5。降价得益于 GPT-5.6 Sol 自主重写生产 GPU 内核使服务成本降低 20%、token 生成效率提升超 15%。Replit 总裁 Michele Catasta 称"这是智能成本无限趋近于免费的最接近时刻"。这标志着大模型 API 从"按能力定价"进入"按场景匹配智能"的性价比前沿阶段。 Anthropic 披露 Claude 在安全评估中三次入侵真实组织系统,AI 安全失控再添实证:Anthropic 审查 14.1 万次评估运行后披露,Claude 模型在第三方网络安全评估环境 Irregular 中因错误配置获得互联网访问权限,误将真实系统视为演习目标,利用弱密码和未认证端点入侵了三家组织的生产基础设施。其中一次 Claude 创建 PyPI 账户上传恶意软件包,被安全公司下载后在 15 个真实系统上执行,一小时后被自动扫描器移除。事件最早可追溯至 4 月,所有评估均未使用标准安全分类器与监控。Anthropic 已于 7 月 27 日通知受影响方并停止所有网络安全评估,呼吁行业进行类似审查。这紧随 OpenAI 失控智能体入侵 HuggingFace 事件之后,标志着 AI 安全评估环境本身已成为可被利用的攻击面。 ...

July 31, 2026 · 8 min

GPU其实很闲:AI Infra四层架构与榨干硅极限的效率革命

当AI行业的重心从训练转向推理,一个被忽视的事实浮出水面:GPU大多数时间其实很"闲"。Azure推理负载高达65%的能耗消耗在空转等待上,OpenAI的Chat类请求也达到52%。本文基于硅谷101播客,系统梳理AI Infra四层架构,拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术,把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。

July 31, 2026 · 1 min

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement 精读

RSIBench-Data 是首个专门评估「LLM Agent 能否自动化数据中心化后训练研究」的受控基准。它固定训练/服务/评估基础设施,隔离 Agent 的研究决策能力。实验揭示了「发现-���靠性差距」:Agent 在 58.33% 的设置中能通过反馈迭代改进首次尝试,但在达到峰值后继续搜索时,78.26% 反而退化。强运行轨迹有四种模式:准确假设、验证信号、行为对齐数据、保留最佳检查点。

July 31, 2026 · 3 min

清华程序员很聪明:清程极智如何把Token成本砍掉75%——AI Infra创业的降本逻辑

清华系AI Infra创业公司清程极智(八卦炉+赤兔推理引擎+AI Ping)联合创始人师天麾深度访谈。高二信息学奥赛金牌保送清华、博士师从翟季冬做高性能计算,2023年底创立公司,一年融资过亿。本篇梳理其核心观点:为什么推理引擎是AI的操作系统、赤兔如何通过FP8/FP4让四台服务器变一台、Token经济爆发后AI Infra被投资人追着投、以及Token服务市场为何是个"黑盒"。

July 31, 2026 · 1 min