【每日AI前沿追踪】2026年07月13日 核心技术与产业动态速递

一、 今日核心洞察与重点摘要

  • GPT-5.6 Sol Ultra 持续攻克数学巅峰:继上周破解50年 Cycle Double Cover Conjecture 后,Sol Ultra 再下一城,解决了 Erdős 问题 #793(关于 2-primitive 集的渐近性质),模型给出了极短且优雅的构造性证明,改进了 Erdős 本人此前证明的较弱结果。此外,Sol 在 Codex 中自主操控电脑连续 5 小时通关《Slay the Spire 2》每日挑战,展示了长时自主规划与复杂决策能力,同时在 Agent Arena 排名第二,逐步逼近 Claude Fable 5。

  • Apple 起诉 OpenAI 窃密案白热化:苹果在 41 页诉状中提出六大惊人指控——前硬件主管 Tang Tan(在苹果任职24年)指示面试者携带"实际零件"和"原型机"参加面试;前工程师 Chang Liu 离职后利用认证漏洞持续访问苹果云存储,下载数十份机密文件,被发现时只回了一句"LOL";超过400名前 Apple 员工已加入 OpenAI。这场诉讼可能重塑硅谷人才流动规则。

  • Agent 编排层与长时任务评测成为焦点:今日多篇重磅研究指向同一个趋势——决定 Agent 实际生产力的不是模型本身,而是编排层(harness)。Better Harnesses 论文证明优化 harness 可让小模型以 4% 成本恢复 89.7% 的 LLM 性能;Long-Horizon-Terminal-Bench 揭示最强模型在长时终端任务上仅 10.9% 完美通过率;Failure as a Process 首次从过程视角解剖 CLI 编码 Agent 的失败轨迹。

  • “反向信息悖论"成为企业 AI 战略核心议题:微软 CEO 纳德拉明确提出"反向信息悖论"概念——企业使用专有 AI 模型时,不仅支付 token 费用,还在无意中交出更宝贵的专有知识。模型通过用户的提示词、智能体工具调用及纠错反馈进行学习。纳德拉同时批评模型厂商"双标”:一边主张"合理使用"数据训练模型,一边限制他人蒸馏。

产学研合作趋势

今日学术研究呈现出三大鲜明的产学研融合方向:

  1. 视频生成模型作为视觉智能基础范式:Google DeepMind 联合 MIT(Kaiming He)的 GenCeption 工作以企业算力 + 学术理论的方式提出视频生成是通用视觉智能的基础路径;上海 AI Lab(Kai Chen)的 Scalable Visual Pretraining 则从学术侧验证视觉预训练对语言智能的可扩展性贡献。

  2. Agent harness 编排与成本优化:CMU(Christian Kästner, Tongshuang Wu from Amazon)的 Better Harnesses 工作将 Agent 成本优化从"换更强模型"转向"优化编排层",体现了工业界成本焦虑驱动学术方向选择的趋势。

  3. Agent 评测标准去理想化:Tencent Hunyuan 的 Long-Horizon-Terminal-Bench 和 Skyfall AI 的 Morpheus 分别从"长时终端任务"和"永不重置的持续企业模拟"两个维度推动 Agent 评测向真实世界推进,体现了"基准可信度"成为产学研共同关切的核心议题。


二、 详细内容追踪

1. 前沿学术与技术突破(Hugging Face 精选 + Arxiv 精选)


Long-Horizon-Terminal-Bench:测试智能体在长时终端任务上的极限

  • 核心亮点:现有终端基准大多关注几分钟内完成的简单问题,仅评估最终结果。LHTB 提出 46 个长时终端任务(覆盖实验复现、软件工程、多模态分析、交互游戏、科学计算九大类),每个任务分解为细粒度子任务,支持密集中间奖励和部分评分。15 个前沿模型实测中,平均每个任务消耗 990 万 Token、约 231 轮次、85.3 分钟执行时间,最强模型仅 10.9% 完美通过率,均值仅 1.7%,揭示了巨大提升空间。
  • 团队背景:腾讯混元(Tencent Hunyuan)与多所高校合作。
  • 相关链接:📄 点击阅读论文原文

Scalable Visual Pretraining for Language Intelligence

  • 核心亮点:挑战语言模型必须在纯文本上训练的默认假设,系统研究无监督视觉预训练范式——直接利用视觉文档(图表、公式、页面布局)而不提取文本。在多个骨干网络和基准上,相同语料的视觉预训练持续超越纯文本预训练,为可扩展的语言智能提供了高效路径。
  • 团队背景:上海 AI Lab(Kai Chen 领导),纯学术界研究,但方法论直接影响产业界多模态预训练方向。
  • 相关链接:📄 点击阅读论文原文

Video Generation Models are General-Purpose Vision Learners(GenCeption)

  • 核心亮点:提出大规模文本到视频生成可作为计算机视觉的强预训练范式,提供时空先验、视觉-语言对齐和可扩展性。GenCeption 利用预训练视频生成扩散骨干定义前馈感知模型,在深度估计、表面法线、相机位姿、分割、3D 关键点预测等任务上达到 SOTA,常匹配或超越专用模型。在可比较设置下,视频生成预训练优于 V-JEPA 和 VideoMAE,且展现出惊人的数据效率(比 D4RT 和 VGGT-Omega 少 7-500 倍训练数据即达可比性能)。
  • 团队背景:Google DeepMind(Joao Carreira, Andrew Zisserman, Misha Andriluka 等)联合 MIT(Kaiming He)——顶级产业界与顶级学术界的强强联合。
  • 相关链接:📄 点击阅读论文原文

Trust Region Policy Distillation(TOP-D)

  • 核心亮点:将高方差、不稳定的在线策略蒸馏(OPD)转化为稳定训练范式。通过动态构建近端教师(proximal teacher),TOP-D 在理论上建立严谨框架证明其控制梯度方差,提供全局收敛分析和单调改进界。在数学推理任务上显著提升训练稳定性、样本效率和最终性能,且引入零额外计算开销。
  • 团队背景:香港科技大学(广州)(HKUSTGZ),Li Lyna Zhang 和 Mao Yang 均有微软研究院背景。
  • 相关链接:📄 点击阅读论文原文

Self-Guided Test-Time Training for Long-Context LLMs(S-TTT)

  • 核心亮点:解决长上下文 LLM 的有效利用问题。发现测试时训练(TTT)对训练片段质量高度敏感——在随机采样片段上训练反而损害性能。S-TTT 让模型在适应前先识别应该学习的证据片段,仅在这些片段上应用标准语言建模训练目标。在 LongBench-v2 和 LongBench-Pro 上为 Qwen3-4B 和 Llama-3.1-8B 带来最高 15% 相对提升。
  • 团队背景:学术界研究团队(含 Amazon 相关作者)。
  • 相关链接:📄 点击阅读论文原文

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in LLM Finetuning

  • 核心亮点:形式化定义微调中"知行鸿沟"(Knowing-Using Gap)——LLM 能快速记忆新事实但在推理中无法使用。通过创新的 self-patching 干预技术追踪知识的空间渗透动力学,发现知识电路错位假说:记忆表示可以存在于模型内部但未被路由到计算有效层。设计简单启发式策略恢复了 58-75% 的泛化失败差距。
  • 团队背景:HKUST(Hui Xiong)。
  • 相关链接:📄 点击阅读论文原文

Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation

  • 核心亮点:证明对于许多常规业务任务,小语言模型(SLM)配合适配的 harness 可在 90% 更低成本下匹敌大模型性能。关键洞察是任务难度的很大一部分跨实例共享,可通过定制指令、工具和编排循环从模型"提升"到 harness。构建 harness 优化器从失败轨迹自动发现有效适配策略。在 7 个业务导向 Agent 任务和 3 个 SLM 家族中,优化 harness 在 21 个任务-SLM 对的 16 个上显著改善,7 个对完全弥合 SLM-LLM 性能差距,最佳 SLM Agent 以 4% 成本恢复 89.7% 的 LLM 性能。
  • 团队背景:CMU(Christian Kästner)联合 Amazon(Tongshuang Wu)——典型产学研合作。
  • 相关链接:📄 点击阅读论文原文

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

  • 核心亮点:首次从过程视角(而非结果视角)大规模分析 CLI 编码 Agent 的失败轨迹。收集 7 个前沿模型在 3 种编码 Agent 支架上生成的 3843 条执行轨迹,筛选出 1794 条完整轨迹(超 63000 步)进行人工标注,推导出 14 项发现。核心结论:编码 Agent 失败主要由认知错误(epistemic errors)驱动,通常在执行最初几步就开始,且往往在恢复已不可能时才被发现,暗示提升可靠性需要更早的验证和干预。
  • 团队背景:UCL(Earl T. Barr, Federica Sarro)联合微软亚研(He Ye)——欧洲学术界与产业界合作。
  • 相关链接:📄 点击阅读论文原文

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning

  • 核心亮点:结合系统化 UCB1 树搜索和分层世界模型,在推理时完全消除 LLM 调用。三层世界模型集成精确符号匹配(L1)、执行日志统计学习(L2)和 LLM 未知动作预测(L3)。在合成规划任务上达 100% 成功率(LATS 92%,ReAct 64%),12 个压力测试场景维持 100%(LATS 降至 88.9%,ReAct 降至 23.9%),规划时零 LLM 调用(LATS 每任务 37 次)且跨运行零方差。
  • 团队背景:独立研究。
  • 相关链接:📄 点击阅读论文原文

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

  • 核心亮点:解决过程奖励模型(PRM)在长多 Agent 回合中的计算瓶颈。KV-PRM 直接读取 LLM 生成阶段自然产生的 KV 缓存,通过处理单个"验证 Token"将评分成本从 O(L²) 降至 O(L)。形式证明 KV 缓存包含严格大于文本的信息容量。在 MATH、GSM8K、AIME 上匹配或超越文本 PRM,评分 FLOP 减少最高 5000 倍,延迟降低 37 倍,单序列内存占用降低 34 倍。
  • 团队背景:Drexel University 联合多所学术机构。
  • 相关链接:📄 点击阅读论文原文

Scoped Verification for Reliable Long-Horizon Agentic Context Evolution(GRACE)

  • 核心亮点:提出图正则化 Agent 上下文演化(GRACE),将持久化系统指令维护为类型化语义图,在修改节点的局部类型邻域内验证更新。在固定电信 Agent harness 和分布偏移协议下,GRACE 将严格可靠性(pass³)从 Gemini 2.5 Flash 零样本的 0.091 提升至 0.673±0.136,超越 Gemini 3.1 Pro 零样本的 0.242。
  • 团队背景:独立研究(Dan C. Hsu, Luke Lu)。
  • 相关链接:📄 点击阅读论文原文

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

  • 核心亮点:设计作者-评论者(author-critic)架构的数学 Agent,在 FirstProof 第二批挑战(10 个真实数学问题)中 6 个被裁判判定为基本正确,获参赛团队最佳表现。在 30 个开放问题中,21 个获人类反馈的解答里 5 个完全正确,2 个有前景待最终验证,8 个含有用进展。发布开源 Agent 构建库。
  • 团队背景:ETH Zürich(Johannes Schmitt)联合多所学术机构。
  • 相关链接:📄 点击阅读论文原文

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests

  • 核心亮点:将 Bug 复现测试生成分解为四阶段 Agent 框架(Bug 定位、根因分析、测试规划、测试生成),集成仓库图上下文检索和运行时环境交互。在 SWT-bench-lite 和 verified 上分别复现 58.43% 和 70.30% 的 Issue,超越所有基线,平均每实例成本仅 $0.14。配合 GPT-5-mini 时比 OpenHands 高出 20.43 个百分点。
  • 团队背景:南京大学联合微软亚研(Liang Xiao, Chunrong Fang)——产学研合作。
  • 相关链接:📄 点击阅读论文原文

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

  • 核心亮点:引入激励兼容拍卖机制动态分配任务给专家模型和工具。将推理步骤视为可交易品,Agent 基于其修正后的能力(rectified competence)竞标,确保关键逻辑路由给最有能力的求解器而非最过度自信的。在 5 个基准上超越匹配的单模型、路由和级联基线,通过单一拍卖参数暴露可控的成本-质量权衡。
  • 团队背景:University of Surrey(Ales Leonardis)。
  • 相关链接:📄 点击阅读论文原文

StickyMoE: Training MoE Models for Memory-Efficient Inference

  • 核心亮点:提出可微分路由一致性损失,惩罚相邻 Token 间的专家切换突变,鼓励路由器在语义连贯的片段中保持相同专家分配。无需架构变更,仅增加单一超参数 lambda,在预训练第一步就允许专家表示和路由决策共同适应。小规模 MoE 语言模型实验显示专家切换率降低最高 60%,困惑度下降不到 4%,在质量-局部性前沿 Pareto 优于后微调方法。
  • 团队背景:独立研究(Ali Kayyam)。
  • 相关链接:📄 点击阅读论文原文

Neural Collapse Is Forbidden: Information Floors in Language Models

  • 核心亮点:挑战语言模型表示中"类内方差=神经坍缩不完整"的常见解读,论证它是被分配的信息存储且遵循一条定律。一行中心化恒等式推翻了一族单纯形等角紧框架声明。跨 14 个模型的无量纲方差份额中,宏类别结构仅承载 4-12% 的表示方差,Token 内上下文承载 79-91%,在 100 倍参数范围内稳定。
  • 团队背景:独立研究(Bruno Abrahao)。
  • 相关链接:📄 点击阅读论文原文

Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills

  • 核心亮点:首次大规模实证研究公共仓库和市场中软件工程技能的封装方式。分析大量 SE 技能语料,考察其封装的活动、生命周期覆盖、演化特征和评估机制。揭示 SE 活动正日益成为通过技能复用的可重用工件,指出技能推荐和面向工程的结构化研究机会。
  • 团队背景:香港科技大学(S.-C. Cheung)。
  • 相关链接:📄 点击阅读论文原文

2. 产业动态与产品创新(AI Hot 精选)


GPT-5.6 Sol Ultra 解决 Erdős 问题 #793

  • 核心内容:继上周破解 50 年 Cycle Double Cover Conjecture 后,GPT-5.6 Sol Ultra 再下一城,解决了 Erdős 问题 #793(关于 2-primitive 集的渐近性质)。模型给出了极短且优雅的构造性证明,改进了 Erdős 本人此前证明较弱结果所用的方法。Sol 在 Agent Arena 排行榜上也位列第二(基于 7.8K 次真实智能体会话评测),净提升 1.6%,缩小了与 Claude Fable 5 的差距。
  • 落地应用场景:前沿数学研究辅助、AI 自主科学发现能力验证。连续攻克开放数学问题标志着 AI 正从"推理"迈向"发现"。
  • 相关链接:🌐 点击查看新闻来源

GPT-5.6 Sol 在 Codex 中自主操控电脑 5 小时通关《Slay the Spire 2》

  • 核心内容:Ethan Mollick 分享 AI 能力里程碑——让 GPT-5.6 Sol 在 Codex 中控制其电脑,要求它赢得《Slay the Spire 2》每日挑战(随机化因素,无法作弊)。AI 连续工作 5 小时,做出复杂游戏选择并最终通关。此前已有研究显示固定记忆层策略让该游戏胜率翻倍。
  • 落地应用场景:长时自主任务执行验证、复杂决策环境中的持续规划能力评估,为未来通用办公 Agent 的可行性提供了关键实证。
  • 相关链接:🌐 点击查看新闻来源

Codex 与 ChatGPT Work 用户破 700 万,OpenAI 全量赠送额度重置

  • 核心内容:OpenAI 庆祝 Codex 和 ChatGPT Work 达到 700 万活跃用户,向所有用户账户添加了一次"banked reset"(可累积的额度重置),用户可在桌面端或网页端使用,补充每周使用量。Sam Altman 发推称"我们爱我们的用户"。此前 GPT-5.6 发布后容量压力巨大,OpenAI 曾紧急取消 5 小时限制。
  • 落地应用场景:编码 Agent 生态快速扩张,700 万活跃用户标志着 AI 编码工具从"开发者尝鲜"走向"日常生产力基础设施"。
  • 相关链接:🌐 点击查看新闻来源

Apple 起诉 OpenAI 窃密案升级:六大惊人指控

  • 核心内容:苹果在 41 页诉状中提出六大惊人指控:①前硬件主管 Tang Tan(任职苹果 24 年)指示面试者携带苹果"实际零件"和"原型机"参加面试;②前工程师 Chang Liu 离职后未归还电脑,利用认证漏洞持续访问苹果云存储下载数十份机密文件,被发现时只回了一句"LOL";③另一名前员工 Peng 被指控持续向 Liu 输送信息;④超过 400 名前 Apple 员工已加入 OpenAI;⑤诉讼涉及 65 亿美元设备项目;⑥Jony Ive 的 IO Products 也被牵涉。
  • 落地应用场景:硅谷人才流动规则与商业秘密保护边界的标志性案例,直接影响科技巨头间的挖角协议和知识产权管理策略。
  • 相关链接:🌐 点击查看新闻来源

Anthropic 延长 Claude Fable 5 免费期并推出协作功能

  • 核心内容:应对 OpenAI GPT-5.6 Sol 定价压力,Anthropic 再次延长 Claude Fable 5 免费使用推广期至 7 月 19 日之后。同时推出 Claude Artifacts 公开分享与 Claude Code 多人实时编辑功能,用户可通过 Claude Tag 创建可由他人或本地 Claude Code 会话编辑的仪表盘。Anthropic 还发布研究,通过构建"价值观轴"(顺从 vs 谨慎、温暖 vs 严谨、深度 vs 简洁、坦诚 vs 执行)量化 Claude 在不同模型和语言中表达的价值倾向。
  • 落地应用场景:团队协作编程、项目知识管理、跨语言 AI 行为一致性审计。
  • 相关链接:🌐 点击查看新闻来源

微软 CEO 纳德拉提出"反向信息悖论"警告

  • 核心内容:纳德拉在博客中警告,企业使用 OpenAI、Anthropic 等专有 AI 模型时不仅支付 token 费用,还无意中交出了更宝贵的专有知识。模型通过用户的提示词、Agent 工具调用及纠错反馈进行学习,这些"废气"数据提炼出的知识将被用于服务企业的竞争对手。纳德拉同时批评模型厂商"双标":一边主张"合理使用"数据训练模型,一边限制他人蒸馏。
  • 落地应用场景:企业 AI 采购决策框架重构、私有化部署需求增长、知识资产保护策略。
  • 相关链接:🌐 点击查看新闻来源

图灵奖得主 Rich Sutton 创立 Oak Lab,打造自主学习 AI 智能体

  • 核心内容:2024 年图灵奖得主、现代强化学习联合创始人 Richard Sutton 与 Khurram Javed 在加拿大多伦多创立 Oak Lab,目标是构建能自主学习的 AI 智能体。两人此前均任职于 John Carmack 的 AI 公司 Keen Technologies。Sutton 主张真正的通用 AI 需要通过持续与环境交互的强化学习而非监督学习来实现。
  • 落地应用场景:自主决策 Agent、机器人持续学习系统、摆脱标注数据依赖的 AI 训练范式。
  • 相关链接:🌐 点击查看新闻来源

Morpheus 基准:首个永不重置的持续学习 RL 环境

  • 核心内容:Skyfall AI 推出 Morpheus,面向持续强化学习(CRL)的持久企业模拟平台。与传统每次回合重置的环境不同,Morpheus 构建永不重置的持久世界,通过故障注入引擎(11 种故障类型,4 种预设速率)和异步配置漂移控制器引入结构化非平稳性。测试发现前沿 LLM 表现不佳,目标异步变化时决策后果不断累积,持续适应能力成为关键瓶颈。
  • 落地应用场景:企业 Agent 持续部署可靠性评估、供应链动态调度、IT 运维自动化中的持续适应。
  • 相关链接:🌐 点击查看新闻来源

Grok CLI 被曝静默上传整个代码库及 Git 历史,API 密钥泄露

  • 核心内容:xAI 的 Grok CLI 被曝将用户的整个主目录上传至 GCS(Google Cloud Storage),包括代码库、Git 历史和 Claude Code 配置文件中的 API 密钥。多名开发者在 Hacker News 确认安全问题。Grok Build 同日推出隐私保护功能(零数据留存与追溯删除),但 CLI 安全事件持续发酵。
  • 落地应用场景:AI 编码工具安全审计标准、企业敏感代码保护、DevSecOps 中 AI Agent 权限最小化原则。
  • 相关链接:🌐 点击查看新闻来源

Nous Research 以 15 亿美元估值融资,Hermes Agent 生态扩张

  • 核心内容:开源 AI 智能体 Hermes 的开发商 Nous Research 正由 Robot Ventures 领投、USV 等参投,以 15 亿美元估值完成新一轮融资,至少筹集 7500 万美元。公司成立于 2023 年,此前累计融资超 7000 万美元。Hermes 系列开源模型在去中心化 Agent 生态中具有广泛影响力。
  • 落地应用场景:开源 Agent 模型生态建设、去中心化 AI 应用、企业可定制 Agent 解决方案。
  • 相关链接:🌐 点击查看新闻来源

腾讯混元 Hy3 登顶 OpenRouter,定位 Agent 向 LLM

  • 核心内容:腾讯低调发布的 Hy3(295B 总参数、21B 激活参数 MoE)登顶 OpenRouter 排行榜,被定位为 Agent 向 LLM 而非聊天模型。实测中 Hy3 将 101 个混乱 SKU 的销售数据自动整理为含执行摘要、异常值识别(IQR 方法)、定价梯度、重复 SKU 检测的结构化报告并生成 PPT。幻觉率从 12.5% 降至 5.4%,已接入微信超 10 亿用户。
  • 落地应用场景:企业数据分析自动化、电商 SKU 管理、Agent 向任务编排。
  • 相关链接:🌐 点击查看新闻来源

Google Antigravity 推出 Agent Teams 团队协作

  • 核心内容:Google 的 Antigravity 工具在 /teamwork-preview 命令下支持 Agent Teams,可启动由专业智能体组成的团队来规划、构建和验证复杂任务。同时 Google Gemini Omni Flash 登顶 Artificial Analysis 文生图与图生视频双榜。
  • 落地应用场景:复杂软件项目的多 Agent 协作开发、自动化验证流水线。
  • 相关链接:🌐 点击查看新闻来源

苹果正研发 M7 Ultra 芯片,支持 1.5TB 统一内存

  • 核心内容:据爆料苹果正研发 M7 Ultra 芯片,支持高达 1.5TB 统一内存,是当前 M3 Ultra Mac 内存上限的两倍多。GPU 可直接访问全部内存池,与英伟达 B200 服务器 GPU(180GB HBM3e)形成竞争,旨在满足本地 AI 大模型推理需求。
  • 落地应用场景:本地大模型推理(70B+ 参数模型端侧运行)、隐私敏感的 AI 工作流、AI 开发者工作站。
  • 相关链接:🌐 点击查看新闻来源

Cloudflare 将于 9 月 15 日起默认屏蔽 AI 智能体爬虫

  • 核心内容:Cloudflare 宣布从 9 月 15 日起默认屏蔽 AI 智能体爬虫,同时上线三类爬虫控制开关。还推出 Precursor,通过持续客户端信号检测 AI 智能体行为。这是内容生态与 AI 爬虫博弈的标志性节点。
  • 落地应用场景:内容版权保护、网站数据采集合规、AI 训练数据获取成本上升。
  • 相关链接:🌐 点击查看新闻来源

Colibri 框架:25GB 内存运行 744B 参数 GLM-5.2 MoE 模型

  • 核心内容:开源框架 Colibri 实现在仅 25GB 内存下运行 744B 参数(40B 激活)的 GLM-5.2 MoE 模型。核心思路是分析模型激活细节:每个 Token 推理时仅路由专家部分(约 11GB,int4)变化,而注意力、共享专家和归一化层在请求间保持静态可缓存。
  • 落地应用场景:消费级硬件运行超大规模 MoE 模型、端侧大模型部署降本。
  • 相关链接:🌐 点击查看新闻来源

FastAFD 开源方案提升 GB200 解码吞吐 1.35-1.45 倍

  • 核心内容:面向 GB200 NVL72 的开源注意力-前馈分离(AFD)运行时 FastAFD 发布。72 块 Blackwell GPU 位于同一 NVLink 域内,将每 GPU 解码吞吐提升 1.35-1.45 倍,为最新机架级 GPU 系统上的 AFD 架构提供开源验证。
  • 落地应用场景:超大规模推理集群性能优化、Blackwell 架构部署最佳实践。
  • 相关链接:🌐 点击查看新闻来源

200+ 经济学家与 AI 研究者签署"We Must Act Now"联合声明

  • 核心内容:200 余位经济学家与 AI 研究者(含诺奖得主)签署联合声明,警告 AI 经济影响窗口正在关闭,呼吁政府立即应对 AI 对就业和经济结构的冲击。同时有人呼吁 2040 年前放缓 AI 发展。
  • 落地应用场景:AI 政策制定、劳动力转型规划、企业 AI 战略与社会责任的平衡。
  • 相关链接:🌐 点击查看新闻来源

OpenAI 安全系统负责人 Johannes Heidecke 即将离职

  • 核心内容:OpenAI 安全系统团队负责人 Johannes Heidecke 即将离职。近年来 OpenAI 安全与对齐团队已有 8 名核心成员离开,包括联合创始人 Ilya Sutskever、Jan Leike 等。部分离职员工曾公开质疑 OpenAI 更看重产品而非安全。
  • 落地应用场景:AI 安全治理格局、前沿模型公司安全文化、监管审查风向标。
  • 相关链接:🌐 点击查看新闻来源

Prime Intellect 发布 Verifiers v1:智能体 RL 训练与评估可组合任务集

  • 核心内容:Prime Intellect 发布 Verifiers v1,提供用于智能体强化学习训练与评估的可组合任务集、Harness 和运行时。为开源社区提供了标准化的 Agent RL 基础设施。
  • 落地应用场景:开源 Agent RL 训练、可复现的 Agent 评估基准。
  • 相关链接:🌐 点击查看新闻来源

中国自研 AI 芯片架构突破:14nm 制程实现每秒 520 万亿次浮点运算

  • 核心内容:我国自研 AI 芯片在 14nm 制程下实现每秒 520 TFLOPS 浮点运算性能突破。东方算芯同步发布全球首颗软件定义近存计算 3D 芯片 DF1000。中国临时禁止氦气出口以保障芯片生产,AI 半导体价值链核心瓶颈正从 GPU 转向存储。
  • 落地应用场景:国产 AI 推理算力替代、端侧 AI 部署、半导体供应链自主化。
  • 相关链接:🌐 点击查看新闻来源

Hebbia 测试 Claude Fable 5:金融基准准确率提升约 20%

  • 核心内容:为机构金融提供 AI 平台的 Hebbia 测试了 Claude Fable 5。在其金融专用基准测试中,Fable 5 在文档问答与引证测试上实现约 20% 的相对准确率提升,创下团队记录。在 Agent 测试中能同时处理多部文档进行交叉验证。
  • 落地应用场景:金融尽职调查自动化、法律文档审查、多文档交叉验证工作流。
  • 相关链接:🌐 点击查看新闻来源

Artificial Analysis 推出 AA-Briefcase 基准

  • 核心内容:Artificial Analysis 在 AI Engineer World’s Fair 上推出新基准 AA-Briefcase,测试模型在数千个输入文件上的真实任务(电子表格、演示文稿、UI 原型)。指出完成复杂智能体任务的成本正在上升。Meta Muse Spark 1.1 取得 863 分,与 Gemini 3.5 Flash 持平。
  • 落地应用场景:长周期知识工作 Agent 能力评估、真实办公场景的模型选型。
  • 相关链接:🌐 点击查看新闻来源