OpenART Arena: Scaling Agent Red Teaming via Open-Ended Environment Evolution 精读

OpenART 是评估 Agent 在演化环境中安全性的大规模红队测试 Arena:覆盖 10,000+ 验证场景、50 个领域、500,000+ 工具/MCP/Skills,通过 15 个真实部署的 Agent × 5 个基础模型 = 75 个配置展开评测。其参考策略 EMHA(Evolutionary Markov Hypergraph Attack)以超图遍历、授权状态转移、档案引导演化为核心,在不更新任何参数的前提下取得 85.0% 的池化 Strict ASR。本文系统拆解其问题定义、EMHA 技术细节、8 个攻击向量、消融实验与三类反复出现的漏洞模式,并提炼出对 Agent 安全研究的可迁移方法论。

August 13, 2026 · 12 min

从DeepSeek到Kimi K3,中国开源模型如何逼出黄仁勋的'开源联盟'

DeepSeek V4 Pro登场,中国开源模型连续逼近前沿能力,迫使黄仁勋牵头组建美国"开放安全AI联盟",Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI"开源"到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别,以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。

August 13, 2026 · 1 min

哲学到底是精英的表演,还是每个人都该追问的事?毕英杰与老蒋的两场跨洋对话

一个辍学创业的哥大CS全奖生,为什么在二十岁那年转向哲学?老蒋(视频博客博主)与毕英杰(哲学学者/自媒体创作者)在一年内展开两次对话,从"哲学是不是精英阶层的表演"出发,聊到模仿欲望、认可理论、AI时代的意义危机、中国教育体系的助推火箭隐喻,以及年轻人为什么越来越讽刺。这期对话的核心张力在于:一个"过得太好"的人到底有没有资格谈哲学,以及哲学的抽象到底是一种深刻的概括,还是一种逃避现实的狡猾。

August 13, 2026 · 1 min

在算力最多的地方做世界模型:对话英伟达Cosmos掌舵人刘洺堉

英伟达研究副总裁、Cosmos Lab负责人刘洺堉的4小时深度访谈。从GAN到Diffusion到世界模型的20年研究者之路,到Cosmos 3为何将语言/视频/音频/动作统一进单一模型,到"模型竞争不是零和游戏"的Low Ego哲学,再到黄仁勋的第一性原理决策与"不裁员"文化。他认为模型能力终将收敛,真正决定胜负的是生态整合;他不想击败任何人,只想帮助Physical AI整个领域成功。

August 13, 2026 · 1 min

论文工厂开进直播间,学术打假博主与评价机制的拉锯

老蒋对话学术打假博主"耿同学":论文工厂已产业化到直播间标价售卖,医生成最大买家群体;评价机制"唯论文"是系统性痼疾,纵向与横向经费存在鄙视链,产学研深度脱节;大环境上中国科研正从堆论文数量转向产业转化阶段,科研经费已超美国但产出质量未跟上,大国竞争要求学术环境先突破;打假方法论是"概率低于一亿分之一反复出现"叠加AI交叉验证;耿同学自诩"大型自私",认为做好事的收益应被制度化,并称已与教育部建立合作。

August 13, 2026 · 1 min

【每日AI前沿追踪】2026年08月12日 核心技术与产业动态速递

Agent自进化从单轨迹走向跨谱系比较进化,测试时强到弱能力迁移改写蒸馏范式,编程Agent指令遵循与技能安全性被首次系统量化,Grok 4.6与DeepSeek V4 Pro同日逼近Fable 5,Anthropic揭示多智能体系统三大系统性失效模式。

August 12, 2026 · 5 min

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents 精读

这篇来自华为与华中科技大学的 empirical study 首次系统地把 LLM Agent 的失败归因到「被加载的 Skill」上。作者借鉴差分测试思想,构建配对执行(有 Skill vs 无 Skill / 语义匹配 Skill),在 SkillsBench 与 SWE-Skills-Bench 上确认了 307 个技能诱导失败(125 功能失败 + 182 效率回归),并开发分类法驱动的 SkillTriage 归因工具。最反直觉的发现:看似相关的 Skill 比不相关 Skill 更有害——它让 Agent 错误实现或漏掉任务必需元素;效率回归的最大来源不是提示长度,而是「过度程序」(过度验证 67 例、重实现管道 30 例)。

August 12, 2026 · 7 min

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses 精读

Salesforce AI Research 联合 Notre Dame、UIUC(Heng Ji)提出强到弱推理时脚手架(Strong-to-Weak Scaffolding):用强 builder 模型为弱 target 模型自动构建推理时 harness,无需任何参数更新即可在四个 Theory-of-Mind 基准(3900 项)上将 GPT-5.4-mini 从 0.488 提升到 0.912(+0.423)。机制分析表明增益主要来自把不稳定的自然语言推理卸载为确定性代码(r=0.72),而非更长推理链或更多采样。这是对传统训练时蒸馏的一条互补路线,也直接印证了 harness 工程作为独立工程对象的价值。

August 12, 2026 · 9 min

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI 精读

Bang Liu 团队 38 页范式论文,提出继 Digital Agents(数字状态)和 Embodied Agents(物理状态)之后的第三种 Agentic AI 行动基底——Combodied Agents(以人的演化状态为核心)。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架,并把’保留并增强人类 agency’首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。

August 12, 2026 · 6 min

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents 精读

ByteDance Seed 团队提出的 Harness-IF 把「编程 Agent 是否真的在遵守指令」这件事第一次变成了可量化、可归因的规则级测量问题。它构造了 642 条原子规则的库,实例化出 60 个多轮编程任务,在 5 个可配置的「指令表面」(系统提示/工具描述/技能描述/项目文件/用户指令)上分别打分;更重要的是,它用 Against-Prior Accuracy(AP-Acc)把「模型本来就是这么做」的巧合从「真正遵从指令」中剥离出来——12 个前沿模型无一例外都在反先验规则上表现更差,平均落差 5.81 分。配套的 E0 冲突实验还揭示了一个反直觉结论:表面优先级并不服从提示深度,SP/PF/UI 同居首位,而工具描述和技能描述垫底。这篇精读从背景、定位、问题、解法、证据、根源、知识反推到通用灵感,完整拆解这项与 Harness 评估方向高度相关的工作。

August 12, 2026 · 9 min