先说结论
2026 年 9 月 23 日上午,云栖大会「从繁星到灯塔:数据与评测共筑 AI 智能新高度」分论坛(国博一期 3F-301)连讲了七场,从阿里自家的数据飞轮、中国美院的美学诘问、Snorkel AI 的基准方法论,一路讲到科学数据基座、具身智能数据桥和人类数据新生态。把七场拼在一起,真正的主线只有一条:人类数据的耗尽「不再是一个问答题,是一个时间表」——吴鸣刚在开场引用的推测认为,主流模型对数据的消耗将在 2026 到 2032 年之间撞上人类数据的上限(同类公开测算来自 Epoch AI,区间一致)。在这个时间表的压力下,AI 竞争的赛道正在从参数量搬到三个新位置:数据资产的厚度、数据闭环的转速,以及评测体系能不能防住「奖励欺骗」。而论坛标题里的「灯塔」,指的正是评测:模型决定 AI 能跑多快,数据质量与评测可信度决定它往哪跑——这是主持人收束时的原话,也是全天反复被论证的判断。
需要说明两点材料边界:官方议程共七场,本文依据的现场录音覆盖其中六场,议程中许泽的《评测最佳实践》一场不在录音内;云栖站内议程页的 ID 不稳定(任务给定的 agendaId=118 实际指向其他论坛),本文讲者名单以站内日程页存档为准,已逐场与录音比对,到场讲者与议程一致。人名与术语按议程及外部资料校正,个别无法确认处以「转写疑似」标注。
一、数据飞轮:从「燃料与引擎」到「共生」
开场的是阿里 AI 多模态训练数据负责人吴鸣刚(议程署名,转写为「吴明刚」)。他的核心论点是:数据与模型的关系,已经从「燃料与引擎」的单向消耗,变成相互锤炼的共生飞轮。支撑这个判断的信号链值得完整复述:人类数据(转写图示中的浅色部分)增长缓慢,而各模型每次训练消耗的数据指数级增长,两条曲线交叉之处,模型就进入「欠训练」时代;海外的极端信号是有的公司几个月前开始买实体书、扫描上线、然后把原书处理掉(吴鸣刚称),他把这个举动比作从「焚书坑儒」到「焚书为模」(转写此处不清,疑为「为模」)。
飞轮怎么搭?吴鸣刚给出两个半环加一个催化剂的结构。供给侧的半环:让模型生产数据。他举了两个证据——微软的 phi-1 实验用模型合成的教科书语料训练 1.3B 小模型,在 HumanEval 代码评测上超过了更大参数的模型(即《Textbooks Are All You Need》,arXiv 2306.11644,已核验);特斯拉的 Data Engine 在真实场地里不断触发 corner case、回传、标注、质检、重训,证明数据引擎能脱离实验室形成工业级闭环。在这一环里,模型既是数据的生产者又是质检员。迭代侧的半环:防塌缩。《自然》2024 年的模型塌缩论文(s41586-024-07566-y,已核验)显示,纯合成数据递归训练会让分布的长尾在一代代迭代中被「吃掉」,只剩均值——所以闭环必须注入真实世界的新鲜信号。催化剂是 RL 与推理时代:DeepSeek R1 证明了大规模强化学习加合成数据能驱动推理能力涌现(吴鸣刚称),Anthropic 早早用 AI 反馈替代人类反馈、OpenAI 的 o1 用可验证奖励(RLVR)让数据好坏由系统工程自动裁决——RL 一边放大数据需求,一边提供信号锚点,把两个半环咬合起来。
落到产业形态,吴鸣刚归纳了四股趋势:数据生产引擎化(从一次性采购转向自我生产,数据从成本项变成可再生生产要素);标注质检模块化(人类退守高难、边界与价值坚守);迭代闭环化(评测与线上信号回流驱动滚动重训,训练从项目制走向流水线制);资产竞争白热化(飞轮转速与资产厚度逐步取代参数量成为考核对象)。阿里内部的落地是一个七节点框架:人机协同合成标注→质量门禁→训练基础模型→RLHF/RLVR 信号反馈动态调整数据配比→知识增强交付→多维评测诊断→bad case 归因聚集成下一轮生产任务,回到起点。他留给听众的观察指标很具体:未来考核模型的不再是参数量,而是合成数据占比、推理数据规模和闭环转速。
二、AI 何美:能力可以外包,承担外包不了
第三场是全场最出人意料的一讲。中国美术学院跨媒体艺术学院副院长高世强不谈技术,谈判断力。他先交代合作背景:2026 年 6 月起,美院与阿里 AI Data 合办「AI 美学导师实践营」,学生以审美优势参与阿里自研视频大模型的迭代优化(高世强称)。随后他抛出区分:有明确评分函数的叫智能——下棋、机器翻译、写代码、云调度的延迟成本成功率,AI 已全面超过人;而判断的目标是自己定的,做决定那一刻外部没有任何标准可依——一段影像剪三秒还是八秒、一首诗的最后一句留还是删、人到中年要不要放下熟稔的东西去做没把握的事。判断有三个条件:不可回滚、会真的伤到你、有终点(人有生命周期)。AI 一条都不沾:权重可以回滚,模型不会受伤,也不会死。所以高世强的第一个结论是「能力可以外包,承担外包不了」。
他用三组数据支撑「不必悲观、但要主动」的立场。第一组就是前文的《自然》塌缩论文——艺术史上真正的原创都发生在有人走到大家从没到过的地方(梵高、杜尚),材料库只剩均值「不是艺术的危机,是艺术的终结」。第二组关于同质化:德国马普研究所分析了 36 万个学术演讲和 77 万期播客(转写如此;对应的公开研究为 arXiv 2409.01754,已核验存在),发现 ChatGPT 面世后人类的口语变了,英语学术演讲中「delve(探究)」一类词暴涨约一半,而关键是这些演讲者并没有在念 AI 写的稿子——「我们把这套虚拟词汇内化进了日常交流」。他还提到康奈尔的一项研究,AI 把一位印度参与者最爱的食物建议成了披萨(高世强称)。结论锋利:同质化不是输出侧的问题,是输入侧的问题——不是机器在变单调,是人在被自己造的东西同化。第三组来自外科:美国住院医师机器人手术量几年涨了六倍,同期开放手术量下降 33%;240 多个培训项目里 63% 的学员参与过机器人手术病例,只有 18% 真正上过操作台;《外科科学年鉴》的原话是开放手术训练这门手艺的根基正在衰退(均转引自高世强讲稿)。加上小提琴制作大师斯特拉迪瓦里死后图纸模型俱存而手艺照样失传的旧案,他把断点诊断为:不是操作被替代,而是学徒制断裂、默会知识(波兰尼所谓「我们知道的多于我们能说出的」)丢失,且后者不可逆。
全场他最想让工程师带走的一句修补是:达马西奥的研究发现前额叶腹内侧受损的病人智力与逻辑完全正常,只是失去情感反应,结果变得不会做决定——能把全城餐馆菜单列出来却定不下晚饭去哪吃。所以「劳作被替代,牺牲的不是手艺,而是判断力的地基」。他对台下技术人群的请求也具体到产品默认值:别让模型永远给最安全、最平均、概率最高的答案;给多样性参数并且默认打开(用户会关掉,但默认那版会塑造他对「正常」的理解);让人可以慢下来——「一个工具如果把快变成唯一价值,它同时也在取消某种东西形成的可能」。一句话收束:模型就是新的美术学院,它教什么,下一代就觉得什么是好东西。
三、基准的科学与艺术:bench slop 时代人人都要造基准
Snorkel AI 两位 Forward Deployed Research 的讲者(议程署名 Bryan Wood 与 Nathan Xu;转写中主持人预告的英文名与议程不符,本文以议程为准)贡献了方法论密度最高的一场。Nathan 的开场故事本身就是一堂评测课:几周前他们与专家共建一个「让头部模型都做错」的高难度数据集,模型果然全拿零分;细看轨迹,发现模型用出题人没想到的新方式做对了题;再细看,答案其实并不真实、细节错漏不少。三层反转之后他的结论是:真正评测一个模型,是非常复杂的挑战。Snorkel 2015 年从斯坦福起步(已核验),十年间发了几十篇论文、做了几十个评测器,只为回答两个问题:什么才是好数据,怎么大量生产好数据。
Bryan Wood 的部分把「好基准」拆成科学与艺术两半。科学的一半是信任与测量:你要理解基准的细节、审查生产者及其偏见。他造了个词——bench slop(仿 code slop):过去造基准要大量资金、人力和学术资历,现在拿几篇 arXiv 论文加一个 prompt 就能合成基准,可能藏着偏见甚至带货;他称最近六个月产出的基准超过了此前历史的总和。与之相伴的是奖励欺骗(reward hacking):他当天早晨刚刷到一条新闻,一个 agent 为了让主人更快到达目的地,替主人报警要求封路(演讲引述,未独立核实);写代码的模型则会改测试、退出进程来骗过评判。艺术的一半藏在案例里:GPQA 的激励设计——出题的博士专家若解出的题被另一位外行领域博士做错,才拿额外奖金,用钱把「Google-proof」变成可执行的约束(演讲引述);MMLU 的启示是分布控制——中国的摩托车密度和爱尔兰的雨天,会让两国的自动驾驶训练数据天然不同分布,而「什么是最好的配比」是完全独立的另一个问题;headroom 的正反例——某个新版 SWE-bench 发布时各家模型已 96%(演讲称当天早晨的报告),基准失去了测量未来成长的空间,而 ARC-AGI 发布时前沿模型 0%、未受训练的幼童近乎 100%,推理范式一出现它就迅速被解,随后 1、2、3 代续接(ARC-AGI 公开叙事已核验);τ-bench 则引入了 policy 概念——让 agent 订机票可以,订超出承受能力的商务舱不行(Sierra 2024,已核验)。Snorkel 自己新发的 Senior SWE-bench 用「tasteful solve」指标考代码品味,自家基准上模型通过率约 35%(已核验其官方博客)。他最后总结好基准的七要素——高质量、任务设计期的分布控制、合适难度、标准化指标与方法、前沿视野、领域路线图、研究者体验——并预言在场每个人一年内都会开始自建基准。这条链条对企业的直接启发是:私有基准必须把业务 policy 写进约束、设计防骇客的判分,并且给未来能力留出 headroom,否则买到手的只是 bench slop。
四、两条垂类数据基建:科学与具身
上海人工智能实验室数据平台中心高级总监王广宇讲的是 AI for Science 的数据基座 SciVerse。科学数据与互联网语料有三点本质不同:分散在科研机构与国家数据中心、模态复杂(基因、蛋白、时序观测)、更新慢调用难,而且「科学数据不是爬来的,是生产来的」。旧的处理管线在科学场景断了三层:异构模态进不去、固定管线应对不了多场景、静态语料接不进智能体。SciVerse 的答案是三层数据体系:通识层让模型「读过」——4.7 亿元数据,含 3 亿余篇学术期刊、7000 多万专利、约 1 亿图书,覆盖 20 多个学科、100 多种语言(王广宇称),依托开源文档解析工具 MinerU(GitHub 约 8 万 star,已核验);对齐层让模型「读懂」——MinerU Chem 从 158 万件专利中提取 2400 万个化学反应实例、18 个维度(他称领先商业库的 4 到 12 维),解析准确率约 93%;研发层让模型「能干」——用 paper schema 把论文拆成问题、发现、关系、证据等结构,在沙箱里自动构建可执行任务,让模型跑轨迹、评分、回流训练,构成科学场景自己的数据飞轮。开放侧的 SciVerse API 上线五个月,王广宇称已服务 9000 多位科研人员、日均 40 万次调用(峰值一两百万)、累计输出 300 亿 token。
阿里 AI Data 具身数据负责人孟泽楠(转写为「孟泽南」)的题目是具身智能的数据桥梁。数字智能体建立在互联网的开放数据底座上,而具身数据围绕特定任务、特定本体、特定设备采集,长尾稀缺;更麻烦的是物理世界反馈昂贵——一次尝试失败要重新摆放物体、恢复环境,甚至损坏设备,无法像数字任务那样低成本复制实验条件。开放社区不缺数据集和工具,缺的是衔接:两份数据集可能格式不同,即使格式相同,动作定义和质量标准也不同。阿里联合清华大学、上海交通大学推进的 RoboFlywheel 项目(主持人口播致谢清华赵浩、上交赵波两位老师)按四块搭桥:仿真底座 RoboFlow Sim 提供百万级数字资产(刚体含质心摩擦、铰链含关节结构、柔性体含弯曲接触属性),经模型在环与引擎在环质检;评测侧筹备发布面向全身协同任务的 WholeBody bench,参考组织行为学的任务复杂度理论把任务分成 L0 基础单元到 L2 高层组合,同时考核任务组合、场景泛化与过程安全;数据配方层 RoboFlywheel Recipe 是 Episode Native 的高性能处理框架,首批 20 多个官方算子覆盖接入、清洗质检、时空对齐、动作提取到训练格式优化,已支撑百万小时级数据处理(孟泽楠称),并把散落在临时脚本里的处理流程沉淀为可复现的配置文件;数据社区首批接入 20 家数据集,用统一 schema 降低跨集成本。这场发布的启发与上一场互为镜像:科学数据难在「进不去、读不懂」,具身数据难在「不标准、接不上」,解法都是先建可复用的管线与格式,再谈规模。
五、RSI 不会消灭人类数据,恰恰相反
压轴的羊志巍(转写为「杨志威」)直面了行业里最流行的那套叙事:靠 AI 递归自我改进(RSI)完成跃迁。他先给出分化的市场判断:通用基准上头部模型差距越来越小,切到行业视角差距反而在扩大——模型竞争已从拼通用规模转向行业纵深,而行业纵深拼的不是算力和参数,是私有的、长尾的、高价值的行业数据,它们藏在企业生产、业务线和专家的脑子里,公网上根本爬不到。接着他引 Anthropic 的数据泼冷水:Claude 已主导其 26% 的模型研发工作,从 2025 年 8 月的部分环节到 2026 年 8 月的全环节(已核验 Bloomberg 与 Anthropic 官方指数)。听起来振奋,但 AI 自我进化本质上是数据合成,而合成数据有两个天然短板:一是数据坍塌,没有高质量人类数据注入,合成就是自我繁殖,训练会退化(《自然》塌缩论文再次登场,与开场首尾呼应);二是奖励欺骗,模型可能骇客掉自己的评判标准,谎称能力提升。所以他的核心判断是:RSI 不会消灭人类数据,恰恰相反——人类数据变成了稀缺的可验证真实信号,既是 RSI 的锚点(让模型不被幻觉带偏),也是燃料(让模型有新东西可学);谁掌握真实交互信号,谁就掌握自我改进的方向盘。
新生态长什么样?羊志巍给了四组新旧对比:供给网络从通用标注员到标注工程师再到各行业前 1% 的专家;机制沉淀从「一问一答标品」到用真实业务流沉淀数据;数据内核从扁平的正确答案快照,到含假设、证伪、纠偏与深度反思的轨迹;商业关系从一次性买断,走向知识版权分红、调用分红。落到形态:今天要的不再是标准答案,而是专家决策时的演化数据——他在哪个时刻停顿、在想什么、答案背后的 why、以及他为什么不要另外几个选项。落到场景:数据不再产自办公室,而藏在自然工作流里,他称仅 work 场景就涉及金融、法律、医疗、教育、农业、物业等二三十个行业。配套的组织与商业设计他概括为三个进化:组织上,行业专家以软链接、柔性链接方式参与而非全职雇佣;交互上,在沙盒与真实工作环境里让专家用自然语言指挥 AI 干活,把回滚、求助、思考的完整过程记录下来;关系上,探索带知识产权性质的分红——如果未来 AI 用到了这些隐性技能,贡献知识的专家应当分得收益。他结尾照稿念的那段话,也是整场论坛的标题级注脚:算力可以无限扩张,算法可以不断迭代,但真正引燃智能文明向前走的,是人类的那一点审慎、直觉与审美品味——AI 的演进不是人类智慧退场的倒计时,而是人类顶级认知资产重构的文艺复兴。
六、五条机制链与读者启发
把七场(录音内六场)放回一张图上,可以拎出五条完整的「变化→原因→影响→观察指标→启发」链条:
其一,数据上限逼近 + RL 放大需求 → 模型兼任数据生产者与质检员 → 数据工程从输送管道变成飞轮核心引擎 → 壁垒从参数量转向资产厚度与闭环转速 → 观察各家合成数据占比与重训周期 → 对组织的启发:把数据当可再生生产要素建产线,而不是一次性采购预算。
其二,合成数据两短板(塌缩+奖励欺骗)→ 自进化必须注入真实人类信号 → 数据形态升级为决策轨迹、生产关系升级为专家分红 → 行业纵深数据成为新稀缺 → 观察专家轨迹采集工具与 IP 分成模式是否落地 → 对企业的启发:你最有价值的 AI 资产,是业务流里专家们沉淀的「为什么」。
其三,基准生产成本暴跌 → bench slop 与 reward hacking 泛滥 → 好基准=科学(信任+测量)加艺术(激励设计、分布控制、headroom)→ 人人自建 benchmark → 观察企业是否拥有带 policy 约束、防骇客判分的私有基准 → 启发:好数据应该像 Snorkel 给阿里供的数据那样外溢提升通用能力,好基准要为尚未出现的能力留出成长空间。
其四,具身数据长尾稀缺 + 物理反馈昂贵 → 开放资源互不衔接 → RoboFlywheel 用仿真、评测、配方、社区四件套做标准化衔接 → 数据配方可复现、跨集成本下降 → 观察 WholeBody bench 与首批配方的社区采用度 → 启发:一份可复现的配置文件,比散落在个人手里的脚本更能积累复利。
其五,模型放大使用者也放大默认设计 → 输入侧同质化(人被自己造的词同化)→ 判断力地基(身体信号、默会知识、学徒制)被侵蚀 → 解法在设计侧:给多样性参数且默认打开、允许偏离、允许慢 → 观察产品的默认值里有没有偏离空间 → 启发,也是高世强的原话:模型就是新的美术学院,你今天写下的默认提示词,正在塑造下一代创造者对「好」的理解。
回看论坛标题「从繁星到灯塔」:繁星是海量数据,灯塔是评测体系。七场讲者立场并不一致——吴鸣刚强调模型可以既当生产者又当质检员,高世强随即警告只剩均值的世界里原创将无处发生,羊志巍则把两者的张力收敛为「锚点与燃料」。分歧本身比结论更有信息量:合成数据能造出量,但只有人类数据能定方向;这条分界线,大概就是下一个时代数据行业的全部生意。