先说结论

这期硅谷101(E253)请来了两位身处漩涡中心的人:Scale AI 研究总监何允中(负责后训练与评测研究,观点均为个人立场)和加州大学伯克利分校博士后孙一铀——他是 Agents’ Last Exam(ALE)项目的牵头研究者,这个出自 Dawn Song 组的基准试图用真实职业工作流考倒所有前沿 Agent。两人一个是"卖数据的",一个是"出题的",恰好覆盖了这期节目的核心问题:数据公司到底在卖什么,评测和卖数据之间那条模糊的界线在哪里。

背景是估值的疯狂:据 Forbes 和 TechCrunch 报道,AfterQuery 今年 4 月 A 轮估值 3 亿美元,9 月新融资推到 32 亿美元,五个月十倍,成为 YC 历史上从创立到独角兽最快的公司;Mercor 去年 10 月融资估值 100 亿美元;Meta 2025 年 6 月以 143 亿美元入股 Scale AI 时,后者估值约 290 亿。但比估值更重要的是三个结构性判断:评测的权威性天然通向数据生意,但两者角色混同就会毁掉评测本身;数据行业的瓶颈正在从"标注产能"转向"采购能力";激励机制的设计决定了数据质量的上限——这是比模型架构更朴素、也更难的问题。

数据公司在卖什么:从打标签到"TA 改卷"再到盖考场

过去提到数据标注,想到的是给图片打标签、给模型回答打分。何允中把这几年的演进讲成了一条清晰的链条。

先是 rubric 数据。强化学习需要一个可验证的信号:数学和代码有客观标答,选择题对错一目了然;但医疗、金融这类领域,答案存在却不结构化——“就像历史考题有标答,但每个人写法都不一样,没法做模式匹配”。解法是 rubric:让专家把"什么算好答案"提前写成打分规则,然后"让一个 TA 拿着教授写的规则来改卷子"。因为规则是专家预先写好的,TA 不需要特别聪明——这就是大模型数据体系里的 weak-to-strong supervision:用弱模型监督强模型,成立条件是专家必须把脑海里的知识先写下来。何允中一年多前加入 Scale 时 rubric 还很新,如今他判断"静态的、纯知识类的 rubric 需求在变小"——不是因为做完了,而是行业往前走了。

往前走的一步是 RL 环境(environment)。当模型从回答问题转向动手干活——操作软件、执行任务、反复尝试——光有打分规则不够了,还需要一整套"考场":任务定义、工具、执行沙盒,以及多样的验证方式(程序化检查、rubric、人类偏好)。孙一铀的 ALE 就是这个逻辑的产物:把 vibe coding 的发展路径推广到"vibe everything"。他的观察是,coding 之所以进步快,正因为容易验证、benchmark 密集,大家为了刷榜往里砸资源——“只要你刷的是有益的分、有益的题,模型带来的提升对人的日常工作就是实打实的提升”。

这解释了新一代数据公司的机会:整个行业从"找人标注"过渡到"交付一整套环境",环境需要大量工程工作,擅长合成技术栈的小团队(如何允中提到的 Bespoke、Snorkel)能在短时间交付大量合成环境。据小宇宙节目页,Bespoke Labs 今年 7 月种子轮加 A 轮合计融资 4000 万美元。但何允中提醒:这一波成立的前提是今年的主题在卷代码——软件行业开放、资料公开、做数据的人自己也懂代码。再往外走,垂类领域的环境就复杂了。

值得留意的还有两家嘉宾提到的公司基因差异:Mercor 做招聘起家,靠 AI 面试快速筛出足够量的专家(TechCrunch 报道其 CEO Brendan Foody 称专家时薪最高 200 美元、每天向合同工支付超 150 万美元);Scale 从众包网络出身,优势在质检经验——“不光在数据上,也在人上”。何允中还提到一类新玩家:一些做模型的公司暂时没赚到钱,却投入大量精力做素材,“顺便做起了素材生意”。

出题人的权威,和一条不能碰的红线

节目最有信息量的部分,是两人对"评测与卖数据的关系"的坦率讨论。

何允中把原理讲得很直白:评测体现的是"模型距离理想状态的 gap",而当大家都在刷某个维度时,“构造 benchmark 的人对这个领域认识比较深,自然就获得了一定卖数据的权威性,大家会比较相信你手上卖的数据——这个生意就这么产生了”。Scale 自己就既做评测(HLE、SWE Atlas)又卖数据。外部核验补充了一个播客没提的细节:ALE 的资助方包括 Snorkel AI(通过 Open Benchmarks Grants 计划),而 Snorkel 本身也是数据公司——评测机构与数据商的利益关联比节目中呈现的更深。

但两人都把"卖评测数据"划为绝对红线。何允中说他私下听说"有一些数据公司踩了这个红线,把自己在做评测的数据拿去卖"。后果是双重的:毁掉自己的 benchmark,也毁掉别人的模型。孙一铀的表述更有框架感:benchmark 面向未来,数据面向现在——benchmark 告诉模型公司"还有什么没解决",数据解决 benchmark 产生的需求。在他看来 benchmarking 不一定是贬义词,前提是榜单贴近真实用户体验。

数据污染的另一面是评测自身的质量问题。主持人提到 OpenAI 今年 2 月停止报告 SWE-bench Verified 分数,理由是测试缺陷和数据污染。外部核验确认:OpenAI 在 2026 年 2 月 23 日的官方博客中披露,对 138 道 o3 反复失败的难题审计发现 59.4% 存在实质性缺陷(测试过窄、检查了题目没要求的功能等),且所有被测前沿模型都能仅凭 task ID 逐字复现人类编写的"金补丁"——即训练时见过这些题。孙一铀补充了他观察到的另一层:SWE-bench 这类数据的剩余失败很大程度集中在题目本身的脚本过严或不可解问题上。OpenAI 的建议是改用 Scale 发布的 SWE-bench Pro——注意这条建议本身又把裁判权交回了数据公司手里,生态的环环相扣可见一斑。

何允中还讲了一个榜单随机性的小案例:Scale 分三阶段推出 SWE Atlas 套件(Codebase QnA、Test Writing、Refactoring,共 284 个任务,基于 SWE-Bench Pro 同源生产仓库),结果最简单的 QnA 先被 Artificial Analysis 收录,需求立刻暴涨——“我们花了那么多心血做更复杂的 benchmark,结果就是因为时间关系、某一个 lab 碰巧用了”。他借此提醒:tech report 上看得到的榜单,背后有相当随机性;看不到的评测,可能也有人在默默用。至于什么样的评测值得刷,何允中的标准有两条:要么反映核心认知能力(提升后各 benchmark 一起涨,而非只涨一个),要么贴近在意的真实场景(哪怕它测的主要是 harness 而非模型本身)。

真正的瓶颈不是标注,是采购

谈到垂直领域,何允中把数据生意拆成两段:采购(把原材料买回来)和加工(标注、做成环境)。他的判断是"采购正变得越来越复杂",甚至私域代码仓库的采购"谁能解决好就是巨大优势"。

孙一铀给了两个具体案例。其一是 ALE v2 尝试收集游戏开发任务时,发现 Steam 上一款名不见经传、几千玩家体量的 MOBA 游戏,源码要价 200 到 300 万人民币一条(嘉宾说法,未独立核验)——“哪家数据公司或做 benchmark 的都没有这个财力”。其二是生物领域:他按 Nature 的子学科分类把树展开到第三级,约 3000 个节点,而市面上已有的 Life/Bio benchmark 覆盖"可能 5%、10% 都不到"(嘉宾统计口径)——连成型的覆盖性 benchmark 都不存在,更别说对应数据。

何允中补充了采购的深层困难:芯片设计环境里的商业软件授权、DevOps 需要的整套 AWS 模拟器、医药领域敏感的病例数据。医疗数据"谁能拿到大量病例,谁就非常有优势"。他甚至观察到私募股权的新玩法:以前买公司重组提效再卖出,现在多了一层——买来的公司数据还能挖出来卖钱。

这引出他对数商核心能力的判断:长期拼的是研发。“一个好的数商最后解决的是研发问题,像软件公司一样,提前投入未来大家需要的东西,赚到钱再投入下一个。“他有个"暴论”:lab 未必有解决数据问题的最好基因——合成数据本该是 lab 后训练的本职,但今年懂行的人在外面把数据核好再卖回去照样有市场;采购上 lab 甚至有利益冲突,“一方面把 FDE 派到企业里,另一方面又有人搞企业数据,我作为企业是不放心把数据交给你的”。而 lab 的 deadline 很死,“有人把行业问题研究清楚了问你要不要,大家通常都会看一眼”。

一个反向的锚点是模型公司的自给倾向:主持人问模型越来越强、内部造数据能力越来越强,外部机会是否在收窄。何允中的回应是"从第一性原理看还有巨量问题没解决,但只盯手上的工作一定越来越难”——他举数学为例:以前引用奥数课本就能批量造数据,这类数据现在基本零价值。孙一铀则从估值角度补了一刀:数据生意很难有传统公司的杠杆,“没法躺在积累的用户上吃老本,必须持续迭代,因为模型迭代速度太恐怖”。

激励决定数据质量的上限

节目最后回到一个贯穿始终的问题:怎么让专家真正交出高质量的东西。

ALE 的答案是 authorship:提交任务被采纳就能进入作者列表。这个机制在学术界意外地好用——孙一铀说他们收到的很多数据是无偿的,因为"专家不求钱,图的是大家一起把事情做好,图的是个名"。对照 Mercor 官网上制造业工程师一小时一两百美元的定价,他点破了关键:奖励机制不一样,能吸引的人不一样,上游就不一样。

但声誉激励同样会被博弈。孙一铀坦承 ALE 真实发生过造假:有人为了进作者列表,起 agent 合成了一堆乱七八糟的数据,“有些肉眼看出是编的”。而最难检测的不是公开数据的污染(“直接问 agent 都能找到,还好检测”),而是编造的执行数据——比如根本没跑过的化学模拟,编出一套似是而非的结果,“没有几个月根本查不出来”。暴露往往要等到所有 agent 能力远超问题本身时:所有答案高度一致、却与真值不符——这个周期非常长。让另一位专家验证?成本极高,且验证者自己也有偷懒作弊的动机。“众包 benchmark 为什么难做?就难在这里,人性是非常复杂的。”

何允中把这个问题上升为研究课题:长远目标是"把人类都蒸馏干净",怎么设计让目标对齐的激励机制,“是一个巨大的 research area”。孙一铀自己设想的方案是 proof of work 式的验证:要求提交完整工作流程录像、达到一定时长——“你给我合假数据,也要把每一步都做出来,那他就没有那么大的动机造假了”。

读者启发

把这期节目串成几条可带走的判断:

看评测先看利益结构。 出题人、判卷人、卖题人三种角色集中在同一机构时,权威性是杠杆也是风险——HLE 团队自己也在做数据生意,ALE 的资助方里有数据公司,OpenAI 弃用一个 benchmark 后的替代建议又指向数据公司的产品。这不必然导致腐败,但意味着读榜单时应该把利益链当作背景信息。

区分"面向未来的题"和"面向现在的数据"。 判断一个 benchmark 值不值得投入,孙一铀的框架很实用:它测的是核心认知能力还是犄角旮旯的场景知识?它贴近谁的真实体验?刷上去的分数对谁有用?一个领域只要 benchmark 与真实工作流对齐(如 ALE 对齐 O*NET 职业分类、用隐藏参考答案防泄漏),刷分就是能力进步;不对齐,就是 SWE-bench Verified 的结局——分数不再反映真实能力,出题人自己宣布作废。

数据行业的护城河在迁移。 从标注产能(质检、众包管理)→ 专家网络(招聘基因、时薪定价)→ 合成工程(小团队风口)→ 采购与版权(垂类环境、私域数据、商业软件授权),再到何允中说的研发 flywheel。判断一家数据公司的持久性,看它解决的是哪一层的问题——纯合成层的门槛正在快速降低。

激励设计是被低估的硬问题。 “把人蒸馏干净"的前提是设计出让诚实比作弊划算的机制:小时工、authorship、proof of work 各自吸引不同上游、暴露于不同造假模式。这个框架不限于数据行业——任何依赖众包贡献的系统(开源、百科、内容平台)都面对同一组约束。

最后留一个节目没有回答的问题:当 RSI(递归自我改进)成为今年的 buzz word、训练任务长到"GPU 上模型训模型、一跑几天一星期”,何允中坦言训练方式"还没有共识"。数据行业服务的是今天的训练范式,而范式本身还在移动——这也许是这个野蛮生长的行业唯一确定的事。

本期播客:硅谷101 E253《谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长》,主播 Yiwen,嘉宾何允中(Scale AI)、孙一铀(UC Berkeley)。文中外部核验来源:Forbes/TechCrunch(AfterQuery、Mercor)、OpenAI 官方博客 2026-02-23(SWE-bench Verified)、Berkeley RDI/arXiv:2606.05405(ALE)、Scale 官方博客(HLE、SWE Atlas)。未标注来源的观点均来自嘉宾口述,其中 MOBA 源码要价、生物学科树覆盖率统计为嘉宾个人说法。