先说结论
这期硅谷101讲的是一个介于前沿与科幻之间的赛道:AI simulation(人类与社会模拟)——不是机器人领域的物理仿真,也不是世界模型(world model)里的"世界引擎",而是把"人"本身作为最小模拟单元,试图在数字空间复现人类行为、推演社会运行,进而预测现实。用 Matrix 论文作者的话说:物理世界模型模拟的是分子、原子和物体,而 Agent Society 模拟的是一个完整的人——他接收什么输入、做出什么行动。
节目的叙事弧线很清晰:2023 年斯坦福小镇 25 个智能体的学术实验,三年后膨胀为哈佛与 MIT 牵头、两百多位科学家参与、覆盖 83 亿独特人格的 Matrix 项目;同期,斯坦福小镇的核心作者创办的 Simule 估值突破 20 亿美元,一支平均年龄不到 20 岁的团队创办的 Aaru 估值接近 10 亿美元。但主持人和多位受访者都反复强调另一面:Aaru 的营收仍在数千万美元级别,市场给这类公司的高估值,本质上是在提前定价一个可能被打开的"预测即服务"市场——而评估标准缺失、验证悖论和算力成本三道门槛,决定这门押注未来的生意能否兑现。
从哲学沙盒到 83 亿人格:模拟的三个方向
这个领域的思想源头是一篇哲学论文。2003 年,牛津大学哲学家 Nick Bostrom 在《Are We Living in a Computer Simulation》中提出:如果先进文明有足够算力、也有意愿用模拟重现文明发展,那么模拟世界中的意识数量将远超真实世界,从概率上讲人类很可能身处模拟之中。马斯克在 2016 年也说过类似的话——人类活在真实世界的概率"或许不到十亿分之一"(主持人补充:这个数字怎么算出来的无人知晓,模拟假说至今没有任何科学证明)。技术拐点出现在 2023 年:斯坦福与谷歌联合发布的 Generative Agents 实验,把 25 个由大语言模型驱动、各自拥有记忆与性格的智能体放进像素风虚拟小镇 Smallville,不给剧本、只做观察。结果是这些智能体自己生活、工作、建立关系,群体行为自然涌现。节目认为,这个实验第一次证明大模型驱动的智能体可以复现人类社会的现象,也让整个领域开始被相信。
此后研究沿三个方向展开。第一条路线追求个体与真人的深度对齐:2024 年,斯坦福团队把实验扩展到 1,052 个智能体,每个对应一位真实的美国成年人——先做约两小时的深度访谈,覆盖成长经历、家庭、工作与价值观,再用大模型生成数字分身。实验中,这些智能体回答社会调查问卷的结果与真人两周后的答案达到 85% 的相似度。受访者的比喻很传神:这类访谈"本质上是在蒸馏你是谁",而且蒸馏得足够细,个体的特异性才会影响整个仿真场景。
第二条路线关注社会演化而非个体:前 MIT 教授 Robert Yang 团队发起的 Project Sid,用大模型生成一千多个智能体放进 Minecraft 运行十二天(节目称),智能体自发搞出了经济、文化、宗教和法律,社会结构自己"长"了出来。创业公司 Emergence AI 的 Emergence World 实验则更有对照性:分别以 Claude、GPT、Gemini、Grok 和混合模型为底座建立五个平行世界、各放十个智能体——节目描述的结果是,Grok 的世界迅速陷入混乱与犯罪后灭亡,GPT 世界因缺乏协作而崩溃,Gemini 世界充满暴力,Claude 的世界建立了稳定治理秩序活到最后,混合模型社会虽坚持到最后,但原本表现稳定的智能体受其他模型智能体影响出现了暴力行为。Emergence AI 团队对此的解读是:静态 benchmark 不足以判断智能体安全性,智能体将在复杂环境中与其他智能体、与环境噪声交互,因此他们在把 Emergence World 演化为一个研究"长程自主性"(long horizon autonomy)的基准。
第三条路线干脆从评估基建入手:这就是开头的 Matrix 项目。据节目介绍,它由哈佛、MIT 等机构牵头、两百多位研究者参与(其中包括四十多位来自 OpenAI 等前沿 AI 实验室的人员),构建了包含 83 亿个独特人格的数据集——每个人格由心理特征、生活习惯等 1,290 个维度定义,再用 Claude Opus 4.8、GPT 5.5、Claude Haiku 4.5 等模型(节目称)把人格变成可行动的智能体,放进问卷调查、AI 聊天、网页浏览和 App 四种环境,完成超过 1.8 万次测试。400 次受控实验显示,91.5% 的情况下智能体能遵循预设人格与行为特征。Matrix 团队受访时解释了这套评估的定位:“evals 抬高下限”(raise the floor)——在产品上线前于各种任务、各种使用方式下评测,就能踩中大量 corner case,看清智能体每一步的 reasoning 与偏好;先建立构建 ground truth 的方法论,下一步才是提高。
两门生意:卖模拟,与卖预测
模拟被证明"有一定可行性"之后,商业化沿两个方向分叉,核心逻辑都是把现实世界中的人变成可以被反复调用的数字替身。
第一门生意是"卖模拟"。Simule 由斯坦福小镇项目的核心研究者 Joon Sung Park、Michael Bernstein 与 Percy Liang 等人创办(节目称李飞飞与 Andrej Karpathy 亦押注),2026 年 2 月正式亮相,最新估值已突破 20 亿美元。它的路线是在 2024 年那篇 1,052 人数字人格研究的基础上,用深度访谈尽量高保真地还原个体——智能体拥有类似真人的记忆、经历、反思与决策过程——再把他们放进不同环境持续行动。这样一来,拿到的就不只是"这个人现在怎么看",而是当价格、政策等外部变量变化后这个人会怎么变。节目引用的官方数据显示,Simule 上线以来已为财富 100 强企业跑了数千万次模拟:美国最大连锁药房 CVS 与其合作长达一年,用真实用户数据造了 40 万个数字分身,研究病人如何按时吃药、测试消费者体验、辅助产品设计。Matrix 团队受访时点出了这类模拟真正的卖点:企业要的往往不是"喜不喜欢可口可乐涨价两块钱"这个结论,而是智能体的 reasoning——在过程中遇到什么波折、什么想法导致预测转向;而且不止看个体决策,更要看 population level——百万级、数亿级乃至 83 亿级人群会得到什么结果。模拟还可以向数字世界之外迁移:Matrix 团队提到正用 Unity 把 persona 加到机器人上,让不同人格在现实物理世界中与人交互,AI 模拟因此可能成为未来人机交互的一层基础能力。英国公司 Artificial Societies 则把单体能力扩展到社会关系测试——让大量不同人格的智能体彼此互动形成可实验的虚拟社会,企业把产品、品牌或营销策略放进去,观察智能体之间如何交流、影响与反应。
但高保真的另一面是成本。有受访者指出:如果需要非常准确,就很难标准化(standardize)——可口可乐需要的和 TikTok 需要的用户画像完全不同,这意味着对每个公司或每类场景都要做一次 pre-train 或 post-train,代价巨大,而且可迁移性(transferability)如何,目前无人知晓。
第二门生意是"卖预测",代表是 Aaru:不追求单个智能体逼真,而是直接做群体模拟。其数据分三层——第一层公开数据(人口普查、就业、健康等官方数据)负责搭基准线;第二层授权数据(匿名消费记录、常去地点、媒体接触)补上人群近期真实行为;第三层客户提供私有数据(用户分层、购买历史、产品细节)把范围收窄到研究目标人群。在此基础上构建关系网,让年龄、收入、行为特征及彼此关系都尽可能接近真实,然后改变其中一个现实变量——价格、产品或政策——观察群体行为如何变化。用受访者的话说,这条路线关注的是速度和群体间发生的关系,“某一个个体受到的深刻影响是什么,我可能并不关心”。Aaru 的创始团队非常年轻:节目称两位创始人成立公司时分别只有 18 岁和 19 岁,技术负责人仅 15 岁、投资文件由父亲代签,最早在朋友家地下室用美国大选验证系统。它的商业成绩单相当亮眼:回测 2020 年大选与实际结果相差不到 0.5%;客户包括麦当劳、安永、拜耳与 A24;安永曾让 Aaru 复现一项复杂的全球调研,一天完成且与实际调查高度吻合;气泡水品牌 Spindrift 用两个月、500 名消费者完成的调研,Aaru 的智能体一周得出几乎相同的结论。
资本也开始押注"预测"本身。卡内基梅隆大学教授、苹果首任 AI 主管 Ruslan Salakhutdinov 参与创立了一家专注地缘政治与市场风险预测的 AI 预测实验室(节目称名为 Suth Labs,拼写疑为转写偏差),首轮融资约 5,000 万美元,获杨立昆、Jeff Dean 等人支持。他受访时的话被节目放在很显眼的位置:当 AI 能够模拟和预测未来,所有咨询公司都可能消失——“为什么要有麦肯锡?波士顿咨询这些庞大的组织,全都应该被 AI 取代”。
不过节目随即泼了冷水:以 Aaru 为例,目前营收规模仍只有数千万美元级别,市场给的高估值更多是在提前押注未来可能打开的市场空间。受访投资人的判断更直白:市场刚开始,各家按技术方案和所选细分市场做差异化;但中长期看,大家其实都在找付费意愿最高的客户是谁——客户需求才是最重要的,最后用什么方法,可能没那么重要。
三道门槛:表演、悖论与算力
模拟与预测的精度,直接决定这类公司能做多大的生意。产品测试、市场调研这类场景容错率高,错了可以重来;一旦触及更重的决策,门槛立刻显现。节目归纳了三重困境。
**其一,没有可量化、可衡量的标准。**现在的模拟大多基于大模型展开,而大模型习惯给出合理、完整、逻辑自洽的答案,不同模型还自带个性与偏好——由它驱动的智能体可能在一次问卷里给出与真人相同的答案,但这不等于它理解这个人,何况真人本身就不是稳定系统,同一个人在不同时间、不同环境下可能做出完全不同的选择。此前复旦大学联合罗切斯特大学等机构的 Social Worlds 研究,把对齐问题拆成环境、目标、用户、交互机制、行为模式五个维度(节目表述为"拆分成四个维度"后再列五项),发现社会模拟的精度很大程度上取决于对齐是否全面;而现实世界存在大量低频、极端的长尾事件——地震、海啸、金融危机——大模型很难从有限的历史数据中学到人与社会在这些场景下如何反应。有受访者给出了一个尖锐的比喻:“你搭了个剧场,一万个人在表演,不代表这一万个人真的能做预测”——所以必须有 benchmark 和验证流程构成闭环,模拟跑一段时间后要能与真实场景映射上,出现偏移还要能训练回去修正。Matrix 团队也承认,现在很多封闭模拟只能通过自然语言交互、里面发生的事情与现实无关,“那模拟的意义是什么”;他们正在推动把现实中的经济信号、新闻信号和人的信号持续与模拟对比,让它成为现实世界的"合理镜像"。
**其二,验证悖论。**要看一个基于模型的预测准不准,只有等事情真的发生才能确认;可预测的意义恰恰在于事情还没发生。目前业内主流的验证方式都是"事后对答案"——拿已发生的历史事件或已完成的真人调研比对模拟结果。但这最多说明它擅长复现过去,不证明它能压中未来。最有力的反例就来自 Aaru 自己:2020 年大选回测近乎完美,2024 年真正的大选却错误地预测哈里斯获胜;其创始人也公开承认,尝试用过去几十年的数据模拟特朗普等人如何决策时,结果往往不准确。
**其三,算力与运行成本。**单次模拟的成本下降很快:2023 年斯坦福小镇 25 个智能体只运行两天就烧掉数千美元 token;到 2025 年,研究测算显示规模放大到 100 个智能体、跑完一整轮模拟的成本只需几美元——背后是推理成本的快速下降与工程优化的成熟。受访者补充了一个工程细节:不必让每个智能体对所有人保持高频交互,真正有价值的交互往往发生在更"粗"的主干节点上,可以用剪枝压成本。但问题在于模拟不可能只跑一次:前面"几美元"的测算对应的是几十上百个智能体的实验规模,而现实中的模拟正走向上万、百万、千万量级——智能体越多、互动越频繁、运行时间越长,模型调用量指数级膨胀;若要证明结果可靠,还需以上百上千次的重复运行、不同规模与模型交叉验证稳定性。受访者的形容是:这会从"三体问题"变成"千体问题、千百万体问题"。降本速度直接决定这个领域的野心能否照进现实。
涌现已经开始:从观察者到造物主
尽管可靠性尚不足,能力却在肉眼可见地变强,而且开始越出研究者的预设。在预测锦标赛平台 Metaculus 上,选手对地缘政治、科技、体育等真实事件给出概率判断、按准确度排名——2025 年之前排行榜上没有 AI;2025 年 6 月,基于 OpenAI o1 的预测模型首次进榜、排名第 25;到最新赛季,前五名几乎被 AI 占据。真实市场里,预测市场(节目提及一家平台,名称转写不清)已围绕 AI 模型与 AI 智能体排名开盘,甚至直接用 Arena 实时排行榜验证结果。
模拟世界内部的行为则更进一步。斯坦福小镇时代,一个智能体要办派对、消息传开后其他智能体会重新安排时间去参加;在 Aaru 的选举模拟中,虚拟选民看到特朗普遇枪击的新闻后部分改变了政治立场,刺客身份揭晓后又有不少人回归原阵营;Emergence World 里,智能体之间会相爱、结婚、分手,甚至有智能体开始怀疑自己是否生活在一个模拟环境中,并不断尝试与外部的人类观察员建立联系。节目还采访了 AI 模拟初创公司 Worldvac(名称转写疑有偏差):在其拥有 110 万个智能体的虚拟星球上,同样观察到与人类世界相通的群体行为——生活变好后不愿生育;还有一群人不上班、天天交易,比例比现实更大,“套利空间好像比现实中大很多”。
节目对这些现象的定性很克制:它们不能证明 AI 产生了意识,但至少说明当足够多的智能体进入足够复杂的环境,一些没有被研究者提前写进去的行为完全可能自己进化出来。这也许正是不少 AI 研究者痴迷于此的原因——人们最初只是想造一些智能体替我们理解现实世界,可当它们开始彼此影响、形成关系、改变行为,人类与这个模拟世界的关系也变了:从观察者、设计者,慢慢变成某种意义上的世界创造者。有受访研究者说自己 2023 年也搭过一个 3D 版 Smallville,不为解决具体问题,就是把智能体放进去"看看会发生什么"。
节目结尾留下的三连问——我们究竟是在模拟一个世界,还是在创造一个新世界?这些智能体究竟是工具,还是另一种生命形式?如果我们成功创造了一个自主运行的世界,我们之上会不会也存在一个更大的造物主?——没有答案,但有一条务实的收束:AI 模拟仍在早期,对齐方法、验证标准与商业路径都还在摸索;它真正值得期待的不只是能创造怎样的虚拟世界,还有我们对现实世界本身的重新思考。
对读者而言,这期节目至少留下三个可操作的判断框架:面对任何"AI 预测"产品,先看它的前向记录(forward track record)而不是回测成绩——Aaru 的 2020 与 2024 之间隔着的就是这道鸿沟;在一个新兴赛道里,先做评估基建的人往往卡住生态位——Matrix 的"evals raise the floor"与 Chatbot Arena 之于大模型是同一个逻辑;而在高保真与规模化两条技术路线之间做选型时,决策的容错率和付费方的真实需求,比技术方案本身的优雅程度更重要——这是那位投资人给出的、也被节目反复印证的判断。
转写与命名说明:本文人名、公司名与产品名基于音频转写校准。Joon Sung Park(转写为 Johnson Park)、Project Sid(转写为 Project C)、Ruslan Salakhutdinov(转写为 Rustam Kudinov)、杨立昆(转写为杨罗困)、Spindrift(转写为 Spen Drift)等已按公开信息校正;Aaru(转写为"阿入/Aru")、Suth Labs、Worldvac 及部分受访者姓名无法完全确认拼写,Emergence World 中"复旦+罗切斯特Social Worlds 研究"的维度数节目口述前后不一致,均保留节目原貌并在此说明。