导语

经济学长期沿袭"观察—解释—预测"的研究范式,从现象归纳理论、从数据拟合参数、从均衡推导结论。然而,牛顿那句"我可以计算天体的运动,但不能计算人们的疯狂"早已一语道破经济系统的根本特质——与受外部法则支配的物理世界不同,经济世界的状态转移由身处其中的异构决策者通过信念、策略与交互内生生成。这意味着传统经济学最缺乏的不是更精巧的拟合技术,而是生成式解释的能力:除非均衡、危机和宏观动态能够从模型内部由智能体行为涌现出来,否则所谓"解释"仍停留在描述层面。

由香港中文大学(深圳)数据科学学院、香港大学与南洋理工大学联合组成的研究团队,在论文《From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models》中提出了一个面向实现的系统蓝图——经济世界模型(Economic World Model, EWM)。论文将 EWM 定义为经济环境的"生成式引擎",它通过建模智能体如何观察、推理、行动、交互并适应经济制度与约束,来预测经济如何从内部演化。

一句话总结其贡献:论文以**六级能力阶梯(L1–L6)**作为统一坐标系,将"经济智能体"升级为闭环的"代理经济(Agentic Economy)",并用四大核心架构模块与五算子状态转移形式化,给出了一条从固定规则仿真走向仿真—现实双胞胎的可工程化路径。同时,基于 737 篇验证论文的系统文献综述清晰地揭示了当前研究高度集中于 L1–L3,而 L4–L6 仍是亟待开拓的空白前沿。

研究背景与动机

为什么需要"经济世界模型"

论文在引言中明确指出,传统经济学的"观察并解释(或预测)范式存在一个内生缺陷——它不产生生成式解释。无论推导出的均衡多么精巧,无论参数拟合多么显著,如果这些结果无法从模型内部由智能体行为和制度交互涌现出来,那么所谓"解释"只是对历史现象的事后描述,而非对机制本身的理解。这一缺陷在面对政策反事实推理、系统性风险评估、市场设计验证等需要"如果……会怎样"的问题时尤为突出。

与此同时,产业界和学术界正同步发出强烈信号。OpenAI 在 2024 年任命了首位首席经济学家,并于 2026 年启动经济研究交流计划;Anthropic 推出了经济影响指数;大语言模型为建模信念、记忆、沟通、推理与情境敏感决策提供了前所未有的统一基底;工具使用的智能体让 LLM 能够把"决策"直接转化为"可执行的经济行动";多智能体模拟提供了异构交互的天然载体;而金融文本、政策文件、交易数据、行政记录的日益可得,也为校准和验证提供了燃料。

现有仿真的局限

论文将现有经济仿真方法的局限归纳为几个关键方面。第一,传统的基于规则的智能体模型(如 DSGE、ABM)虽然具备内生封闭性,但智能体本身缺乏认知维度——它们不会形成信念、不会反思、不会在情境中调整策略。第二,近年兴起的 LLM 社会模拟器虽然在行为保真度上有所突破,但大多停留在"单向预测下一个行动"的层面,缺乏完整的经济反馈闭环:智能体行动后,世界如何内生地产生下一个状态?价格、配置、风险如何从分散交互中涌现?第三,几乎所有现有系统都把经济环境视为一个固定舞台,制度规则、市场机制、治理参数不会随智能体行为和宏观结果而内生演化。

更深层的局限在于"现实对齐"的缺位。论文反复强调,一个真正可用的经济世界模型不应只是"看起来合理"的模拟器,而应当与持续到来的真实经济观察反复对照、不断纠正自身——这一点在既有研究中几乎完全缺失。正是这些局限共同构成了论文提出 L1–L6 能力阶梯、并以"代理经济"作为终态目标的直接动机。

核心概念:经济世界模型定义

经济世界与物理世界的四维度对比

论文用一张对照表清晰地刻画了经济世界与物理世界的根本差异,其重要性贯穿全文。具体可以从四个维度来理解:

第一,主要驱动因素。物理世界由外部法则支配,行星运动不依赖于行星自身的"信念";而经济世界由智能体的主观信念与激励驱动,行动者在不完全信息和制度约束下形成期望并做出响应。第二,行为者性质。物理世界中的物体是被动的、受动力学支配的实体;经济世界中的智能体则是战略性的决策者,会主动解释环境、推断他人意图并选择最优策略。第三,结果的形成方式。物理世界的结果由外部法则蕴含,具有法则必然性;经济世界的核心变量——价格、配置、数量、风险、宏观条件——则是内生形成的,由分散化的交易、议价、竞标、签约和市场出清交互涌现。第四,反馈与规则的性质。物理世界的反馈是机械的、因果的,规则是稳定的固定法则;而经济世界的反馈是反射性的(reflexive)——智能体根据信念行动、行动改变经济、被改变的经济又重塑后续信念,规则本身也会随制度适应而演化。

经济世界的四大独特特征

在四维度对比的基础上,论文进一步凝练出经济世界的四个独特特征,这些特征直接决定了 EWM 的设计要求:

  1. 主观智能体(Subjective Agents):经济智能体在行动前必须先"解释"世界。家庭、企业、银行、投资者、监管者各自拥有角色专属的信息集、信念体系和战略视角,他们在不完全信息和制度约束下形成期望与判断。
  2. 内生结果(Endogenous Outcomes):价格、配置、数量、风险、宏观条件等核心经济变量不是从外部施加的,而是从智能体分散化交互中涌现的——EWM 必须能够生成这些结果,而不仅是描述它们。
  3. 反射性反馈(Reflexive Feedback):经济反馈是信念介导的、自我指涉的。智能体行动改变经济,经济改变又反过来重塑信念和后续行动,形成与物理因果截然不同的循环结构。
  4. 适应性动态(Adaptive Dynamics):经济世界不在固定行为法则下演化。智能体学习、策略迁移、期望漂移,制度与政策规则可能随时间调整——这意味着 EWM 必须支持智能体与制度的协同演化。

经济世界状态的形式化定义

基于上述特征,论文给出了经济世界状态的精确定义。一个完整的经济状态必须同时包含客观条件与主观智能体侧表示,其形式化为:

$$s_t = \left(x_t,\; \{z_t^i, b_t^i\}_{i=1}^{N_t},\; \mathcal{I}_t\right)$$

这一状态由三部分组成。第一部分是聚合经济状态 $x_t$,刻画宏观与市场层面的客观条件,包括价格、数量、波动率、就业、产出、利率、公共新闻等经济变量与公开信息。第二部分是智能体侧状态 $\{z_t^i, b_t^i\}_{i=1}^{N_t}$,其中 $z_t^i$ 是私有状态,包括现金、财富、库存、资产负债表头寸、合约、产能、风险敞口或未偿义务等;$b_t^i$ 是信念状态,刻画智能体对价格、需求、政策、他人行为以及风险与不确定性的期望、感知和预测。第三部分是制度环境 $\mathcal{I}_t$,描述约束智能体行动的制度性框架,包括市场机制、政策制度、披露规则、信息渠道、数据访问权限和治理参数。

这一状态定义的革命性在于:它把传统经济模型中被简化的"主观维度"和"制度维度"提升为与客观聚合状态同等地位的一等公民。任何对经济世界状态的完整刻画,都不能只看价格和数量,必须同时建模谁在想什么(信念)、谁持有什么(私有状态)、以及谁在什么样的规则下行动(制度)。这正是 EWM 区别于传统宏观模型与纯行为模拟的根本所在。

六级能力阶梯

论文最具结构性的贡献是提出了一个六级能力阶梯(L1–L6),作为评估和定位任何 EWM 系统的统一坐标系。这一阶梯不是简单的"智能体越来越聪明"的线性排列,而是围绕四个期望准则(Desiderata) 定义的多维度框架:内生封闭性(Endogenous Closure)、行为保真度(Behavioral Fidelity)、演化动态(Evolutionary Dynamics)和现实对齐(Reality Alignment)。每一级的能力跃迁,对应着某些算子的激活或某些期望准则的满足。

能力水平矩阵概览

按照论文表 2 的能力水平矩阵,可以从四个期望准则的满足程度来定位每一级:

  • L1 固定规则智能体世界:满足内生封闭性与行为保真度(基础),但不满足演化动态与现实对齐。
  • L2 自适应规则智能体世界:满足内生封闭性与行为保真度,部分满足演化动态,不满足现实对齐。
  • L3 基于 LLM 的自主智能体世界:满足内生封闭性、行为保真度与演化动态,不满足现实对齐。
  • L4 自演化智能体世界:满足前三项准则,不满足现实对齐。
  • L5 智能体—环境协同演化世界:满足前三项准则,不满足现实对齐。
  • L6 仿真—现实经济双胞胎:四项准则全部满足。

需要特别注意的是,从 L3 到 L5 的跃迁并非简单的"智能体更强",而是改变了"谁在演化"这一本质问题。下面逐一解析每一级。

Level 1:固定规则智能体世界

L1 将经济建模为一个封闭系统,智能体和环境都遵循预先指定的固定规则。从算子角度看:决策规则 $\pi^i$ 预先指定、状态转换 $\Omega^i$ 预先指定、聚合算子 $G$ 预先指定;而认知算子 $B^i$(信念更新)和制度演化算子 $\Phi$ 都处于不活跃状态。这一级别的典型代表是传统的基于主体的模型(ABM)和动态随机一般均衡(DSGE)模型。L1 能够提供内生封闭性——价格和配置确实从规则驱动的交互中产生——但缺乏世界内的任何适应机制:无论运行多少期,智能体的行为规则和环境参数都不会改变。

Level 2:自适应规则智能体世界

L2 的关键突破在于智能体不再是固定的规则执行器,而是能够通过符号或算法机制修订决策策略。此时决策规则 $\pi_t^i$ 变为时间变化的,可以通过强化学习、进化搜索、在线学习或自适应启发式进行更新。然而认知算子 $B^i$ 和制度演化算子 $\Phi$ 仍然不活跃。这一级别添加了"世界内的适应",但适应仍然是基于规则而非基于认知——智能体没有显式的信念状态,无法进行真正意义上的"思考"。UTD-24 商学和经济学期刊中的许多自适应智能体模型都落在这一级别。

Level 3:基于 LLM 的自主智能体世界

L3 是论文中特别强调的一个跃迁点:智能体被配备了显式的认知状态——信念、期望、记忆和经济主观表示。此时认知算子 $B^i$ 变为活跃,能够随时间更新智能体的主观经济视图;决策规则 $\pi_t^i$ 基于更新的信念、智能体状态、聚合条件和制度约束生成行动。然而制度演化算子 $\Phi$ 仍然不活跃,且认知基底(即 LLM 本身)在推演期间保持固定。这一级别显著改善了行为保真度,使智能体能够进行推理、沟通和情境敏感的经济决策,但智能体本身不会"学会新技能"。

Level 4:自演化智能体世界

L4 把适应从信念和行动扩展到智能体能力基底本身。在这一级别,$B^i$ 和 $\pi_t^i$ 都会被获得的能力持久地重塑——智能体不仅更新当前信念或选择当前行动,还会持续扩展策略库、技能集或行为例程。这些更新由模拟反馈驱动:收益、交互结果、反思和聚合经济状态共同塑造智能体的长期能力。关键的是,制度演化算子 $\Phi$ 在 L4 仍然不活跃——智能体在认知上变得动态,但周围的世界尚未演化。论文文献综述显示,L4 系统在最近才刚刚出现,是当前研究的前沿之一。

Level 5:智能体—环境协同演化世界

L5 是阶梯中最具概念性突破的一级。论文明确指出:定义 L5 的不是智能体有多智能,而是游戏规则是否变得内生。此时制度演化算子 $\Phi$ 被激活,允许政策、市场规则、合约、治理结构或制度约束响应智能体行为和聚合结果而变化。智能体基底可以对应 L2、L3 或 L4——也就是说,一个 L3 + $\Phi$ 的系统同样可以属于 L5。这一级别的本质在于:经济不再是一个"智能体在内行动、规则在外不变"的舞台,而是智能体与制度共同演化的生态系统。论文强调,L5 极为稀少,大多数现有模拟仍把经济环境视为固定的背景。

Level 6:仿真—现实经济双胞胎

L6 是整个阶梯的终态目标。在这一级别,EWM 不再只是一个通过内部动态演化的封闭模拟器,而是维护一个在线纠正循环,使系统成为经济的自纠正数字双胞胎。L6 的架构是双循环结构:内循环负责生成内生经济动态(即 L1–L5 的能力),外循环则执行实时监控、诊断和纠正——当模拟轨迹与新观察到的经济数据出现差异时,系统会更新相关组件,包括智能体行为、参数、机制、制度规则或状态转换模块。L6 是唯一同时满足四项期望准则的级别,也是论文认为"几乎不存在"的前沿——它要求在同一个系统内同时整合自演化智能体、内生制度和在线现实对齐,这本身是一个远未解决的系统工程问题。

四大核心架构模块

论文将 EWM 实现为一个模块化的经济运行时,而非单一预测器。这一运行时由四个层级构成:智能体层、经济环境层、协同演化层和实时对齐层。四层分别对应 L1–L6 能力阶梯中不同算子的承载与激活,并提供了可复用的实现接口。

模块一:智能体层

智能体层是 EWM 中"行为主体"的载体。论文将智能体定义为可执行的经济行为者,每个智能体拥有角色、目标、内部状态、信息渠道、行动空间、约束、信念、记忆、工具和技能。这些属性被组织为三组:

第一组是属性(Attributes),刻画智能体的经济身份和内部状态。role 和 objective 指定经济身份和决策目标;state_variables、belief 和 information_channels 描述内部经济状态、主观期望和信息访问权限。一个家庭智能体的目标可能是"在预算约束下持有现金和外汇",其状态变量包括现金、外汇头寸和信念。

第二组是能力(Capabilities),定义智能体可以做什么。action_space 定义可用经济行动(如买入外汇、卖出外汇、持有);tools 提供推理、计算、信息检索和交互辅助能力,例如预算计算器、报价查询接口等。

第三组是边界(Boundaries),确保生成的行动合法可行。constraints 强制满足预算、库存、制度和角色特定要求;memory_window 限制历史上下文的长度,避免信息过载。

论文给出了清晰的智能体配置接口示例:通过 ewm.agent(role=..., objective=..., state_variables=[...], information_channels={...}, action_space=[...], tools=[...], constraints=[...], memory_window=...) 即可声明一个完整的经济智能体。这种声明式接口使得不同研究背景的智能体(基于规则的、基于学习的、基于 LLM 的)可以在同一个运行时中互操作。

模块二:经济环境层

经济环境层是一个状态化运行时,负责存储状态并执行转换。论文将其核心职责概括为:发布异构观察、接收行动、应用约束、调度行动、出清机制、更新账户和合约、发出奖励和诊断、记录事件日志。环境层由四组组件构成:

  • State(状态):定义当前经济世界,包括聚合市场变量(如汇率、交易量、波动率)和角色级账户(如家庭、企业、银行各自的现金与头寸)。
  • Constraints(约束):预算、库存、角色权限、风险敞口等可行性规则。环境会在收到行动后检查其是否满足约束,违反的行动按策略处理(如拒绝并记录日志)。
  • Scheduler(调度器):当时机或优先级重要时,定义行动的执行顺序——例如在连续双拍市场中,订单的先后会影响成交价格。
  • Mechanism(机制):机构规则,指定参与者、行动类型、定价规则和结算规则。一个外汇市场机制可能是批量出清(batch_clearing),定价规则为统一出清价格,结算规则为现金—资产交割。

环境层的核心协议是 (state_t, 行动档案 A_t) -> state_{t+1},其内部转换循环依次执行:约束检查、行动调度、机制出清、日志更新。这一协议的清晰定义使得不同市场结构(拍卖、订单簿、批量出清、双边议价)可以作为可替换的"机制插件"接入同一套运行时。

模块三:协同演化层

协同演化层承载智能体与世界之间的双向改进循环,是 L4 和 L5 能力的实现载体。论文从两个方向描述了这一循环:

一方面,更好的智能体改进世界。当智能体能力提升(例如学会了新的交易策略、能够识别更复杂的市场状态),它们会产生更具挑战性的轨迹、暴露现有机制的缺失规则、压力测试制度设计、并揭示不现实的动态——这些反馈都驱动环境的改进。

另一方面,更好的世界改进智能体。一个设计良好的环境会提供结构化反馈、反事实推演能力、奖励信号、约束信号、记忆和压力案例,这些都是智能体学习和能力扩展的关键燃料。

协同演化层在接口上分为两个子配置:agent_updates 描述智能体侧的更新目标(信念、记忆、策略)和信号来源(观察、实现结果、奖励);environment_updates 描述环境侧的更新目标(机制参数)和信号来源(交易量、价格误差、约束违反)。在运行时协议中,每个时间步在执行完状态转移后会调用 world.coevolve(state, actions, next_state),由系统分别抽取环境反馈和聚合智能体行为,更新对应的组件。

模块四:实时对齐层

实时对齐层是 L6 能力的实现载体,负责在推演期间将人工经济锚定到经验、制度、安全或任务特定证据。论文将其功能概括为:纠正不可行或危险行动、监控漂移和不稳定性、将差异归因于智能体/状态/机制/规则、记录干预并对更正进行版本化。

对齐层的接口配置包括三个核心部分。data_sources 声明用于对齐的现实数据流(如汇率、交易量、波动率)及其频率;metrics 和 tolerance 定义比较指标(价格误差、成交量误差、波动率误差)及其容忍区间;correction 描述当偏差超出容忍区间时的纠正策略,包括智能体侧目标(信念、状态)、环境侧目标(机制参数)以及更新策略(如有界更新)。

实时对齐层的存在使 EWM 从"封闭沙箱"转变为"开放双胞胎"——它不再是自我演化的孤立系统,而是持续与真实经济对话、不断自我修正的认知架构。论文明确指出,这一层在现有研究中几乎完全缺失,是从 L5 跃迁到 L6 的关键工程挑战。

形式化状态转移算子

论文将 EWM 的状态转移形式化为一个由五个算子组成的序列,每个算子对应状态转移的一个阶段,并在不同能力级别上具有不同的激活状态。这一形式化是整个论文的理论骨架——它不仅精确刻画了"经济世界如何从一个状态演化到下一个状态",还为 L1–L6 能力阶梯提供了严格的算子级定义。

算子一:信念更新算子 $B^i$

$$b_{t+1}^i = B^i\left(b_t^i,\; z_t^i,\; x_t,\; u_t,\; \mathcal{I}_t\right), \quad i = 1, \ldots, N_t$$

$B^i$ 是智能体 $i$ 的信念更新算子,它将智能体的先验信念 $b_t^i$、当前私有状态 $z_t^i$、聚合经济状态 $x_t$、外生干预 $u_t$ 和制度环境 $\mathcal{I}_t$ 映射为更新的主观经济表示 $b_{t+1}^i$。这一算子刻画了智能体如何"解释"世界——它不是被动接收信息,而是基于自身角色、信息渠道和先验期望,对观察到的事实进行主动解读。在 L1 和 L2 中,$B^i$ 处于不活跃状态(智能体没有显式信念);从 L3 开始,$B^i$ 被激活,成为 LLM 智能体认知能力的核心。

算子二:行动生成算子 $\pi^i$

$$a_{t+1}^i = \pi^i\left(z_t^i,\; b_{t+1}^i,\; x_t,\; u_t,\; \mathcal{I}_t\right), \quad i = 1, \ldots, N_t$$

$\pi^i$ 是智能体 $i$ 的决策规则,它将智能体的当前状态 $z_t^i$、刚刚更新的信念 $b_{t+1}^i$、聚合经济状态 $x_t$、外生干预 $u_t$ 和制度环境 $\mathcal{I}_t$ 映射为下一个行动 $a_{t+1}^i$。在 L1 中,$\pi^i$ 是预先指定的固定规则;在 L2 及以上,$\pi^i$ 变为时间变化的 $\pi_t^i$,可以通过强化学习、进化搜索、在线学习或 LLM 推理进行更新。在 L4 中,$\pi_t^i$ 的更新扩展到能力基底本身——智能体不仅调整当前决策,还会持久地重塑策略库和技能集。

算子三:状态更新算子 $\Omega^i$

$$z_{t+1}^i = \Omega^i\left(z_t^i,\; a_{t+1}^i\right), \quad i = 1, \ldots, N_t$$

$\Omega^i$ 是智能体 $i$ 的状态转换函数,它根据当前私有状态 $z_t^i$ 和刚刚生成的行动 $a_{t+1}^i$,更新智能体的个人微观层面变量,如财富、库存、资产负债表头寸等。$\Omega^i$ 通常由环境的账户和合约系统实现——例如当一个家庭智能体执行"买入外汇"行动后,$\Omega^i$ 会相应减少其现金头寸、增加其外汇库存。这一算子在所有能力级别都处于活跃状态,是 EWM 内生封闭性的基础保障。

算子四:内生聚合算子 $G$

$$x_{t+1} = G\left(\{z_{t+1}^i, a_{t+1}^i, b_{t+1}^i\}_{i=1}^{N_t},\; x_t,\; \mathcal{I}_t\right)$$

$G$ 是内生聚合和市场出清算子,它将所有智能体的下一状态、行动和信念的集合 $\{z_{t+1}^i, a_{t+1}^i, b_{t+1}^i\}_{i=1}^{N_t}$、当前聚合经济状态 $x_t$ 和制度环境 $\mathcal{I}_t$ 映射为下一时期的聚合结果 $x_{t+1}$——包括价格、配置和宏观经济条件。$G$ 的关键意义在于"内生":价格和宏观条件不是从外部施加的,而是从智能体的分散化交互中涌现的。这一算子直接对应论文反复强调的"生成式解释"——EWM 必须能够从内部生成经济结果,而不仅是描述它们。$G$ 在所有能力级别都处于活跃状态,但其复杂度和真实性会随机制设计的精细化而提升。

算子五:制度演化算子 $\Phi$

$$\mathcal{I}_{t+1} = \Phi\left(\mathcal{I}_t,\; x_{t+1},\; \{b_{t+1}^i, a_{t+1}^i, z_{t+1}^i\}_{i=1}^{N_t}\right)$$

$\Phi$ 是制度或管理机制的演化算子,它根据当前制度环境 $\mathcal{I}_t$、新产生的聚合状态 $x_{t+1}$ 以及所有智能体的信念、行动和状态,生成下一时期的制度环境 $\mathcal{I}_{t+1}$。$\Phi$ 的激活是 L5 的标志——它使政策、市场规则、合约结构、治理参数和制度约束能够响应智能体行为和宏观结果而内生演化。在 L1–L4 中,$\Phi$ 处于不活跃状态,$\mathcal{I}_{t+1} = \mathcal{I}_t$,制度被视为固定背景;只有当 $\Phi$ 被激活时,经济才真正成为一个"智能体与制度协同演化"的生态系统。

五算子与能力阶梯的对应关系

将五个算子与 L1–L6 能力阶梯对照,可以得到一张清晰的"算子激活矩阵":

  • L1:$\pi^i$、$\Omega^i$、$G$ 预先指定;$B^i$、$\Phi$ 不活跃。
  • L2:$\pi^i$ 升级为时间变化的 $\pi_t^i$;$B^i$、$\Phi$ 仍不活跃。
  • L3:$B^i$ 被激活,$\pi_t^i$ 基于信念生成行动;$\Phi$ 仍不活跃。
  • L4:$B^i$ 和 $\pi_t^i$ 被获得的能力持久重塑;$\Phi$ 仍不活跃。
  • L5:$\Phi$ 被激活,制度内生演化;智能体基底可以是 L2–L4 任一。
  • L6:在 L5 基础上增加外循环的实时对齐,对全部算子进行在线纠正。

这张矩阵的价值在于,它把"经济仿真能力"从一个模糊的概念,转化为可以通过算子激活状态精确度量的工程指标。任何一个 EWM 系统,都可以通过回答"$B^i$ 是否活跃?$\pi^i$ 是否时间变化?$\Phi$ 是否激活?是否存在现实对齐循环?“这四个问题,被准确定位到 L1–L6 的某一级。

系统文献综述发现

论文最具实证分量的部分是一项覆盖 1950 年至 2026 年 4 月的系统性文献综述。这项综述不是为了罗列相关工作,而是为了用 L1–L6 阶梯作为统一坐标系,绘制整个经济世界模型研究的"文献景观”,从而精确识别研究空白。

数据来源与三阶段分类流程

综述的数据来源包括两类:arXiv 上 8 个相关类别(经济学、金融、AI、多智能体系统、机器学习、统计学、量化金融)的预印本,以及 Web of Science 索引的 UTD-24 顶级商学和经济学期刊列表。关键词过滤采用交集式策略——每篇论文必须同时包含至少一个经济/金融术语和至少一个建模/模拟/智能体/强化学习/世界模型术语,才会进入候选池。去重后得到 7,836 篇候选论文(arXiv 6,008 篇 + UTD-24 1,828 篇)。

分类流程分为三个阶段。阶段一是关键词预过滤,应用交集式标题和摘要关键词,输出 7,836 篇候选。阶段二是召回导向筛选,使用 GPT-5.4-mini 对标题和摘要进行筛选,保留那些显示合理 EWM 结构(经济智能体、交互产生的内生结果、动态反馈或反复转换)的论文,输出 794 篇 arXiv 论文和 87 篇 UTD-24 论文进入全文评审。阶段三是精度导向的全文 PDF 分类,使用 GPT-5.5 进行全文分类,先做 EWM 二元验证,再分配到最高支持的能力水平(L1–L6),边界和低置信度案例标记为人工验证。最终语料库为 737 篇验证的 EWM 论文。

四项关键发现

文献综述揭示了四项关键模式,这些模式共同勾勒出 EWM 研究的现状与前沿。

第一,智能体智能已成为近期进展的主要前沿。从时间趋势看,2024–2025 年前后 EWM 相关论文数量急剧上升,增长高度集中在 L1–L3,特别是基于 LLM 的自主智能体系统(L3)。这反映了大语言模型为经济智能体带来的认知能力的跃升,但同时也说明,大多数工作仍停留在"让智能体更聪明"这一维度。

第二,商学和经济学期刊仍集中在较低水平。UTD-24 期刊上的 EWM 论文几乎完全集中在 L1 和 L2,反映了更长的基于规则或自适应智能体模型的传统。这一现象值得深思——顶刊发表的研究在方法论上往往更为保守,而真正具有系统能力跃迁的工作(L4–L6)更多出现在计算机科学和 AI 会议/预印本中。

第三,高级 EWM 仍然稀少。L4–L6 系统在文献景观中占据一个薄区域。L4(自演化智能体)最近才刚刚出现;L5(内生制度演化)更为稀少;而 L6(仿真—现实经济双胞胎)几乎不存在。这一空白不是研究兴趣的空白,而是系统能力的空白——构建一个同时具备自演化智能体、内生制度演化、在线现实对齐的 EWM,在工程上远未解决。

第四,整合挑战是真正的难题。文献综述清晰地表明,即便 L4、L5、L6 各自在小规模上有所探索,但把它们整合在同一个经济世界内——让自演化智能体在演化制度中行动,并接受现实观察的持续纠正——仍然是一个未解决的更难系统问题。这恰恰是论文提出"代理经济"概念和模块化架构的直接动机:只有通过清晰的接口和模块化设计,才有可能逐步逼近 L6。

实现蓝图与接口设计

论文最具工程价值的部分是提供了一套完整的Python 伪代码接口,将抽象的能力阶梯和架构模块转化为可实现的工程规范。这套接口采用"规范接口 + 运行时接口"的双层架构:规范接口定义各模块应当具备的属性和方法签名,运行时接口则定义这些方法在 EWM 主循环中的调用协议。

规范接口:声明式模块定义

规范接口采用声明式风格,通过 ewm.make(...) 作为统一入口,接受 agents、environment、coevolution、alignment 四个可选模块配置。一个最小执行示例展示了这种风格的简洁性:

import economic_world_model as ewm

world = ewm.make(
    name="FXMarket-v0",
    agents=[ewm.agent(role="household", count=1000),
            ewm.agent(role="firm", count=20),
            ewm.agent(role="bank", count=5)],
    environment=ewm.environment("FXMarket-v0"))

state = world.reset(seed=42)
for t in range(T):
    actions = world.run_agents(state, parallel=True)
    state = world.step(actions)
world.close()

智能体配置接口允许精确声明角色、目标、状态变量、信息渠道、行动空间、工具、约束和记忆窗口——这些字段直接对应智能体层的三组属性。环境配置接口则允许声明初始状态(聚合变量 + 角色账户)、约束规则、调度器和机制(类型、参与者、输入行动、定价规则、结算规则)。协同演化和对齐模块同样通过声明式接口配置,使得一个完整的 L6 系统可以通过几行代码完成骨架声明。

运行时接口:四步主循环

运行时接口定义了 EWM 主循环的四个关键协议调用。第一步是 world.reset(seed),生成初始经济状态。第二步是 world.run_agents(state, parallel=True),即公共协议 state_t -> 行动档案 A_t,由各智能体内部完成观察、行动选择、实例化和约束验证的决策循环。第三步是 world.step(actions),即公共协议 (state_t, 行动档案 A_t) -> state_{t+1},由环境内部完成约束检查、行动调度、机制出清和日志更新。第四步(仅 L4–L6)是 world.coevolve(state, actions, next_state),基于实现的转换进行协同演化更新,分别更新智能体和环境组件。

对于 L6 系统,还存在一个第五步——在线现实对齐,它会比较模拟轨迹与现实数据流,当偏差超出容忍区间时触发纠正,更新智能体信念/状态或环境机制参数。这套运行时接口的清晰分层使得不同能力级别的系统可以共享同一套主循环,只需根据级别激活或关闭相应模块。

工程路径:五项工程方法

除了接口规范,论文还提出了构建 EWM 的五项工程方法,分别对应不同的能力提升路径。特征工程关注为智能体设计适当的观察信号;数据工程通过数据驱动方法提升模型智能;提示工程设计有效提示以引出 LLM 智能体的经济推理;上下文工程为智能体装备记忆、工具、技能等能力;环境工程构建可交互、可演化的经济环境。这五项工程方法并非彼此独立,而是共同构成从 L1 逐步迈向 L6 的工程工具箱。

“代理经济”:从单向预测到闭环协同

论文提出的"代理经济(Agentic Economy)“概念,是整个蓝图的概念性终态。理解这一概念,需要先区分两个相关但根本不同的概念:经济智能体(Economic Agent)和代理经济(Agentic Economy)。

经济智能体主要执行智能体侧的"下一行动生成”——给定观察到的经济状态,预测或选择个体经济行动者的下一个可行行动。它本质上是一个单向预测问题:从状态到行动。然而,经济智能体缺乏可执行的经济反馈循环——它不关心行动之后世界会如何变化,也不关心世界的变化如何反过来影响未来的行动选择。

代理经济则把这一单向预测问题转化为一个工程化的闭环:它同时连接智能体侧的"下一行动预测"和世界侧的"下一状态预测"。在真实经济中采取行动之前,智能体可以首先通过 EWM 中的模拟推演来预判后果、评估替代行动、选择更知情的策略。这种闭环带来一个强大的迭代协同改进循环:

  1. 智能体通过 EWM 中的模拟推演进行训练;
  2. 随着智能体能力提升,这些进步迁移到 EWM 中的智能体实例;
  3. 更强的 EWM 智能体产生更准确的下一行动预测,进而产生更准确的下一状态预测;
  4. 更准确的 EWM 为后续智能体训练提供更现实、更丰富的环境;
  5. 循环往复,智能体与 EWM 共同进化。

这一协同改进循环的意义在于,它把"训练经济智能体"和"构建经济世界模型"从两个孤立的研究问题,整合为一个统一工程范式。代理经济不是一个更聪明的智能体,也不是一个更精细的模拟器,而是两者通过闭环反馈相互成就的协同系统——这正是论文标题"From Economic Agents to Agentic Economies"所要表达的核心愿景。

应用场景与价值定位

论文为 EWM 勾勒了三类应用场景,分别对应不同的价值定位。

第一类是EWM 作为人类决策的沙箱,包括政策模拟和压力测试(测试政策、市场设计、系统性风险)、金融市场和系统性风险分析(金融稳定性评估)、企业战略和供应链韧性(企业决策和供应链管理)、以及研究和教育(经济学研究和教学)。在这类场景中,EWM 的价值在于提供"如果……会怎样"的反事实推理能力,这是传统计量经济学难以提供的。

第二类是EWM 作为 LLM 智能体的工具,包括反事实经济推理工具(通过模拟推演进行反事实分析)、长期规划工具(支持智能体进行长期经济规划)、以及安全和部署评估工具(检测操纵、合谋、不稳定和级联失败等交互风险)。在这类场景中,EWM 成为了 LLM 智能体的"经济世界 API",使其决策不再是脱离经济背景的纯符号推理。

第三类是EWM 作为 LLM 的强化学习训练环境,使智能体在稀缺性、激励和制度约束下学习经济行为。这一场景直接对应前述的"代理经济"协同改进循环——EWM 既是训练环境,又是被训练对象,两者在闭环中共同进化。

论文还系统比较了 EWM 与四种相邻范式:传统经济模型、基于智能体的模型(ABM)、基于 LLM 的社会模拟器、以及通用世界模型。这种定位比较的价值在于澄清了 EWM 的独特性——它既不是传统经济模型的参数拟合,也不是 ABM 的规则模拟,更不是 LLM 社会模拟的行为再现,而是把这些范式的优势整合到一个具备内生封闭性、行为保真度、演化动态和现实对齐的统一系统中。

局限与展望

论文在第 8 节坦诚地讨论了 EWM 研究面临的开放挑战,这些挑战既是当前工作的局限,也是未来研究的方向。

第一,自演化智能体(L4)仍然罕见。虽然 LLM 为智能体提供了前所未有的认知基底,但如何让智能体在推演过程中持久地扩展策略库、技能集和行为例程——而非仅仅更新当前信念——仍然是一个开放问题。现有的反思、记忆、工具学习等技术大多停留在单次会话层面,难以支撑长时程的能力累积。

第二,内生制度演化(L5)极少被探索。大多数模拟仍把经济环境视为固定舞台,制度规则、市场机制、治理参数不会随智能体行为和宏观结果而内生变化。如何设计可演化但又不失稳定性的制度框架,如何在演化与可解释性之间取得平衡,都是悬而未决的问题。

第三,仿真—现实经济双胞胎(L6)几乎不存在。缺乏与现实观察的反复纠正,使得现有 EWM 无法真正成为"自纠正的数字双胞胎"。如何设计高效的在线对齐算法、如何归因模拟与现实之间的差异、如何在纠正过程中保持系统的内生性,都是极具挑战的工程难题。

第四,整合挑战是真正的难题。论文反复强调,即便 L4、L5、L6 各自在小规模上有所探索,但把它们整合在同一个经济世界内,仍然是一个"未解决的更难系统问题"。这种整合不仅涉及技术层面的接口兼容,更涉及理论层面的一致性——自演化智能体、演化制度、在线对齐三者之间的交互动力学远比各自独立时复杂。

论文将自身的目标定位为:使经济世界作为 AI 系统变得可构建、可测试、可对齐,同时保持经济学科纪律。这意味着 EWM 不是要取代经济学,而是为经济学提供一个生成式的实验平台;EWM 也不是要替代真实经济,而是为决策提供一个可反复推演、可对照现实的认知工具。

结论与影响

《From Economic Agents to Agentic Economies》是一篇兼具理论雄心与工程务实性的系统蓝图论文。它的核心贡献可以概括为三层。

在概念层,论文用一个清晰的工作定义把"经济世界模型"从模糊愿景转化为可操作的研究对象——EWM 是经济环境的生成式引擎,通过建模智能体的观察、推理、行动、交互和适应来预测经济如何从内部演化。四维度对比和状态定义 $s_t = (x_t, \{z_t^i, b_t^i\}_{i=1}^{N_t}, \mathcal{I}_t)$ 把"主观维度"和"制度维度"提升为一等公民,从根本上区别于传统宏观模型。

在架构层,论文用六级能力阶梯 L1–L6 作为统一坐标系,把纷繁复杂的现有研究组织成一个线性可比较的能力矩阵;用四个核心模块(智能体层、经济环境层、协同演化层、实时对齐层)和五个状态转移算子($B^i, \pi^i, \Omega^i, G, \Phi$)给出了一套模块化、可工程化的实现路径。算子激活矩阵使得任何一个 EWM 系统都可以被精确定位,这为后续研究提供了共同的参照系。

在实证层,737 篇验证论文的系统性文献综述绘制了 EWM 研究的完整景观,清晰地揭示了 L4–L6 的研究空白——自演化智能体、内生制度演化、仿真—现实双胞胎几乎都是未开拓的前沿。这一发现不是悲观结论,而是行动号召:论文的真正价值在于指出"下一步应当做什么"。

从更广阔的视角看,这篇论文标志着 AI 与经济学的跨界融合进入了一个新阶段。过去,AI 为经济学提供的是更好的拟合工具和预测模型;而现在,AI——特别是 LLM 驱动的智能体——为经济学提供了一个全新的生成式实验平台,使经济学有可能像物理学对待物理世界那样,通过"在模型内部重现现象"来验证和发展理论。与此同时,经济学也为 AI 提供了一个极具挑战性的应用域——稀缺性、激励、制度、策略交互、反射性反馈——这些概念为 AI 智能体的能力评估提供了远比游戏或基准测试更丰富的维度。

“代理经济"的愿景或许还需要多年才能初步实现,但论文提供的蓝图——从经济智能体到代理经济,从固定规则到仿真—现实双胞胎,从单向预测到闭环协同——已经为这一旅程绘制了清晰的地图。对于关注 AI、多智能体系统和计算经济学的研究者而言,这是一条值得认真投入的赛道;对于关注政策模拟、风险管理、市场设计的实践者而言,这是一个值得持续跟踪的方向。经济世界模型的故事,才刚刚开始。