论文链接:What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets 发表时间:2026年9月 机构:DX Research Group(DXRG)—— 独立研究实验室,运营两个生产交易系统(论文自带利益声明的"用自己的钱买来的方法论"气质) 领域标签:cs.AI / LLM Agents in Production / Market Microstructure / Agent Behavior Measurement

一、论文背景

到 2026 年年中,自主 LLM Agent 已经在公开市场持有并移动真金白银:竞赛、arena、在线平台把成群的 prompted 模型推到加密货币订单流面前。伴随的评测文献大量涌现——但几乎全部依赖排行榜 P&L,时间窗口以小时/天计。

这种评测有两个致命缺陷。第一,它测的是结果不是行为:赢了不知道为什么赢,输了不知道为什么输,更不知道 Agent 平时都在干什么。第二,它给出的正结果无法归因:P&L 排行混杂了模型能力、提示工程、市场运气与系统设计,谁也说不清哪个成分贡献了多少。

而"Agent 在真实市场里到底如何行为"这个基础问题,居然没有一份像样的记录。这不只是学术空白:当用户把自己的钱交给 LLM Agent(论文里的金库都是 user-funded 的),运营方与监管者需要知道的第一件事就是行为事实。

本文要做的事情在方法论上非常古典:先有可信的记录,再谈理论。它带来的是两套生产系统的六个月连续遥测——不是模拟回测,不是竞赛 snapshot,而是有真实资金、真实用户、真实订单流的生产环境。

二、论文定位和关联工作

脉络一:LLM 金融交易评测。 现有文献可分为回测类(在历史数据上跑 Agent)、竞赛类(FinArena 式锦标赛)、以及平台排行榜类。三者共同的"排行榜主义"是本文批评的靶心:P&L 之外的行为信息为零。

脉络二:生产系统实证研究(measurement studies)。 系统网络领域的 measurement paper 传统(对生产系统的连续遥测+统计推断)在 AI Agent 领域几乎空白。本文把这一传统完整移植:数据存储 schema、join 纪律、归一化与池化规则、证据分级制度(firm/provisional/weak/retracted)。

脉络三:行为经济学与市场微观结构。 论文的发现大量借用微观结构概念(杠杆、爆仓、bracket order、捕获率),并对"LLM Agent 是否表现出系统性偏差"给出生产级答案(是——且偏差来自运营层设计而非模型"性格")。

维度排行榜评测本文的记录式研究
时间形态快照(小时/天)连续六个月
度量P&L行为(杠杆、时机、退出、风险)+ P&L
归因无法归因滑块→行为映射、RD 设计、固定效应分解
负结果不发表专章呈现(null result 是核心贡献)

定位结论:本文是 LLM Agent 金融应用的第一份"人群规模行为志",方法论上是 measurement study 对 AI Agent 生产系统的首次完整移植。

三、问题定义

具体问题:数千个生产环境中的 LLM 交易 Agent,其行为由什么决定?它们展现出的风险特征与盈利结构是什么?它们(或任何被测前沿模型)有没有方向性优势?

核心洞察(抽象):Agent 的市场行为是三层设计的乘积——模型(哪个 LLM)、策略文本(agent 的个性与"策略")、运营层(滑块约束、渲染的候选列表、下单路径机制)。人们直觉上把行为归因于前两层(“这个 agent 很激进因为它模型强/策略猛”),本文的抽象假设是:运营层的机制设计才是行为的一阶决定因素——用户通过滑块与界面理解系统,Agent 通过渲染与路径执行系统,策略文本夹在中间几乎没有实权。

形式化(几个核心可测量):

  • 行为归因:behavior ~ sliders + agent FE + model FE + controls(固定效应回归);机制识别用 RD(断点回归:榜单渲染的 top-3 截断线两侧的选择行为);
  • 风险结构:sizing 对波动率的弹性(按波动率六分位分桶的中位杠杆);爆仓在仓位配置空间的集中度;
  • 捕获效率:P(浮盈≥300bps | 24h) 与其中负收尾比例;机械 bracket 的反事实恢复;
  • 方向性优势:fleet 胜率 vs 匹配散户基准;前沿模型 paired-replay 的决策质量差异检验。

这个抽象的精妙:它把"LLM Agent 交易能力"这个含混问题拆成了"行为的决定结构"(可回归)、“风险的机制位置”(可定位)、“优势的存在性”(可检验)三个可测量问题。

四、问题解法

4.1 两套生产系统的数据底座

DX Terminal Pro(2026.2–3):3,505 个用户注资金库,每个是 Qwen3-235B Agent,在 Base 链的 12 代币 memecoin 市场交易真实 ETH,21 天、750 万次单模型调用、约 30 万链上动作。DXAP live alpha fleet(2026.6–8):500–599 个用户创建的 Agent(91–117 个并发活跃)在 Hyperliquid 永续合约交易,23 万多工具轮、14,596 笔成交,另含一小本真金账户(全文凡涉及处显式标注,从不与 paper 账户静默合并)。

数据纪律是本文的隐形主角:遥测按 turn id + attempt id + 当时生效的模板/配置版本做历史归因(绝不用当前 roster 回填);跨时代的 builder fee 统一按 5.5bps 重述——重述后 fleet 亏损 -$217K,证明亏损不是费用的产物。

4.2 证据分级制度

每个结论标注四级之一:firm(全窗口注册分析+日聚类置信区间+至少一个消融/置换检验)、provisional(正向但窄/敏感)、weak、retracted。论文明说该计划历史上撤回过三个结论(一个时间戳伪影、两个被日历足迹检验杀掉的"仅净头寸为正"声明)——并把撤回写进正文而非藏进附录。

4.3 因果识别设计

  • 滑块→杠杆:风险滑块每升一级杠杆 +0.425(agent 固定效应吸收 60% 方差后依然显著);
  • 榜单渲染边界 RD:榜单渲染 top-3 截断线两侧,Agent 的选择行为断点 1.75×——渲染边界(纯系统设计)因果地路由了选择;
  • paired-replay 联赛:416 个从生产捕获的真实场景,让前沿模型在相同输入下重放决策,直接比较模型间的决策质量。

五、评估指标与实验证据

四大发现及其证据:

发现一:运营层决定行为。风险滑块→杠杆 +0.425/级;agent 固定效应吸走 60% 方差;榜单渲染边界 RD 1.75×。跨系统对照补充:一个系统里"策略文本"在另一个系统里被证明几乎不影响行为(策略文本 vs 约束的交叉对照)。三层设计的解释力排序被定量建立:运营层 > 模型/个体差异 > 策略文本。

发现二:sizing 对波动率失明。六个波动率六分位的中位杠杆全是 5.0×——Agent 完全不根据市场波动调整仓位。爆仓集中度更触目:一个 posture-slider 格(占账本 11%)持有 62% 的爆仓。强制数值重述(要求 Agent 复述风险参数)干预失败——Agent 说得出规则但执行时不应用。

发现三:捕获鸿沟。43.2% 的仓位在 24 小时内出现过 ≥+300bps 的有利浮动,但其中 49.3% 以负收益收尾——Agent 够得到利润却拿不住。机械 bracket(同时挂止盈止损)的反事实回测可挽回 +39.0 bps/仓位。这是全文对"LLM 交易者行为结构"最具体的解剖:问题不在进场的判断,在退出的纪律。

发现四:无方向性优势(null result)。DXAP fleet 不盈利:胜率 41% vs 匹配 Hyperliquid 散户基准的 50%。416 场景 paired-replay 中,前沿模型的决策质量统计上不可区分(在此时间尺度),但选择的稳定性跨模型家族差异巨大。论文没有掩饰这个 null,反而以它为锚预告了后续开发计划(harness 工程仍是第一收益来源、子代理与工具面、风险对齐作为部署检查、模型训练与环境构建、把基准测试当基础设施)。

证明力评估:所有头条结论都过了日聚类推断、置换零分布、共同费率重述三道关;生产数据+真金标注+撤回制度构成罕见的可信度基础设施。局限:两系统同源(一个 design lineage),外部效度待其他平台复制;paper 账户的撮合机制(零滑移、保证金占位)与真实 venue 有差。

六、效果优势的根源解释

(本文是记录式研究,“优势"体现为相对于排行榜文献的解释力优势。)

排行榜文献的根本缺陷:把 P&L 当行为代理。但 P&L 是市场随机性主导的薄尾输出(论文证明 fleet 无方向性优势,即 P&L 大部分是噪声),用它当因变量等于用骰子点数回归。记录式研究的机制优势:直接测量行为的中间变量(杠杆、时机、退出、选择),它们与设计参数的因果链短、方差低,因此可归因。

三层归因的机制解释:为什么运营层碾压策略文本?因为 Agent 的感知与动作界面完全由运营层构成——滑块定义了动作空间硬边界,渲染列表定义了选择菜单,下单路径定义了动作如何落地。策略文本要影响行为,必须先"穿透"这些界面;而 LLM 对长上下文中的软约束遵循本来就弱。滑块的 +0.425/级 与 RD 的 1.75× 是界面直接塑形行为的两个断面。这也顺带解释了发现二:波动率响应缺失是因为没有哪个滑块叫"波动率”——界面上没有的维度,Agent 不会自己去想(策略文本里的风险条款没有机制抓手)。

捕获鸿沟的机制解释:退出纪律是纯执行问题,而 LLM Agent 的执行循环被触发器与轮次节奏驱动——它没有"挂单离手"的机制概念,倾向主动盯盘、主观止盈,于是利润在犹豫中蒸发。机械 bracket 的 +39bps 恰是把退出从"生成式决策"降级为"基础设施"后的收益——与发现一(运营层决定行为)形成自洽闭环。

paired-replay 的 null 的机制解释:同输入同候选下前沿模型决策不可区分,说明此时间尺度上的"交易智能"不是当前模型间的差异轴——决策质量被场景噪声淹没。但选择稳定性差异巨大提示:模型差异体现在"主见程度"而非"对错率",这对未来的集成/对冲式部署有直接含义。

七、必要知识反推

领域知识层:

  • 加密市场微观结构(永续合约、保证金与爆仓机制、链上交易、builder fee、memecoin 市场结构)——不懂这些就无法设计遥测 schema 也无法解读行为;
  • 内部人视角的交易系统运营(金库、榜单、滑块、posture 配置的产品语义);
  • LLM Agent 的 harness 架构(触发器、记忆、配置版本化、工具循环)。

方法论知识层:

  • 生产系统 measurement study 的全套纪律(schema 设计、join 键、归一化、证据分级、撤回制度);
  • 因果推断工具箱(固定效应回归、断点回归 RD、日聚类标准误、置换检验);
  • 反事实回测的设计(bracket 的机械重放)。

工程知识层:

  • 双遥测栈(Athena + ClickHouse)的数据工程;
  • 2.5 分钟估值快照、成交归因、真实/模拟资金隔离标注;
  • preregistered 探针的设计与执行(H2 的隐式风险表征探针)。

知识融合的关键节点:融合发生在"微观结构金融学(什么行为在市场里致命)“与”Agent 行为学(什么设计塑造 LLM 行为)“之间。金融人知道杠杆失明与捕获鸿沟是致命伤,但不会想到去测"渲染边界是否因果路由选择”;Agent 人懂 harness 与界面,但缺"哪些行为差异在真金环境里有经济后果"的判断。作者以运营者身份持有两边的完整语境,才设计出"行为决定结构"的三层归因——记录的价值不在数据量,在于每个字段都同时是金融变量与设计变量。

八、论文中可以提取的通用性灵感

1. 先建记录,再建理论。 核心思想:一个快速演化的应用领域,第一优先级是可信的行为记录(遥测+归因+证据分级),而非急着下结论。 论文证据:本文以"field lacks a record"开篇,用记录本身构成核心贡献,null result 与正结果同等发表。 推广场景:AI 任何新应用场景(教育、医疗、法律)的落地初期;企业内部 AI 部署的审计基建;监管科技的数据底座。

2. 行为由界面决定,不由声明决定。 核心思想:智能体的"性格"与"策略"(声明层)对其行为的影响,远小于它感知与动作所经的界面(运营层);改行为先改界面。 论文证据:滑块+0.425/级、RD 1.75×,策略文本近乎无效;无"波动率滑块"导致波动率失明。 推广场景:AI 产品的安全设计(约束做成机制而非提示词);组织管理(流程界面 vs 价值观宣贯);教育产品的默认选项设计。

3. 捕获率与命中率是两个独立指标,后者常掩盖前者的溃败。 核心思想:够到收益与拿到收益是不同能力;只看最终盈亏会错过"会进场不会退出"的结构性缺陷。 论文证据:43.2% 仓位曾 +300bps 而 49.3% 负收尾;机械 bracket 挽回 +39bps。 推广场景:销售漏管的线索转化分层;创业公司的机会管理;个人知识管理(收藏≠掌握)。

4. 把退出纪律做成基础设施,而不是交给实时智能决策。 核心思想:对一致性要求高于智能性的环节,应从生成式决策降级为机械机制。 论文证据:bracket 的确定性挽回 vs Agent 的主观止盈亏损。 推广场景:自动化系统的安全阀设计;个人理财的自动定投/止盈;软件发布的自动回滚阈值。

5. null result 是公共品,撤回制度是可信度的复利。 核心思想:诚实发表"没效果"与主动撤回自己的错误结论,是稀缺但高价值的研究基础设施。 论文证据:方向性优势的 null 成为核心发现之一;三个撤回被写进正文并转化为 17 条方法论戒律。 推广场景:企业内部 A/B 文化的"负结果库";学术社区的注册报告制度;产品复盘的"我们错了"档案。


本文基于 arXiv:2609.05663 全文精读撰写。数据与结论均引自原文。