论文链接:arxiv.org/abs/2607.28956 代码:github.com/KhanCold/merchantbench 发表时间:2026 年 7 月(v2 更新于 2026 年 8 月 4 日) 机构:阿里巴巴集团 × 浙江大学 State Key Lab of CAD&CG × 浙江大学软件学院 × 北京大学软件与微电子学院 × 复旦大学计算机学院(企业 + 多校合作) 一句话总结:让 LLM Agent 开一整年网店,最好的模型也只赚到了人类 27.3% 的净资产——问题不是不会做,而是难以"长期保持会做"。


一、论文背景

1.1 什么是"长期连贯性"(Long-Term Coherence)?

过去两年,LLM Agent 评测经历了一场繁荣:AgentBench、WebArena、τ-Bench、AppWorld……这些基准测量工具调用、网页交互、应用控制、状态改变式工作流,模型得分一路飙升。但它们几乎都共享一个隐含前提——任务是有界的(bounded),且带有即时、明确的成功标准:预订一张机票、完成一次退款、在网页上找到某个信息。任务有起点、有终点、有判分点,就像百米冲刺——发令枪响,全力跑十秒,撞线,结束。

然而真实世界的部署根本不是百米冲刺,而更像一场马拉松。马拉松比的不是瞬时速率而是配速能力——你需要在几个小时的持续消耗中不断根据身体反馈调整策略:什么时候补水、什么时候减速、什么时候冲刺。跑崩的人往往不是起跑太慢,而是中途失去了对全局目标的把握。Agent 的真实部署也是如此:环境状态持续存在、早期行动约束后续选择、关键后果可能要在很多次中间决策之后才浮现。论文把这种在扩展视野下保持目的性行为、并根据累积证据调整决策的能力称为"长期连贯性"。

已有的证据表明,即使最先进的 Agent 也常在长视野任务中"崩盘"。但现有评测难以系统性地度量这种失败——因为它需要三个条件同时满足:环境持续、反馈延迟且不均匀、不连贯行为产生可测量的累积效应。

1.2 为什么选"卖家电商运营"这个场景?

论文的选择很讲究:让 Agent 当一年网店老板。这个场景天然满足长期连贯性评测的三个必要条件:

  1. 反复且相互依赖的决策:选品、上架定价、现金流管理、异常处理四个环节环环相扣——今天进的货决定明天能上架什么,上架的价格决定订单量,订单占用现金又反过来限制下一步采购。不存在"做完就结束"的孤立任务。
  2. 混合延迟反馈:上游供应商事件(调价、下架、发货延迟)即时可见,而下游订单结果(取消、缺货、退货、差评)延迟返回。一笔订单从下单到结算要经历采购、发货、签收、结算多个阶段,异常结果往往晚到数天。
  3. 不连贯行为有可测的累积代价:一个月不补货、不调价,损失会直接写进净资产曲线。不连贯不是"风格问题",而是真金白银。

换句话说,电商运营是一个"不保持连贯就必然亏钱“的环境——这正是评测所需要的强信号。

二、论文定位和关联工作

2.1 长期经营类基准的谱系

在 MerchantBench 之前,长期经营类评测已有两条代表性路线:

  • Vending-Bench / Vending-Bench 2(Andon Labs):让 Agent 经营自动售货机。周期相对短、商品种类极少、决策维度单一(基本只是进货和定价),无法构成复杂耦合。
  • RetailBench(2026):模拟超市管理,但基于固定目录的 96 个杂货商品,需求静态,缺乏订单级生命周期跟踪。

论文指出,卖家侧电商同时引入了这两个环境都不具备的两个挑战:其一,反馈通过单个订单生命周期生成——一条上架决策立刻创建订单并占用现金,而履约失败和售后结果很晚才可见,Agent 必须把晚到的结果与早期决策关联起来;其二,长周期本身不构成考验——如果商品和需求静态不变,“熬时间"就够了。MerchantBench 用全年需求轨迹制造了一个变化的机会集:有前景的新品不断涌现,旧选择不断贬值,Agent 必须持续识别机会、修订组合。

2.2 MerchantBench 的差异化定位

在更广的图谱上:购物/客服类基准(WebShop、ECom-Bench、ShoppingBench)评测任务、对话或交易;市场类环境(Market-Bench、Magentic Marketplace)评测经济 Agent 间的竞争;长视野通用基准(UltraHorizon、OdysseyBench、OSWorld 2.0)覆盖工作流、网页导航、计算机使用。没有任何一个评测"同一家网店的持续经营 + 订单级延迟反馈 + 非平稳真实需求”。MerchantBench 补的正是这个空位,并首次把"双维连贯性分析”(操作连贯性 × 战略连贯性)作为一等公民指标。

三、问题定义

3.1 形式化:扩展视野下的目的性行为维持

论文把网店运营形式化为一个有限视野部分可观察马尔可夫决策过程(POMDP):

  • 视野:仿真器以 1 小时为一步推进,控制视野 365 天,共 H = 8,760 步;Agent 每 12 小时获得一个决策窗口(约 730 个窗口)。
  • 状态:仿真时钟、商品需求画像、供应商状态、店铺上架与财务、活跃订单、待决事件——大部分对 Agent 不可见。
  • 部分可观察性:需求画像、风险参数、未决结果、未来事件时间均为潜在变量,Agent 只能基于观察历史与工具结果做决策。这是评测"连贯性"的关键——你必须记住并关联跨越很长时间的证据。
  • 目标:中间奖励为零,唯一目标是最大化期末净资产期望 J(π) = E[R(s_T)],其中净资产 = 现金余额 + 保证金 + 在途资金 + 应收款。经营中途保证金耗尽则强制歇业。

这个"零中间奖励 + 纯终点回报"的设计很锐利:它排除了任何靠即时反馈"刷分"的可能,逼着 Agent 自己维持对 365 天后那个终点的执着。

3.2 两类连贯性的区分

论文最重要的概念贡献是把"长期连贯性"拆成两个正交维度:

  • 操作连贯性:店铺干预行为本身是否持续?是否还在跟进先前的决策与延迟到期的结果?失败的形态是"活动衰减"——干预频率逐月下滑,最终店铺近乎停摆。
  • 战略连贯性:即使保持活跃,决策是否仍服务于期末净资产这一长期目标?失败形态是"战略漂移",又分两个子维度:目标一致性(决策是否还指向终点目标)与证据校准适应(是否随流动性、季节需求、累积经验正确地维持或修订策略)。

一个直观类比:操作连贯性问"商店是否还在开门营业",战略连贯性问"开门之后卖的东西对不对路"。两者可以独立失败——有的 Agent 勤劳地把货架换了个遍但全换错了方向(战略漂移),有的 Agent 方向没错但逐渐不再来店里(操作衰减),而且论文观察到后者往往源于前者。

四、问题解法:MerchantBench 环境设计

4.1 订单级仿真引擎:让"时间的错位"成为核心机制

MerchantBench 环境由上游供应商仿真、商家店铺、下游订单级仿真三部分组成,其精髓在于现金流与信息流的时间错位:

  • 订单即占用现金:环境遵循 1688 平台的一件代发模式(商家不压库存)。订单下单即刻触发采购,采购成功即扣减现金、转入"Procured"状态;订单随后经历发货、签收,签收后货款成为应收款,再经过一段采样延迟才结算入账。也就是说,每一笔新订单都在赚钱之前先花钱。
  • 异常结果延迟浮出:每个订单在创建时就被采样了一个潜在的顾客结果(正常履约 / 取消 / 仅退款 / 退货退款 / 差评),但这个结果及其实现时间对 Agent 隐藏,直到对应的生命周期事件发生才可见。缺货与延迟发货则内生于采购与履约动态。
  • 异常侵蚀店铺评分:缺货、延迟发货、退货退款、差评除罚款外(罚款 3–8 元不等,与真实平台规则一致),还会通过结果特定的体验分与证据权重压低店铺评分;评分每满一天更新一次,其星级档位直接决定需求乘数(低至 0.10,高至 1.20)——单个商品的问题会拖累全店需求。

Figure 1 所展示的核心动力学正是:即时流动性压力 ↔ 延迟异常反馈的耦合。Agent 必须像真实卖家一样跟踪每一笔订单的生命周期、回访自己几周前的决策。

4.2 真实数据 grounding:98,843 条商品记录

仿真不是凭空生成的。商品目录来自 1688(中国最大内贸批发市场)的真实数据:98,843 条商品记录、来自 36,576 个供应商,覆盖服饰、家居办公、家电、宠物园艺、玩具、箱包、运动户外等 10 个一级类目;每条记录带 365 天的日级需求历史(2025 年 6 月 1 日至 2026 年 5 月 31 日)与平台质量/履约信号。聚合需求保留了真实节律——618 与双 11 两波高峰、春节低谷,红包封、电风扇、热水袋等单品的季节性需求周期清晰可见。供应商事件(调价、下架、发货延迟)的发生概率也从真实平台履约信号校准。

这保证了"非平稳机会集"不是人造噪声,而是真实市场的纹理。

4.3 四模块任务结构与 26 个工具

Agent 通过 26 个商家工具与环境交互,任务自然分解为四个相互依赖的决策组件:

  1. 选品采购:日报、目录搜索、商品详情、供应商公开档案——需求与风险始终潜在,只能靠公开信号选。
  2. 上架与定价控制:上架、下架、改价、表现查询,构建并修订店铺组合。
  3. 现金流管理:财务与店铺视图暴露现金、保证金、占用资金、预期结算、罚款、歇业条件。
  4. 混合延迟反馈适应:供应商与订单工具在上游事件与下游结果浮现时揭示它们,驱动前三类决策的修订。

每个店铺初始现金 2,000 元、保证金 1,000 元、上限 50 个活跃上架位。

4.4 评估协议:8 模型 × 2 框架 × 3 重复 + 双基线

  • 8 个模型:GPT-5.6 Sol、Claude Opus 4.8、Qwen3.7-Max、Qwen3.7-Plus、GLM-5.2、DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi K2.6——2026 年的主流前沿与开源阵容。
  • 2 个框架:ReAct(最小控制器 + 26 工具,测核心规划推理能力)与 Hermes(26 工具 + 内置代码执行、规划、记忆、技能管理,测增强型 Agent 栈)。两框架都压缩长历史,且由被测模型自己担任摘要器。
  • 3 次重复:共 48 次全年运行,报告均值并考察变异性。
  • 双基线:Rule-based(每日检查、下架滞销与受影响商品、按日报关键词补位)与 3 名人类参与者(无电商经验,通过运营仪表盘各完成一次 365 天经营,历时 5 个自然日)。

上下文管理很现实:ReAct 历史达 16 万 token 时提示模型把重要信息摘要进持久记忆,然后截断到最近 3 万 token。这本身就构成了对"记忆维护能力"的考验——你记不下来的东西,就是会忘。

五、评估指标与实验证据

5.1 指标体系:终点指标 + 过程指标

  • 商业表现:期末净资产(主指标)、GMV、净利润率、订单数
  • 店铺可靠性:总罚款、平均店铺评分、订单异常率
  • 长视野活跃度:平均活跃上架数、SWR(Sustained Window Rate,持续窗口率)、总工具调用数

其中 SWR 是设计得最巧的一个指标:所有滚动 30 天窗口中,“至少包含一次环境工具调用"的决策窗口占比的最小值。注意那个"最小值”——它不看你平均多活跃,只看你最差的那 30 天还活跃吗。类比就是:一家商店全年营业额再高,如果曾经整整一个月没开门,SWR 就会暴露它。人类参与者的 SWR 是 100%——没有人会把自己的店晾在一边一个月不管。

5.2 主结果:16 配置全景表

Table 1 给出了 16 个 LLM 配置与双基线的全年成绩(三次运行均值)。几个关键读数:

  • 最高配置:Qwen3.7-Max + Hermes,期末净资产 59.46 千元,GMV 116.76 千元,1,929 笔订单——16 配置之首。
  • 人类均值:净资产 217.61 千元,GMV 608.06 千元,9,442 笔订单。最佳 LLM 配置只有人类的 27.3%。
  • ReAct 内部最佳:GPT-5.6 Sol(40.89 千元);跨框架按模型平均,GPT-5.6 Sol 最高。
  • Rule-based 基线 24.48 千元——注意,这个"每天机械检查+按关键词补货"的朴素规则,净资产竟超过了 16 个 LLM 配置中的大多数。多个 LLM 配置(尤其 DeepSeek-V4-Pro ReAct 的 6.56 千元)被一条规则脚本击败,这个事实本身就值得所有 Agent 从业者深思。

5.3 框架效应:Hermes 平均比 ReAct 强得多

8 模型平均下,Hermes 比 ReAct 净资产 +53.3%、GMV +71.5%、订单 +71.2%。8 个模型中 7 个在 Hermes 下净资产提升,从 Claude Opus 4.8 的 +11.5% 到 Qwen3.7-Max 的 +187.8%;唯一例外是 Kimi K2.6(-4.1%)——框架收益强烈依赖底层模型。

Hermes 案例研究给出了机制线索:GPT-5.6 Sol 大量使用原生代码执行(一次运行 13 次 execute_code),第一个决策窗口就用公式 p = max(1.70c, c+6) 把 50 个候选商品批量算成定价组合、还先跑校验脚本确认最小利润率再上架;Claude Opus 4.8 则通过 261 次记忆调用维护带日期戳的"已验证/已否证"经营假设;24 个 Hermes 运行中有 17 个自创了"RealShop"技能并被后续复用(GPT-5.6 Sol 每次都创建,带 7–15 次补丁)。结构化记忆与规划确实能减轻状态丢失——但只对本来就偏量化记账的模型起放大作用,纯语言型操作者(GLM-5.2、Qwen3.7-Plus、Kimi K2.6 从不调用代码工具)几乎无感。

5.4 稳定性:均值高不等于可靠

三次重复运行的变异系数差异巨大:GPT-5.6 Sol(ReAct)仅 3.3%、Claude Opus 4.8(Hermes)10.0%,最稳定;而均值最高的 Qwen3.7-Max(Hermes)变异系数高达 55.1%——“最好的一次很惊艳,但换了随机种子就完全是另一次经营”。对真实部署而言,这提示均值与方差必须一起看。

5.5 风险响应分化:从"察觉异常"到"完整响应链"

面对延迟浮现的产品级异常,各模型表现出一道清晰的成熟度阶梯:

  • GPT-5.6 Sol / Kimi K2.6:把不利结果归因到责任商品并替换之——做到了"归因 → 移除"。
  • Qwen3.7-Plus:保留问题商品继续观察——有察觉,无行动。
  • DeepSeek-V4-Pro:退款发生后不修订任何受影响上架——连察觉都未转化为任何决策。
  • 人类参与者:下架问题商品,并按相似关键词寻找能保留原有需求的替代品——完整的"归因 → 移除 → 保需求替代"链条。

这条链的完整度,堪称 Agent 成熟度的试金石。店铺级适应同样分化:GPT-5.6 Sol 在评分承压时对无异常的成熟商品降价以增加正常结算、拉回评分阈值;Qwen3.7-Max 更激进——一次早期差评把店铺打到三星后,一口气重定价 40 条上架。

5.6 连贯性轨迹:衰减是渐进的

月度轨迹显示:人类 SWR 100%;LLM 在 ReAct 下从 10.6%(Kimi K2.6)到 99.4%(GPT-5.6 Sol),Hermes 下从 17.8% 到 66.1%。最刺眼的是 Qwen3.7-Max 的季度有效窗口率:Hermes 下 62% → 37%,ReAct 下 68% → 23%——全年最强的模型之一,经营活动在下半年逐渐熄火。GPT-5.6 Sol(Hermes)撑到 2 月才开始下滑(最后两月 81%、77%);Claude Opus 4.8 的月末活跃上架从 46 收缩到 8。衰减不是悬崖,是斜坡——这正是它危险的地方。

六、效果优势的根源解释

6.1 为什么最好的 LLM 也只有人类的 27.3%?

论文的轨迹证据指向两类渐进性失败:

(1)操作衰减:源于"干预收益递减"的误判。 深挖轨迹发现,控制循环逐渐收窄(Control-Loop Narrowing):选品与经营循环慢慢塌缩成对上游供应商事件的被动响应——还在查库存、看供应商,但不再主动选品、改价、替换、诊断。ReAct Qwen3.7-Max 的 SWR 只剩 11.1% 时,供应链检查占其剩余工具调用的比例从 14% 升到 34%。极端情况是过早放弃(Premature Abandonment):一次 Hermes Kimi K2.6 运行中,Agent 在第 104 天断定店铺已无救,此后 523 个决策窗口中 355 个不再采取任何环境行动——而实际上可行的动作一直存在。它不是做不动了,是以为做不动了。

深层原因在于:长视野中干预的回报是延迟且稀释的(今天补的货下周才卖出、下月才结算),而干预的成本是即时的(占用现金、暴露于风险)。人类卖家凭着对"开店"这件事的先验执着持续干预,LLM 则容易在多次干预未见即时回报后,逐渐把"等待"误判为最优策略。

(2)战略漂移:延迟反馈与即时指标的错位。 即便保持活跃,策略也可能不再被证据校准。证据有三:其一,流动性适应——人类在流动性改善后扩大采购价格带(前三月均值 43.4–53.1 元,后三月升至 58.7–90.8 元),高价实验失败时还会选择性退回低价高流量商品;GLM-5.2、DeepSeek-V4-Flash、Kimi K2.6 的价格带全年几乎平坦。其二,需求对齐——人类的需求对齐分从 6 月的 56.1 升到 12 月/1 月的 80+,LLM 的提升更弱或更不一致;Claude Opus 4.8 后期对齐分上去了,货架却从 37.3 个商品收缩到 12.0 个,利润并没跟上——对齐 without 广度等于白对齐。其三,记忆的错误固化为策略:一次 Hermes Claude Opus 4.8 运行中,Agent 错误推断"下架弱势商品会把流量集中到剩余商品",货架从第 54 天的 47 个活跃上架收缩到第 322 天的 3 个,尽管每条上架都有独立的需求机会;一次 Hermes Qwen3.7-Max 运行中,Agent 在第 282 天把终点误记成第 285 天,提前 83 天停止填补空位,直到仿真时间越过其臆想的终点才纠正——一次记忆错误,用 83 天的经营来买单。

另一个不可忽视的量级因素:人类做了 9,442 笔订单、8,311 次工具调用,把规模与单位利润做了平衡(论文附录显示,一个 Kimi K2.6 ReAct 运行跑出 3,004 笔订单但每单仅赚 11.1 元——规模本身不保证回报)。LLM 普遍在"敢不敢把赚到的钱再投出去"上远逊于人类。

6.2 为什么 Hermes 优于 ReAct?

平均 +53.3% 的框架优势来自一个朴素机制:结构化记忆与规划减轻了状态丢失。ReAct 的 16 万 token 截断机制意味着所有长期关联必须经由模型自己写的摘要存活;Hermes 的内置记忆、技能蒸馏(17/24 运行自创技能且 17/18 的技能被再次使用)与代码执行把"记住并复用有效程序"变成了框架能力而非模型负担。但 Kimi K2.6 的例外说明:框架是放大器,不是发生器——它放大本来就有的量化经营倾向,无法凭空注入。

七、必要知识反推

要做出这项工作,作者需要哪些储备?

领域层(电商运营全链路):一件代发的订单生命周期(下单→采购→发货→签收→结算 + 六类异常)、平台罚款与店铺评分规则(各类异常的罚款额、体验分与证据权重、星级-需求乘数映射)、季节性选品逻辑(618/双11/春节节律、品类轮动)。没有阿里 1688 的真实数据与规则知识,仿真会失真成玩具。

方法论层(基准设计与评测科学):POMDP 形式化(部分可观察性如何从机制上强制记忆)、长期连贯性的双维拆解(操作 × 战略,战略再拆目标一致性与证据校准适应)、过程指标设计(SWR 的"滚动窗口最小值"思想——用最差表现而非平均表现定义持续性)、人类对照实验(无经验人类 + 5 个自然日跑完 365 天、Rule-based 基线锚定"朴素策略"的下限)、需求对齐分与时间感知选品增益等反事实分析设计。

工程层(大规模仿真与成本控制):订单级仿真引擎(小时级推进、泊松订单生成、价格弹性与店铺评分联动需求)、基于真实数据校准的风险概率(下游结果概率 × 上游事件强度的联合分布)、48 次全年运行的多模型评测管线(上下文压缩策略、3 次重复控制随机性、工具调用计量)。全年 8,760 步 × 48 次运行的规模本身就要求相当的工程投入。

八、通用性灵感

即使不做电商 Agent,这篇论文也有三点可以直接迁移:

1. 过程指标优于终点指标:SWR 式"最差窗口"诊断高分掩盖的停摆。 一个期末净资产还不错的 Agent,可能靠前三个月的积累"躺平"了后九个月。任何长期系统评测——长期运维 Agent、长周期项目自动化、甚至个人知识管理工具——都可以定义自己的 SWR:用"最差的 30 天里你还在主动干预吗"来替代"平均而言你多活跃"。平均值会撒谎,最差值不会。反过来,评估别人给出的长周期成绩时,先问一句:它的 SWR 是多少?

2. 混合延迟反馈设计可迁移到任何长期系统评测。 “上游即时可见 + 下游延迟返回 + 结果回溯影响全局声誉"这一机制组合,是制造"必须回访先前决策"压力的最小充分设计。做长期编程 Agent 评测(提交代码即时成功,线上故障一周后才报警)、长期投资 Agent 评测(下单即时,业绩季度后结算)都可以套用同一骨架:让每个决策的代价先到、回报后到、声誉全局耦合。这也提示 Agent 开发者:把"未决事项跟踪”(pending order tracking)做成一等公民数据结构,而不是指望上下文窗口自然记住。

3. 风险响应完整链(归因 → 移除 → 保需求替代)是智能体成熟度试金石。 察觉异常只是第一步,归因到具体对象、移除风险源、还要想办法保住背后的需求才是完整响应。这个三段式框架可以直接用来评估任何容错型 Agent:客服 Agent 出错后是只道歉(察觉)、换话术(归因),还是重建整个解决方案(保需求替代)?论文里连最强模型都普遍断链在第三环,而人类自然完成了全链——离终点最近的差距,恰恰在最不起眼的收尾环节。

附录:关键数字速查

指标数值
真实商品记录 / 供应商数98,843 / 36,576(来自 1688)
仿真视野 / 步长365 天 / 1 小时(Agent 每 12 小时一个决策窗口)
工具数 / 决策组件26 个 / 4 个模块
运行规模8 LLM × 2 框架 × 3 重复 = 48 次全年运行
最佳配置净资产Qwen3.7-Max + Hermes:59.46 千元
人类均值净资产217.61 千元(最佳 LLM = 人类的 27.3%)
Rule-based 基线24.48 千元(超过多数 LLM 配置)
框架平均效应Hermes:净资产 +53.3% / GMV +71.5% / 订单 +71.2%
框架例外Kimi K2.6 在 Hermes 下 -4.1%(8 模型中唯一)
最大单模型框架增益Qwen3.7-Max +187.8%
稳定性极值GPT-5.6 Sol ReAct 变异系数 3.3% vs Qwen3.7-Max Hermes 55.1%
SWR 范围人类 100%;LLM 最低 10.6%(Kimi K2.6 ReAct)最高 99.4%(GPT-5.6 Sol ReAct)
活动衰减样本Qwen3.7-Max 季度有效窗口率:Hermes 62%→37%,ReAct 68%→23%
人类采购价格带演化前三月 43.4–53.1 元 → 后三月 58.7–90.8 元
店铺初始配置现金 2,000 元 + 保证金 1,000 元 + 50 个上架位