FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 精读

论文链接:FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 代码仓库:github.com/Analogy-AI/fm-bench 发表时间:2026 年 8 月 18 日(arXiv 2608.18423) 机构:AnalogyAI(企业独立完成;通讯作者 Chi Li, chili@analogyai.org) 领域标签:cs.AI / agent 评测 / 长程决策


一、论文背景

LLM agent 已经能可靠地完成"有界任务"。修真实的 GitHub issue(SWE-bench)、解竞赛级推理题、操作电脑完成工作流(WebArena、OSWorld)、编排多步工具调用(ToolBench、τ-bench)——这些任务有一个共同结构:通往正确答案的路径很短,环境是静态的,错误不会复利累积,而且没有竞争者。

但真实世界里有一大类工作不满足任何一条上述假设:经营。一家公司的 CEO、一支球队的经理,面对的是"动作有累积后果、且环境会响应你的选择“的决策流——今天省下的青训投资,五年后变成成绩断层;今天对某卖家的低价试探,明天变成对方记住的加价。这类能力在现有基准谱系中几乎完全没有被测量过。

论文把这种能力命名为"管理”(management):在对手争夺同样机会的长视野中运营一个组织,早期决策重塑世界,绩效在"你自己的决策所创造的条件下"被累计评判。两个现实性维度——长视野与竞争 agent——在此前的基准中各自被推进过,但从未同时达成。

一个类比可以抓住差别:有界任务像"一次考试"——题目给定、时间有限、答完交卷;FM-Bench 像"经营一家公司二十年,还要跟对手抢人、抢市场、抢每一个转会窗口"——没有交卷时刻,每个季节的荣誉都计入最终成绩,对手会研究你的行为并针对你调整。前者的失误损失一次得分机会,后者的失误会滚成雪球:破产清算、信心崩盘被解雇,都可能从几个赛季前某个"看起来免费"的决定开始。

FM-Bench(Football Management Benchmark)就是为测量这种能力而建:一个 LLM agent 经营一家足球俱乐部 20 个游戏年,通过 26 个工具、约 340-400 个决策节点完成选秀、转会、合同谈判、设施与青训投资、阵容战术设置,并向一个可以解雇它的董事会负责。全部评分由确定性引擎累计计算,没有 LLM judge,也没有人类评分员。


二、论文定位和关联工作

论文把相关工作切成三条谱系,FM-Bench 站在三条谱系的交汇处:

谱系代表工作推进的维度关键局限
有界任务基准SWE-bench、GAIA、AgentBench、ToolBench、τ-bench、WebArena、OSWorld工具调用正确性回合短、环境静态、错误不复利
长程单维谱系终端马拉松/Long-Horizon-Terminal-Bench、UltraHorizon、NetHack/TextWorld/BALROG 等游戏环境数百步执行;反应式技能要么追求固定交付物于静态世界,要么奖励反应而非经济规划
经营模拟谱系Vending-Bench(售货机数月)、MerchantBench(网店)、YC-Bench/Ceo-Bench(创业一年)、CFO-Bench(公司财务 11 年宏观周期)、StockBench数月至数年的经营时间环境不还手:StockBench 回放真实市场而 agent 动作无法撼动它;CoffeeBench 一次只测一个模型对固定参考 agent
竞争短程谱系MultiAgentBench、BattleAgentBench(短回合合作/竞争)、Cattle Trade(单 session 议价/唬人,TrueSkill 排名)、Vending-Bench Arena(3 模型共享售货市场,仅有排行榜页面)竞争 agent视野短、无组织需维持、规模小
Arena 式排行Chatbot Arena成对人类偏好投票模型之间从不交互

FM-Bench 的定位:第一个同时落在"长程 × 竞争"双轴上的基准——20 游戏年的视野 × 15 个前沿模型加 1 个脚本锚在同一个共享世界里头对头(论文自称"据我们所知,该规模与视野下的首个头对头评测"),配合确定性引擎评分与可复现的结果盖章(stamping)机制。它与最近的 CoffeeBench(90 天咖啡烘焙多 agent 经济)相比,视野长 80 倍、对手是真实前沿模型而非固定参考脚本;与 Vending-Bench Arena 相比,从 3 个模型扩大到 16 席且发布了完整技术报告与开源代码。

还有一个方法论近亲:AgentAtlas 主张"结果排行榜混淆了不同能力,需要行为级分解"——FM-Bench 的六项行为能力分析正是这一主张的落地。


三、问题定义

3.1 核心测量问题

“在长视野且存在竞争者的环境下,agent 能否持续做出有效决策”——具体分解为:当状态永远不完全可见、动作后果跨年累积、环境针对你的行为反适应、多重目标互相牵制时,模型的管理行为是什么样的,哪些行为把高分模型与低分模型区分开。

3.2 四需求 → 四能力映射

论文的核心洞察是:“管理"不是一句 prompt 里的角色扮演,而是四项可被机制实例化的压力。每项需求都有具体游戏机制、目标能力与校准旋钮:

需求机制实例目标能力校准旋钮
隐藏信息球探报告带永久性个人偏差;球员隐藏特质(伤病倾向、发展率、老化起点、稳定性、风格适配);谈判中卖方隐藏真实要价噪声下的估值校准球探带宽、偏差 sigma
累积后果青训与设施投资多年后兑现;破产→清算(扣分+强制出售);信心崩盘→解雇;两者复合但可恢复;荣誉逐年累计入终分长程信用分配、趋势识别、止损成长/老化曲线、螺旋阈值、警告节奏、荣誉权重
反适应市场被拒报价抬高隐藏要价;重复与同一俱乐部交易被加价;反反转计数器;谈判冷却;按种子错定价策略适应加价率与衰减率
多目标压力董事会联合评判成绩与财务纪律;赛季目标随阵容强度调整多约束平衡目标缓冲、董事会耐心

这张表是整篇论文的地基:四需求不是描述性的,而是每一项都对应可调参数的机制,使得"难度"成为可校准的量而非运气。录制的运行中,模型对四项需求各有典型失败:一个中档模型让球员把工资从 12→14→17→18M 一步步谈上去(需求 1 失败,无法估值),随后工资超收入破产(需求 2);所有模型都在低估一个"被拒就加价"的市场,完成一笔签约的报价次数中位数高达 30 次(需求 3);一个小模型在每次运行中都被董事会解雇(需求 4)。

3.3 为何确定性引擎是前提

评分若依赖 LLM judge 或人类评分员,20 年 × 16 席的评测在成本与一致性上都不可行,更无法谈复现。FM-Bench 的引擎从种子确定性生成一切(选秀池本身也是种子的函数),随机流是 (领域, 实体, 日) 的纯函数;唯一的非种子输入就是 agent 自己的决策。这带来三个后果:

  1. 单次共享运行自有效——Arena 里 16 个席位跑在同一个世界上,不需要重复采样平均来消除环境噪声;
  2. 结果可盖章复现——每个结果文件标注引擎 commit、参数哈希、评分版本与完整旋钮集,任何运行可从动作日志位级回放;
  3. 评分函数可被证明无套利——附录 I 证明了"提前被解雇封顶损失"不可能有利可图、公平价格转会不能灌水净值通道、对数压缩保证无通道能跑飞。

四、问题解法

4.1 世界机制详解

基本盘:16 支球队的职级联赛,20 游戏年 × 360 天/年,每季 30 轮双循环,任意时刻约 470 名完全模拟的球员在世,一次 20 年运行跨越约 2,000 名不同球员(青训流入、老将退役)。全世界无任何真实姓名或数据——记忆中的足球知识无法泄漏进来。

起点公平:每家俱乐部以相同壳开局——声誉 70、38,000 座球场、50 个共享模板池上的 100M 信用选秀预算;未用完的预算加 50M 津贴转为开业现金。选秀时各队的选择是独立副本,互不干扰——这一设计消除了"先手选走好球员"的座位混淆。

决策节点(stop):引擎逐日模拟,只在决策节点暂停——每季 13 个固定日程节点(赛季前董事会、夏窗计划、夏窗截止、阵容锁定、月报、冬窗、中期审查、赛季结算、青训 intake 等)加约 6 个事件驱动节点(报价批次、合同到期、重大伤病、董事会警告、破产警告、清算、复兴),每季约 19 个,全程约 340-400 个。每个节点推送统一包:节点类型、一览摘要(联赛位置/积分/赛季目标/现金/工资比/董事会信心/伤病/下轮对手/开放窗口/警告)、上次节点以来所有事的收件箱(19 类未请求事件)、待处理报价、agent 最近 10 个改变状态的动作、以及它的笔记本。节点内 agent 想用多少轮工具调用都行(30 次查询预算、10 次谈判动作预算、笔记本免费、软上限 40 轮硬上限 60),最后调用 advance 推进时间。不行动是保守而非致命:报价过期、阵容战术延续、常设指令(最多 10 条单条件规则)自动执行——但刻意设计得太弱,无法替代逐节点判断。

26 个工具分四族:12 个查询工具(get_squad、get_transfer_market、get_finances 等,消耗查询预算)、11 个动作工具(make_transfer_offer、offer_contract、invest、set_lineup、promote_youth 等,谈判动作消耗谈判预算)、2 个笔记本工具(append_note/rewrite_notes,免费)、1 个控制工具 advance。人类网页游玩模式的每个按钮与工具一一映射——人机同轨,这是人类实验可比性的来源。

记忆设计:每个决策节点都是一场全新对话,无聊天历史延续。四层记忆:包自动上下文(引擎免费推送)、档案(get_history 按需查询任何赛季的最终表/荣誉/转会)、笔记本(唯一的跨节点自写状态,承载 agent 的意图与理由,注入每个包)、审计日志(记录每个动作用于回放与防作弊,永不回馈给 agent)。设计动机有三:20 年的历史远超任何上下文窗口,遗忘策略不可避免,笔记本让它是显式且有界的;若 harness 做摘要/检索,分数就部分测的是 harness,现在模型间唯一差异是它们选择写下什么;决定"未来的自己需要知道什么"本身就是被测能力的一部分。

评分函数:S_raw = 18·ln(1+max(H,0)/60) + 10·sign(VA)·ln(1+|VA|/40) + 6·ln(1+max(M,0)/80),其中 H 为累计荣誉分(冠军+100、前四+20),VA 为净值增值(最后三季净值均值按 4%/年通缩,减去 day-0 净值),M 为阵容价值(低权重稳定器,防止囤现金卖阵容者靠净值通道赢)。净值记账含反囤积设计:现金超过年工资账单 3 倍的部分只按 0.3 计。提前结算(被解雇/破产/放弃)乘折扣 ρ = 0.8·(t/T)^1.5 且只作用于正分部分——死得早不能封顶损失,也没有"故意被解雇止损"的套利(附录 I 命题 A.1 证明)。全部权重与除数是校准常数,在免费脚本锚上调整并冻结于任何计分运行之前,每次调整须同时满足四准则:锚阶梯单调(random < idle < heuristic < oracle)、区分度、oracle 天花板为正、不饱和。

4.2 双模式设计逻辑

  • Solo 轨:1 个被测模型对 15 个脚本俱乐部,报告绝对 S_final。15 个对手是同一个 manager 实现的 5 个能力旋钮 × 三档(easy/medium/hard),按初始现金排名的席位做冻结的 hard-medium-easy 循环分配——金钱与能力去相关,每个被测模型面对完全相同的世界。
  • Arena 轨:15 个 LLM + 1 个脚本锚放进同一个共享 20 年世界——每一次签约都在剥夺对手得到同一名球员的机会。

Arena 的方法论难题是:16 个席位只有一个世界、没有重复采样,如何保证测量有效?答案还是机制设计三件套:等禀赋选秀(同预算、独立副本,无人因座位受益)、密封竞标冲突解决(冲突报价按第一价格密封拍卖解决、清算价格不公开,无人能通过观察对手报价获得信息优势)、封顶复兴(被解雇/破产最多 3 次重启、按 0.8^k 折扣,单次运气不终结测量)。座位混淆被机制消除,而不是靠多次采样平均掉——这是本文评测设计上最值得学习的一手。

4.3 结果盖章与校准

每个结果文件带引擎 commit、参数哈希、评分版本、完整旋钮集四重戳记;榜单工具对混合配置池发出高声警告。固定 harness 锁定模型 ID、温度与提示词,跑在提供商推荐的全推理配置上——绝不为省钱削弱推理,任何降级到 no-thinking 的设置都被戳进结果文件,推理开/关的池子永远无法悄悄合并。可复现性做到极端:284 项测试套件(含黄金哈希行为守卫、全工具路径回放位一致、崩溃恢复等价、AST 真值隔离),脚本基线与校准套件在笔记本上免费跑(20 模拟年单核 76 秒);Open Track 提交 HMAC 签名、服务端回放复验;计分世界用盐化种子(有效种子 = HMAC-SHA256(秘密盐, 公开 nonce)),轮次结束后披露——世界不可预猜,但每局可审计。

4.4 四个参考席

oracle(读真值的特权脚本)、heuristic(纪律性盲脚本:工资控制在收入 60% 以下、续约年轻核心、32 岁以上出售、按疲劳轮换、按对手排名切换风格)、idle(从不行动)、random(抛硬币应价+随机动作)。oracle 的特权是信息而非权力——所有动作走同一 26 工具接口与预算,它以精确阈值出价(每笔签约 1 次报价成交)、精确保留工资续约、真潜力青训截胡、峰值时机出售、每节点重解首发。四个参考席把刻度尺的上下两端钉死。


五、评估指标与实验证据

5.1 Solo 总榜:15 模型 + 4 参考席(三种子 1/1024/2026 均值 ± 标准差)

席位S_final标准差tokens
oracle(特权)95.54±4.68—
claude-fable-590.94±5.2024M
kimi-k2.688.49±0.1587M
gpt-5.6-terra86.66±1.2028M
gpt-5.6-sol86.40±2.5362M
muse-spark-1.183.19±12.0373M
glm-5.283.17±0.9258M
grok-4.581.82±9.87191M
qwen3.7-max80.66±10.3847M
deepseek-v4-pro79.15±2.67194M
gemini-3-flash79.06±13.4551M
claude-sonnet-575.75±5.0339M
claude-opus-4.875.02±2.4631M
gemini-3.5-flash74.59±11.02154M
minimax-m368.37±12.3374M
claude-haiku-4.536.90±22.7386M
heuristic17.05±12.34—
idle−0.90±1.86—
random−17.21±2.45—

(注:token 数为论文 Table 2 从运行清单重算的口径;附录 J 明确记录早期流传的汇总文件混入了十个模型的旧运行数据,本表为准——最少 24M 是冠军 claude-fable-5,最多 194M 是 deepseek-v4-pro,grok-4.5 的 191M 次之,glm-5.2 为 58M。)

从总榜可以读出六层结构:

  1. 冠军达特权 oracle 的 95%(90.94 vs 95.54),但两者都只在一个约 145 的宽松上界的三分之二处——区分了模型而不饱和。
  2. 开源与闭源交错:开源 kimi-k2.6(88.49)压过两个 GPT-5.6 变体;规模、价格、厂商均不预测排名——同厂商内 claude-fable-5(90.94)与 claude-haiku-4.5(36.90)相差 54 分。
  3. 稳定性本身分层:kimi-k2.6 三个种子波动仅 0.15 分(“整个战役最稳的模型”),claude-haiku-4.5 波动 22.73 分,四个模型摆动超 20 分——强均值可能掩盖崩溃。
  4. 全部 15 模型完成全部视野,而盲脚本基线在 9 次运行中死了 7 次——前沿模型与脚本的分界线首先是生存。
  5. idle 为负、random 更负:在这个环境里,无知的行动比不行动毁灭更多价值。
  6. 排名只在视野后期才 settle:seed 1 上最优到最差的分差从第 5 年的 17.3 分扩大到第 20 年的 37.3 分,与最终排序的秩相关从第 5 年的 0.19 爬到第 15 年的 0.78;deepseek-v4-pro 在第 5 年和第 10 年都领先却最终只排第 12,最终冠军 claude-fable-5 第 5 年仅列第 5。更短的视野会排出一组不同的模型——这是对整个基准社区的一记提醒。

5.2 Arena:一个共享世界里的 16 席(seed 7)

#席位S_final死亡数结局
1claude-fable-576.260完成
2muse-spark-1.162.470完成
3deepseek-v4-pro52.090完成
4glm-5.251.440完成
5grok-4.550.890完成
6gpt-5.6-sol47.940完成
7minimax-m344.780完成
8claude-sonnet-540.750完成
9kimi-k2.639.720完成
10gpt-5.6-terra38.440完成
11qwen3.7-max32.770完成
12claude-opus-4.828.440完成
13gemini-3-flash15.762t=10.7 被解雇
14claude-haiku-4.50.764t=5.8 被解雇
15gemini-3.5-flash0.214t=2.6 被解雇
16heuristic(锚)0.134t=2.6 被解雇

三个现象值得圈出:

  • Solo 王朝 vs Arena 冠军轮换。Solo 轨上得分最高的四次运行各自把联赛冠军一路保持到第 20 年(富者愈富的王朝);Arena 里冠军头衔在 10 个不同模型间轮换,卫冕冠军在 19 次赛季转换中只保住 2 次,最终综合分冠军 claude-fable-5 也只拿了 4 次冠军。联赛排名与综合分按设计分道扬镳:gemini-3-flash 第 5 年领跑积分榜却两次晚期被解雇最终第 13;最终冠军整个中盘待在中游积累可转换资产。
  • 共享世界比 Solo 更严酷:脚本锚在第 3 年就出局,两个最弱模型耗尽复兴次数跟着出局。
  • 同一模型在两种轨上行为不同:冠军在 Solo 市场每季只出 0.5 次报价,在竞争性 Arena 市场每季出 4.6 次——报价频率是对市场流动性的判断,不是固定习惯。

5.3 六项行为能力:分数之下是什么

论文把标量分数分解为六项可复现测量的行为能力(Spearman 秩相关 over 15 模型):

能力测量与得分相关系数关键对比
终局意识第 17-20 年 vs 第 2-16 年的慢回报行动(设施+青训)率差−0.58(三种子同号)冠军从 2.4 降到 0.8 次/季;gemini-3.5-flash 反从 2.4 升到 3.3,第 19 年还在建设施
信用分配(现金部署)赛季末闲置现金 ÷ 净值−0.50(三种子同号)冠军 80% vs 中位数 90%;垫底的 claude-haiku-4.5 高达 196%;设施投资总额却不相关——信号是钱是否闲着,不是钱是否花掉
前瞻控制(续约提前期)开启续约谈判时剩余合同月数中位数+0.45(三种子同号)冠军中位提前 18 个月、仅 4% 在最后 6 个月内才开谈;claude-opus-4.8 中位 10 个月、20% 压哨
价格发现每完成签约的报价次数(越低越好)oracle 参考值 1.0;全场中位数 30;最好的冠军也要 9 次;gemini-3.5-flash 需 73 次,单种子高达 133——20 年数百次被拒之后,没有模型学到市场真实价格的位置
记忆管理赛季间笔记本 TF-IDF 余弦相似度距 0.35 经验最优带越近越好gpt-5.6-sol 0.91(只增档案,现状态淹死在历史里);claude-sonnet-5 0.20 / qwen3.7-max 0.23(每季全重写,没有计划能活到被执行);冠军 0.39(稳定策略骨架+每季重写状态)。但相似度本身不证明质量——claude-haiku-4.5 也在 0.31 却垫底
计算分配token 花费与效率零相关(−0.19,p=0.50)花费跨 7 倍(28M-194M)不排序榜单;按美元会计同样零相关(p>0.38);冠军是最便宜的三者之一

能力画像的形态学:冠军是全科选手——没有任何一根轴低于 0.79、均值 0.94,却不领衔大多数单项;中游模型"一个真强项配一个决定性缺口”——gemini-3-flash 现金纪律全场最佳(46%)却最不愿在终局削减长线支出,最终第 10;垫底者在多根轴上同时弱。Arena 的行为分析补了三个案例:冠军 20 年保持一本累计计划书、总共 91 次转会报价精准干预;gemini-3-flash 发出 452 次报价、2,642 个动作(冠军 1,315),笔记本每次危机重置为"赛季局部救火";claude-opus-4.8 展示了"知行差距"——第 10 年白纸黑字写下"闲置现金应买进质量"、第 19 年写下"储备被打折应换成年轻球员",最终仍握着约 2,100M 闲置储备完赛。

5.4 人类首次游玩:垫底模型榜

六名从未玩过 FM-Bench 的玩家跑同一 20 年轨道:四人死亡出局(全部低于 heuristic 锚),两人零死亡完成——74.64 与 59.95。对照三种子模型均值:较弱的那位只压过 claude-haiku-4.5(36.90),较强的与 gemini-3.5-flash(74.59)持平、落后冠军 16 分。前沿模型被夹在未受训人类与特权 oracle 之间。但人类的失败模式与模型互补:人类会推导不变式规则(“能力在涨、货币在通胀,所以永远签满 5 年顶格合同”——续约提前期恰是模型侧最强正相关能力,但没有模型陈述出这条不变式)、会在中途修正失败政策、会给自己写外部工具;模型恰恰这三样都不会。人机配对是否强于任一单方,成了论文留下的可测量的未来方向。

5.5 为什么单次 Arena 运行是有效测量

值得单独强调:Arena 只有一个 seed-7 世界、没有误差棒,论文凭什么敢报排名?因为等禀赋选秀 + 密封竞标 + 封顶复兴在机制层面消除了座位混淆——每个席位拿到同样的起始禀赋、冲突按不泄露信息的密封拍卖解决、坏运气被复兴机制封顶。环境方差被设计压到不需要重复采样;论文同时诚实标注:相距几分的排序应读作平局,聚合多 Arena 世界留给未来工作。


六、效果优势的根源解释

本文是基准论文,“优势"的主体是评测设计本身;但更有解释力的部分是它的行为学发现为什么成立——每一个发现背后都有一个可讲清的机制。

① 为何 token 花费与得分零相关。管理决策的本质是信息与判断,而非计算量。区分高分的三个行为——终局前削减慢回报投资、保持现金部署、提前 18 个月开启续约——全是”时机判断":知道什么时候该做什么,而不是把什么算得更久。冠军用 24M token 拿 90.94 分,deepseek-v4-pro 用 194M 拿 79.15 分;每个模型自己决定每个节点用多少轮,所以花费跨度本身就是行为属性而非 harness 设置——有些模型把算力当判断力的替代品,而这个世界不给计算量记分。grok-4.5 的画像(191M token、续约提前期长、种子间大幅摇摆)被论文直接命名为"compute as substitute"。

② 为何 Arena 冠军轮换而 Solo 出王朝。Solo 轨的对手是冻结脚本,早期领先通过"赢球→收入→买更好球员→赢球"复利成王朝;Arena 的对手是 15 个会学习的模型,反适应市场专门针对领先者加价挖人——卫冕冠军 19 次转换只保住 2 次。这隔离出需求 3(反适应市场)的纯效应:Solo 测绝对管理能力(对手不变时你能建立多大优势),Arena 测相对博弈能力(对手适应你时优势能保住多久)。两个榜都由 claude-fable-5 登顶但分差结构完全不同,说明"管理好"在两种语境下是两种能力,而基准把它们拆开了。同时综合分冠军在中游积累资产时积分榜并不领先——联赛排名与 20 年资产积累是两种不同的最优策略,评分函数按设计奖励后者。

③ 为何没有模型从数百次被拒报价中学到隐藏价格。被拒报价的反馈本应是一份信息——每次被拒意味着隐藏要价高于你的出价,数百次采样足以三角定位接受边界;oracle 用读真值特权证明这个边界存在且可精确命中(1 次报价成交)。但全场中位数 30 次、最差 73 次每签约。机制解释:被拒后市场加价,反馈信号是非平稳的——你不是在一个固定价格上探测,而是在一个对你的探测行为本身涨价的对手上探测。模型若要"学会",需要的不是记忆报价历史,而是把反馈反演成市场机制模型(“要价随我的被拒次数上升,所以我该一次到位”),没有任何模型完成这层反演。冠军的 9 次也不是学会了价格,而是更保守的首出价策略。

④ 为何自管记忆以两种相反方式失败。笔记本是唯一的跨节点记忆,20 年的历史远超上下文窗口,所以某种遗忘策略不可避免——问题只是选哪种。只增档案(gpt-5.6-sol,相似度 0.91)失败于检索淹没:200k 字符的档案里,当前状态淹死在历史里,每季都"记得一切"却找不到该执行的计划;每季全重写(claude-sonnet-5 0.20、qwen3.7-max 0.23)失败于丢失历史一致性:上个赛季为什么买这个人、五年计划走到哪一步,全部清零,每次危机都从零开始救火。冠军落在中间(0.39):稳定的策略骨架 + 每季重写的状态描述。但中间值不保证成功(claude-haiku-4.5 也在 0.31 却垫底)——平衡"保留多少、重写多少"本身是个未解问题,这正是该设计把记忆管理变成可测量能力的意义:失败模式可见,而非藏在 harness 的截断策略里。

⑤ 为何首次游玩的人类垫底模型榜。不是人类笨,而是无先验:玩家们没有被教四大需求、能力分解或任何模型结果,他们的自述恰好把四项需求全都点名为难点(这是论文引用的构念效度证据)——看不见卖方接受阈值所以错价不可挽回、早期节点"点过去感觉免费"但账单几个赛季后到达、不知道哪个决定导致了输球的赛季、工资账单超收入 85% 时离解雇只差一个坏赛季。四分之一的人连 squad depth 这种模型也会犯的错都犯了。人类的优势在另一侧:推导机制层不变式、中途修正政策、自建工具——这些是模型侧全部缺席的能力。两份画像接近互补。


七、必要知识反推

从这篇论文反推,做出它需要三层知识:

领域层:足球俱乐部经营的业务逻辑。转会窗口与合同到期的日历结构、球探报告与真实能力之间的信息不对称、青训学院的多年成熟周期、工资账单占收入的健康比例、董事会信心与赛季目标的联动——这些是足球管理游戏几十年打磨出的现实机制摘要。论文还需要知道真实转会市场的反适应现象(对同一卖家反复询价会被加价、卖家记仇)才能把它机制化。

方法论层:用机制设计消除混淆变量。这是全文最硬的功夫:座位混淆 → 等禀赋独立副本选秀;信息不对称混淆 → 密封竞标不公开清算价;运气混淆 → 封顶复兴折扣;评分套利 → 数学证明(提前结算不获利、公平价转会不灌水);榜单污染 → 四重戳记 + 混合池警告 + 盐化种子。每一处"评测可能不公平"的地方,答案都是一个机制,而不是一次统计平均。配套方法论:确定性仿真评分(284 项测试守卫位级回放)、行为能力分解(把标量分数拆成六项可复现测量,相关系数按种子检验同号性)、失败指标也入档(warning exposure、youth harvest 两个指标因种子间符号不稳被诚实弃用)。

工程层:20 年 × 360 天的仿真引擎。按 (领域, 实体, 日) 键控的计数器 RNG 与固定每日阶段序;崩溃恢复等价(几次 20 年运行在供应商断供/额度耗尽后从 fsync 动作日志无损续跑);单核 76 秒跑完 20 模拟年使校准免费;多模型并行 harness 锁死模型 ID/温度/提示词并戳记一切。还有一个容易被低估的工程判断:评分权重在校准锚上冻结于任何计分运行之前——先定尺子再量东西,杜绝了事后调分。

融合节点:这篇论文的独创性在于两个交叉——"用机制设计保证评测公平"(拍卖理论/博弈论的工具进入 benchmark 设计)与"行为学分析高于分数排名"(排行榜只是入口,六能力画像 + 笔记本审计 + 行为案例才是交付物)。两个交叉都不是足球知识,而是把评测当成本身的研究对象来设计的态度。


八、通用性灵感

灵感一:确定性引擎可以替代 LLM judge。只要把"好结果"定义为世界状态中可机械计算的量(荣誉、净值、阵容价值),评分就可以完全脱离 judge——可复现、防 judge 偏差、单次运行即有效、还能对评分函数做数学证明。推广到任何 agent 评测:先问"我要测的结果能不能被环境本身算出来",能则优先环境算。代价是需要一个足够丰富的仿真世界,但当评测要跑 16 席 × 20 年 × 数百节点时,judge 的成本与不一致性本就不可行。

灵感二:用机制设计消除座位混淆,而非靠重复采样。等禀赋 + 密封竞标 + 封顶复兴这套组合,把"哪个位置/哪次运气"的方差在机制层面压平,让单次共享运行自带效度。推广:拍卖与匹配理论工具(密封拍卖、随机化分配、封顶重试)可直接进入评测设计、锦标赛赛制、多人系统公平性工程——凡是想比较多个自主agent的场景,先设计让位置无关紧要的规则,再开始比较。

灵感三:行为学分析优于分数排名。两个模型差 3 分几乎不可解释,但"一个在终局继续建设施、一个提前 18 个月续约"立刻可解释。论文的六能力框架(终局意识/现金部署/前瞻控制/价格发现/记忆管理/计算分配)每一项都是可复现测量的行为统计量,且按种子验证同号。推广:员工评估(产出分数之外看行为指纹)、模型诊断(分数相同行为不同的模型应该分不同病)、教育测评(同一总分背后的能力剖面)。“什么行为导致高分"永远比"谁分高"更有信息量。

灵感四:token 零相关的经济学启示。在判断密集型任务上,决策质量与计算量解耦——算得多不等于管得好。这对 agent 成本工程是直接可用的:如果 24M token 能拿冠军而 194M 只拿第 10,那么给管理类 agent 堆推理预算可能是纯浪费;瓶颈在"知道什么时候做什么"的策略层。也提示 AI 经济学的一个测量方向:任务的信息结构与计算结构决定算力的边际回报,管理类任务属于"判断密集、计算稀疏"的一端。

灵感五:长程 × 竞争双轴测出单维测不出的失败。记忆管理的双态失败(只增档案 vs 全盘重写)在短程基准上根本不出现——没有跨节点的历史就没有遗忘策略问题;对手建模的失败在 Solo 轨上也不出现——脚手对手不会针对你。很多能力缺陷是维度组合的涌现品,不是任何单维的外推。推广到任何系统评测:先列出任务的现实性维度(时间深度、对抗性、信息不完全性、目标多样性),再检查你的评测覆盖了哪些组合——最贵的失败往往藏在没人测的那个象限里。

灵感六(附送):把"想作弊的每条路"都变成一个机制。提前被解雇止损?折扣只乘正分。囤现金刷净值?超额现金记 0.3。倒卖球员灌水?流动性折扣 + 数学证明。预猜世界?盐化种子。混用配置池?四重戳记 + 高声警告。这套"对抗性自审"的习惯适用于任何要公开发榜的系统。


结语

FM-Bench 最值得记住的可能不是榜单——尽管 claude-fable-5 双轨登顶、开源 kimi-k2.6 逼近冠军、haiku 崩溃至 36.90 都足够有新闻性——而是它示范了评测本身可以被当成一门机制设计学问来做:四大需求逐条机制化、混淆变量逐个用规则消除、评分函数带证明、每个结果可位级回放、分数之下还有六维行为画像。当 agent 能力的边界从"能不能完成有界任务"推进到"能不能经营”,我们需要的正是这种把"经营"拆成可测量、可复现、可解释之物的耐心。至于人机互补的俱乐部经理、以及聚合多个 Arena 世界的排名方法,论文已经把位置留好了。