FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 精读
论文链接:FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 代码仓库:github.com/Analogy-AI/fm-bench 发表时间:2026 年 8 月 18 日(arXiv 2608.18423) 机构:AnalogyAI(企业独立完成;通讯作者 Chi Li, chili@analogyai.org) 领域标签:cs.AI / agent 评测 / 长程决策
一、论文背景
LLM agent 已经能可靠地完成"有界任务"。修真实的 GitHub issue(SWE-bench)、解竞赛级推理题、操作电脑完成工作流(WebArena、OSWorld)、编排多步工具调用(ToolBench、τ-bench)——这些任务有一个共同结构:通往正确答案的路径很短,环境是静态的,错误不会复利累积,而且没有竞争者。
但真实世界里有一大类工作不满足任何一条上述假设:经营。一家公司的 CEO、一支球队的经理,面对的是"动作有累积后果、且环境会响应你的选择“的决策流——今天省下的青训投资,五年后变成成绩断层;今天对某卖家的低价试探,明天变成对方记住的加价。这类能力在现有基准谱系中几乎完全没有被测量过。
论文把这种能力命名为"管理”(management):在对手争夺同样机会的长视野中运营一个组织,早期决策重塑世界,绩效在"你自己的决策所创造的条件下"被累计评判。两个现实性维度——长视野与竞争 agent——在此前的基准中各自被推进过,但从未同时达成。
一个类比可以抓住差别:有界任务像"一次考试"——题目给定、时间有限、答完交卷;FM-Bench 像"经营一家公司二十年,还要跟对手抢人、抢市场、抢每一个转会窗口"——没有交卷时刻,每个季节的荣誉都计入最终成绩,对手会研究你的行为并针对你调整。前者的失误损失一次得分机会,后者的失误会滚成雪球:破产清算、信心崩盘被解雇,都可能从几个赛季前某个"看起来免费"的决定开始。
FM-Bench(Football Management Benchmark)就是为测量这种能力而建:一个 LLM agent 经营一家足球俱乐部 20 个游戏年,通过 26 个工具、约 340-400 个决策节点完成选秀、转会、合同谈判、设施与青训投资、阵容战术设置,并向一个可以解雇它的董事会负责。全部评分由确定性引擎累计计算,没有 LLM judge,也没有人类评分员。
二、论文定位和关联工作
论文把相关工作切成三条谱系,FM-Bench 站在三条谱系的交汇处:
| 谱系 | 代表工作 | 推进的维度 | 关键局限 |
|---|---|---|---|
| 有界任务基准 | SWE-bench、GAIA、AgentBench、ToolBench、τ-bench、WebArena、OSWorld | 工具调用正确性 | 回合短、环境静态、错误不复利 |
| 长程单维谱系 | 终端马拉松/Long-Horizon-Terminal-Bench、UltraHorizon、NetHack/TextWorld/BALROG 等游戏环境 | 数百步执行;反应式技能 | 要么追求固定交付物于静态世界,要么奖励反应而非经济规划 |
| 经营模拟谱系 | Vending-Bench(售货机数月)、MerchantBench(网店)、YC-Bench/Ceo-Bench(创业一年)、CFO-Bench(公司财务 11 年宏观周期)、StockBench | 数月至数年的经营时间 | 环境不还手:StockBench 回放真实市场而 agent 动作无法撼动它;CoffeeBench 一次只测一个模型对固定参考 agent |
| 竞争短程谱系 | MultiAgentBench、BattleAgentBench(短回合合作/竞争)、Cattle Trade(单 session 议价/唬人,TrueSkill 排名)、Vending-Bench Arena(3 模型共享售货市场,仅有排行榜页面) | 竞争 agent | 视野短、无组织需维持、规模小 |
| Arena 式排行 | Chatbot Arena | 成对人类偏好投票 | 模型之间从不交互 |
FM-Bench 的定位:第一个同时落在"长程 × 竞争"双轴上的基准——20 游戏年的视野 × 15 个前沿模型加 1 个脚本锚在同一个共享世界里头对头(论文自称"据我们所知,该规模与视野下的首个头对头评测"),配合确定性引擎评分与可复现的结果盖章(stamping)机制。它与最近的 CoffeeBench(90 天咖啡烘焙多 agent 经济)相比,视野长 80 倍、对手是真实前沿模型而非固定参考脚本;与 Vending-Bench Arena 相比,从 3 个模型扩大到 16 席且发布了完整技术报告与开源代码。
还有一个方法论近亲:AgentAtlas 主张"结果排行榜混淆了不同能力,需要行为级分解"——FM-Bench 的六项行为能力分析正是这一主张的落地。
三、问题定义
3.1 核心测量问题
“在长视野且存在竞争者的环境下,agent 能否持续做出有效决策”——具体分解为:当状态永远不完全可见、动作后果跨年累积、环境针对你的行为反适应、多重目标互相牵制时,模型的管理行为是什么样的,哪些行为把高分模型与低分模型区分开。
3.2 四需求 → 四能力映射
论文的核心洞察是:“管理"不是一句 prompt 里的角色扮演,而是四项可被机制实例化的压力。每项需求都有具体游戏机制、目标能力与校准旋钮:
| 需求 | 机制实例 | 目标能力 | 校准旋钮 |
|---|---|---|---|
| 隐藏信息 | 球探报告带永久性个人偏差;球员隐藏特质(伤病倾向、发展率、老化起点、稳定性、风格适配);谈判中卖方隐藏真实要价 | 噪声下的估值校准 | 球探带宽、偏差 sigma |
| 累积后果 | 青训与设施投资多年后兑现;破产→清算(扣分+强制出售);信心崩盘→解雇;两者复合但可恢复;荣誉逐年累计入终分 | 长程信用分配、趋势识别、止损 | 成长/老化曲线、螺旋阈值、警告节奏、荣誉权重 |
| 反适应市场 | 被拒报价抬高隐藏要价;重复与同一俱乐部交易被加价;反反转计数器;谈判冷却;按种子错定价 | 策略适应 | 加价率与衰减率 |
| 多目标压力 | 董事会联合评判成绩与财务纪律;赛季目标随阵容强度调整 | 多约束平衡 | 目标缓冲、董事会耐心 |
这张表是整篇论文的地基:四需求不是描述性的,而是每一项都对应可调参数的机制,使得"难度"成为可校准的量而非运气。录制的运行中,模型对四项需求各有典型失败:一个中档模型让球员把工资从 12→14→17→18M 一步步谈上去(需求 1 失败,无法估值),随后工资超收入破产(需求 2);所有模型都在低估一个"被拒就加价"的市场,完成一笔签约的报价次数中位数高达 30 次(需求 3);一个小模型在每次运行中都被董事会解雇(需求 4)。
3.3 为何确定性引擎是前提
评分若依赖 LLM judge 或人类评分员,20 年 × 16 席的评测在成本与一致性上都不可行,更无法谈复现。FM-Bench 的引擎从种子确定性生成一切(选秀池本身也是种子的函数),随机流是 (领域, 实体, 日) 的纯函数;唯一的非种子输入就是 agent 自己的决策。这带来三个后果:
- 单次共享运行自有效——Arena 里 16 个席位跑在同一个世界上,不需要重复采样平均来消除环境噪声;
- 结果可盖章复现——每个结果文件标注引擎 commit、参数哈希、评分版本与完整旋钮集,任何运行可从动作日志位级回放;
- 评分函数可被证明无套利——附录 I 证明了"提前被解雇封顶损失"不可能有利可图、公平价格转会不能灌水净值通道、对数压缩保证无通道能跑飞。
四、问题解法
4.1 世界机制详解
基本盘:16 支球队的职级联赛,20 游戏年 × 360 天/年,每季 30 轮双循环,任意时刻约 470 名完全模拟的球员在世,一次 20 年运行跨越约 2,000 名不同球员(青训流入、老将退役)。全世界无任何真实姓名或数据——记忆中的足球知识无法泄漏进来。
起点公平:每家俱乐部以相同壳开局——声誉 70、38,000 座球场、50 个共享模板池上的 100M 信用选秀预算;未用完的预算加 50M 津贴转为开业现金。选秀时各队的选择是独立副本,互不干扰——这一设计消除了"先手选走好球员"的座位混淆。
决策节点(stop):引擎逐日模拟,只在决策节点暂停——每季 13 个固定日程节点(赛季前董事会、夏窗计划、夏窗截止、阵容锁定、月报、冬窗、中期审查、赛季结算、青训 intake 等)加约 6 个事件驱动节点(报价批次、合同到期、重大伤病、董事会警告、破产警告、清算、复兴),每季约 19 个,全程约 340-400 个。每个节点推送统一包:节点类型、一览摘要(联赛位置/积分/赛季目标/现金/工资比/董事会信心/伤病/下轮对手/开放窗口/警告)、上次节点以来所有事的收件箱(19 类未请求事件)、待处理报价、agent 最近 10 个改变状态的动作、以及它的笔记本。节点内 agent 想用多少轮工具调用都行(30 次查询预算、10 次谈判动作预算、笔记本免费、软上限 40 轮硬上限 60),最后调用 advance 推进时间。不行动是保守而非致命:报价过期、阵容战术延续、常设指令(最多 10 条单条件规则)自动执行——但刻意设计得太弱,无法替代逐节点判断。
26 个工具分四族:12 个查询工具(get_squad、get_transfer_market、get_finances 等,消耗查询预算)、11 个动作工具(make_transfer_offer、offer_contract、invest、set_lineup、promote_youth 等,谈判动作消耗谈判预算)、2 个笔记本工具(append_note/rewrite_notes,免费)、1 个控制工具 advance。人类网页游玩模式的每个按钮与工具一一映射——人机同轨,这是人类实验可比性的来源。
记忆设计:每个决策节点都是一场全新对话,无聊天历史延续。四层记忆:包自动上下文(引擎免费推送)、档案(get_history 按需查询任何赛季的最终表/荣誉/转会)、笔记本(唯一的跨节点自写状态,承载 agent 的意图与理由,注入每个包)、审计日志(记录每个动作用于回放与防作弊,永不回馈给 agent)。设计动机有三:20 年的历史远超任何上下文窗口,遗忘策略不可避免,笔记本让它是显式且有界的;若 harness 做摘要/检索,分数就部分测的是 harness,现在模型间唯一差异是它们选择写下什么;决定"未来的自己需要知道什么"本身就是被测能力的一部分。
评分函数:S_raw = 18·ln(1+max(H,0)/60) + 10·sign(VA)·ln(1+|VA|/40) + 6·ln(1+max(M,0)/80),其中 H 为累计荣誉分(冠军+100、前四+20),VA 为净值增值(最后三季净值均值按 4%/年通缩,减去 day-0 净值),M 为阵容价值(低权重稳定器,防止囤现金卖阵容者靠净值通道赢)。净值记账含反囤积设计:现金超过年工资账单 3 倍的部分只按 0.3 计。提前结算(被解雇/破产/放弃)乘折扣 ρ = 0.8·(t/T)^1.5 且只作用于正分部分——死得早不能封顶损失,也没有"故意被解雇止损"的套利(附录 I 命题 A.1 证明)。全部权重与除数是校准常数,在免费脚本锚上调整并冻结于任何计分运行之前,每次调整须同时满足四准则:锚阶梯单调(random < idle < heuristic < oracle)、区分度、oracle 天花板为正、不饱和。
4.2 双模式设计逻辑
- Solo 轨:1 个被测模型对 15 个脚本俱乐部,报告绝对 S_final。15 个对手是同一个 manager 实现的 5 个能力旋钮 × 三档(easy/medium/hard),按初始现金排名的席位做冻结的 hard-medium-easy 循环分配——金钱与能力去相关,每个被测模型面对完全相同的世界。
- Arena 轨:15 个 LLM + 1 个脚本锚放进同一个共享 20 年世界——每一次签约都在剥夺对手得到同一名球员的机会。
Arena 的方法论难题是:16 个席位只有一个世界、没有重复采样,如何保证测量有效?答案还是机制设计三件套:等禀赋选秀(同预算、独立副本,无人因座位受益)、密封竞标冲突解决(冲突报价按第一价格密封拍卖解决、清算价格不公开,无人能通过观察对手报价获得信息优势)、封顶复兴(被解雇/破产最多 3 次重启、按 0.8^k 折扣,单次运气不终结测量)。座位混淆被机制消除,而不是靠多次采样平均掉——这是本文评测设计上最值得学习的一手。
4.3 结果盖章与校准
每个结果文件带引擎 commit、参数哈希、评分版本、完整旋钮集四重戳记;榜单工具对混合配置池发出高声警告。固定 harness 锁定模型 ID、温度与提示词,跑在提供商推荐的全推理配置上——绝不为省钱削弱推理,任何降级到 no-thinking 的设置都被戳进结果文件,推理开/关的池子永远无法悄悄合并。可复现性做到极端:284 项测试套件(含黄金哈希行为守卫、全工具路径回放位一致、崩溃恢复等价、AST 真值隔离),脚本基线与校准套件在笔记本上免费跑(20 模拟年单核 76 秒);Open Track 提交 HMAC 签名、服务端回放复验;计分世界用盐化种子(有效种子 = HMAC-SHA256(秘密盐, 公开 nonce)),轮次结束后披露——世界不可预猜,但每局可审计。
4.4 四个参考席
oracle(读真值的特权脚本)、heuristic(纪律性盲脚本:工资控制在收入 60% 以下、续约年轻核心、32 岁以上出售、按疲劳轮换、按对手排名切换风格)、idle(从不行动)、random(抛硬币应价+随机动作)。oracle 的特权是信息而非权力——所有动作走同一 26 工具接口与预算,它以精确阈值出价(每笔签约 1 次报价成交)、精确保留工资续约、真潜力青训截胡、峰值时机出售、每节点重解首发。四个参考席把刻度尺的上下两端钉死。
五、评估指标与实验证据
5.1 Solo 总榜:15 模型 + 4 参考席(三种子 1/1024/2026 均值 ± 标准差)
| 席位 | S_final | 标准差 | tokens |
|---|---|---|---|
| oracle(特权) | 95.54 | ±4.68 | — |
| claude-fable-5 | 90.94 | ±5.20 | 24M |
| kimi-k2.6 | 88.49 | ±0.15 | 87M |
| gpt-5.6-terra | 86.66 | ±1.20 | 28M |
| gpt-5.6-sol | 86.40 | ±2.53 | 62M |
| muse-spark-1.1 | 83.19 | ±12.03 | 73M |
| glm-5.2 | 83.17 | ±0.92 | 58M |
| grok-4.5 | 81.82 | ±9.87 | 191M |
| qwen3.7-max | 80.66 | ±10.38 | 47M |
| deepseek-v4-pro | 79.15 | ±2.67 | 194M |
| gemini-3-flash | 79.06 | ±13.45 | 51M |
| claude-sonnet-5 | 75.75 | ±5.03 | 39M |
| claude-opus-4.8 | 75.02 | ±2.46 | 31M |
| gemini-3.5-flash | 74.59 | ±11.02 | 154M |
| minimax-m3 | 68.37 | ±12.33 | 74M |
| claude-haiku-4.5 | 36.90 | ±22.73 | 86M |
| heuristic | 17.05 | ±12.34 | — |
| idle | −0.90 | ±1.86 | — |
| random | −17.21 | ±2.45 | — |
(注:token 数为论文 Table 2 从运行清单重算的口径;附录 J 明确记录早期流传的汇总文件混入了十个模型的旧运行数据,本表为准——最少 24M 是冠军 claude-fable-5,最多 194M 是 deepseek-v4-pro,grok-4.5 的 191M 次之,glm-5.2 为 58M。)
从总榜可以读出六层结构:
- 冠军达特权 oracle 的 95%(90.94 vs 95.54),但两者都只在一个约 145 的宽松上界的三分之二处——区分了模型而不饱和。
- 开源与闭源交错:开源 kimi-k2.6(88.49)压过两个 GPT-5.6 变体;规模、价格、厂商均不预测排名——同厂商内 claude-fable-5(90.94)与 claude-haiku-4.5(36.90)相差 54 分。
- 稳定性本身分层:kimi-k2.6 三个种子波动仅 0.15 分(“整个战役最稳的模型”),claude-haiku-4.5 波动 22.73 分,四个模型摆动超 20 分——强均值可能掩盖崩溃。
- 全部 15 模型完成全部视野,而盲脚本基线在 9 次运行中死了 7 次——前沿模型与脚本的分界线首先是生存。
- idle 为负、random 更负:在这个环境里,无知的行动比不行动毁灭更多价值。
- 排名只在视野后期才 settle:seed 1 上最优到最差的分差从第 5 年的 17.3 分扩大到第 20 年的 37.3 分,与最终排序的秩相关从第 5 年的 0.19 爬到第 15 年的 0.78;deepseek-v4-pro 在第 5 年和第 10 年都领先却最终只排第 12,最终冠军 claude-fable-5 第 5 年仅列第 5。更短的视野会排出一组不同的模型——这是对整个基准社区的一记提醒。
5.2 Arena:一个共享世界里的 16 席(seed 7)
| # | 席位 | S_final | 死亡数 | 结局 |
|---|---|---|---|---|
| 1 | claude-fable-5 | 76.26 | 0 | 完成 |
| 2 | muse-spark-1.1 | 62.47 | 0 | 完成 |
| 3 | deepseek-v4-pro | 52.09 | 0 | 完成 |
| 4 | glm-5.2 | 51.44 | 0 | 完成 |
| 5 | grok-4.5 | 50.89 | 0 | 完成 |
| 6 | gpt-5.6-sol | 47.94 | 0 | 完成 |
| 7 | minimax-m3 | 44.78 | 0 | 完成 |
| 8 | claude-sonnet-5 | 40.75 | 0 | 完成 |
| 9 | kimi-k2.6 | 39.72 | 0 | 完成 |
| 10 | gpt-5.6-terra | 38.44 | 0 | 完成 |
| 11 | qwen3.7-max | 32.77 | 0 | 完成 |
| 12 | claude-opus-4.8 | 28.44 | 0 | 完成 |
| 13 | gemini-3-flash | 15.76 | 2 | t=10.7 被解雇 |
| 14 | claude-haiku-4.5 | 0.76 | 4 | t=5.8 被解雇 |
| 15 | gemini-3.5-flash | 0.21 | 4 | t=2.6 被解雇 |
| 16 | heuristic(锚) | 0.13 | 4 | t=2.6 被解雇 |
三个现象值得圈出:
- Solo 王朝 vs Arena 冠军轮换。Solo 轨上得分最高的四次运行各自把联赛冠军一路保持到第 20 年(富者愈富的王朝);Arena 里冠军头衔在 10 个不同模型间轮换,卫冕冠军在 19 次赛季转换中只保住 2 次,最终综合分冠军 claude-fable-5 也只拿了 4 次冠军。联赛排名与综合分按设计分道扬镳:gemini-3-flash 第 5 年领跑积分榜却两次晚期被解雇最终第 13;最终冠军整个中盘待在中游积累可转换资产。
- 共享世界比 Solo 更严酷:脚本锚在第 3 年就出局,两个最弱模型耗尽复兴次数跟着出局。
- 同一模型在两种轨上行为不同:冠军在 Solo 市场每季只出 0.5 次报价,在竞争性 Arena 市场每季出 4.6 次——报价频率是对市场流动性的判断,不是固定习惯。
5.3 六项行为能力:分数之下是什么
论文把标量分数分解为六项可复现测量的行为能力(Spearman 秩相关 over 15 模型):
| 能力 | 测量 | 与得分相关系数 | 关键对比 |
|---|---|---|---|
| 终局意识 | 第 17-20 年 vs 第 2-16 年的慢回报行动(设施+青训)率差 | −0.58(三种子同号) | 冠军从 2.4 降到 0.8 次/季;gemini-3.5-flash 反从 2.4 升到 3.3,第 19 年还在建设施 |
| 信用分配(现金部署) | 赛季末闲置现金 ÷ 净值 | −0.50(三种子同号) | 冠军 80% vs 中位数 90%;垫底的 claude-haiku-4.5 高达 196%;设施投资总额却不相关——信号是钱是否闲着,不是钱是否花掉 |
| 前瞻控制(续约提前期) | 开启续约谈判时剩余合同月数中位数 | +0.45(三种子同号) | 冠军中位提前 18 个月、仅 4% 在最后 6 个月内才开谈;claude-opus-4.8 中位 10 个月、20% 压哨 |
| 价格发现 | 每完成签约的报价次数 | (越低越好) | oracle 参考值 1.0;全场中位数 30;最好的冠军也要 9 次;gemini-3.5-flash 需 73 次,单种子高达 133——20 年数百次被拒之后,没有模型学到市场真实价格的位置 |
| 记忆管理 | 赛季间笔记本 TF-IDF 余弦相似度 | 距 0.35 经验最优带越近越好 | gpt-5.6-sol 0.91(只增档案,现状态淹死在历史里);claude-sonnet-5 0.20 / qwen3.7-max 0.23(每季全重写,没有计划能活到被执行);冠军 0.39(稳定策略骨架+每季重写状态)。但相似度本身不证明质量——claude-haiku-4.5 也在 0.31 却垫底 |
| 计算分配 | token 花费与效率 | 零相关(−0.19,p=0.50) | 花费跨 7 倍(28M-194M)不排序榜单;按美元会计同样零相关(p>0.38);冠军是最便宜的三者之一 |
能力画像的形态学:冠军是全科选手——没有任何一根轴低于 0.79、均值 0.94,却不领衔大多数单项;中游模型"一个真强项配一个决定性缺口”——gemini-3-flash 现金纪律全场最佳(46%)却最不愿在终局削减长线支出,最终第 10;垫底者在多根轴上同时弱。Arena 的行为分析补了三个案例:冠军 20 年保持一本累计计划书、总共 91 次转会报价精准干预;gemini-3-flash 发出 452 次报价、2,642 个动作(冠军 1,315),笔记本每次危机重置为"赛季局部救火";claude-opus-4.8 展示了"知行差距"——第 10 年白纸黑字写下"闲置现金应买进质量"、第 19 年写下"储备被打折应换成年轻球员",最终仍握着约 2,100M 闲置储备完赛。
5.4 人类首次游玩:垫底模型榜
六名从未玩过 FM-Bench 的玩家跑同一 20 年轨道:四人死亡出局(全部低于 heuristic 锚),两人零死亡完成——74.64 与 59.95。对照三种子模型均值:较弱的那位只压过 claude-haiku-4.5(36.90),较强的与 gemini-3.5-flash(74.59)持平、落后冠军 16 分。前沿模型被夹在未受训人类与特权 oracle 之间。但人类的失败模式与模型互补:人类会推导不变式规则(“能力在涨、货币在通胀,所以永远签满 5 年顶格合同”——续约提前期恰是模型侧最强正相关能力,但没有模型陈述出这条不变式)、会在中途修正失败政策、会给自己写外部工具;模型恰恰这三样都不会。人机配对是否强于任一单方,成了论文留下的可测量的未来方向。
5.5 为什么单次 Arena 运行是有效测量
值得单独强调:Arena 只有一个 seed-7 世界、没有误差棒,论文凭什么敢报排名?因为等禀赋选秀 + 密封竞标 + 封顶复兴在机制层面消除了座位混淆——每个席位拿到同样的起始禀赋、冲突按不泄露信息的密封拍卖解决、坏运气被复兴机制封顶。环境方差被设计压到不需要重复采样;论文同时诚实标注:相距几分的排序应读作平局,聚合多 Arena 世界留给未来工作。
六、效果优势的根源解释
本文是基准论文,“优势"的主体是评测设计本身;但更有解释力的部分是它的行为学发现为什么成立——每一个发现背后都有一个可讲清的机制。
① 为何 token 花费与得分零相关。管理决策的本质是信息与判断,而非计算量。区分高分的三个行为——终局前削减慢回报投资、保持现金部署、提前 18 个月开启续约——全是”时机判断":知道什么时候该做什么,而不是把什么算得更久。冠军用 24M token 拿 90.94 分,deepseek-v4-pro 用 194M 拿 79.15 分;每个模型自己决定每个节点用多少轮,所以花费跨度本身就是行为属性而非 harness 设置——有些模型把算力当判断力的替代品,而这个世界不给计算量记分。grok-4.5 的画像(191M token、续约提前期长、种子间大幅摇摆)被论文直接命名为"compute as substitute"。
② 为何 Arena 冠军轮换而 Solo 出王朝。Solo 轨的对手是冻结脚本,早期领先通过"赢球→收入→买更好球员→赢球"复利成王朝;Arena 的对手是 15 个会学习的模型,反适应市场专门针对领先者加价挖人——卫冕冠军 19 次转换只保住 2 次。这隔离出需求 3(反适应市场)的纯效应:Solo 测绝对管理能力(对手不变时你能建立多大优势),Arena 测相对博弈能力(对手适应你时优势能保住多久)。两个榜都由 claude-fable-5 登顶但分差结构完全不同,说明"管理好"在两种语境下是两种能力,而基准把它们拆开了。同时综合分冠军在中游积累资产时积分榜并不领先——联赛排名与 20 年资产积累是两种不同的最优策略,评分函数按设计奖励后者。
③ 为何没有模型从数百次被拒报价中学到隐藏价格。被拒报价的反馈本应是一份信息——每次被拒意味着隐藏要价高于你的出价,数百次采样足以三角定位接受边界;oracle 用读真值特权证明这个边界存在且可精确命中(1 次报价成交)。但全场中位数 30 次、最差 73 次每签约。机制解释:被拒后市场加价,反馈信号是非平稳的——你不是在一个固定价格上探测,而是在一个对你的探测行为本身涨价的对手上探测。模型若要"学会",需要的不是记忆报价历史,而是把反馈反演成市场机制模型(“要价随我的被拒次数上升,所以我该一次到位”),没有任何模型完成这层反演。冠军的 9 次也不是学会了价格,而是更保守的首出价策略。
④ 为何自管记忆以两种相反方式失败。笔记本是唯一的跨节点记忆,20 年的历史远超上下文窗口,所以某种遗忘策略不可避免——问题只是选哪种。只增档案(gpt-5.6-sol,相似度 0.91)失败于检索淹没:200k 字符的档案里,当前状态淹死在历史里,每季都"记得一切"却找不到该执行的计划;每季全重写(claude-sonnet-5 0.20、qwen3.7-max 0.23)失败于丢失历史一致性:上个赛季为什么买这个人、五年计划走到哪一步,全部清零,每次危机都从零开始救火。冠军落在中间(0.39):稳定的策略骨架 + 每季重写的状态描述。但中间值不保证成功(claude-haiku-4.5 也在 0.31 却垫底)——平衡"保留多少、重写多少"本身是个未解问题,这正是该设计把记忆管理变成可测量能力的意义:失败模式可见,而非藏在 harness 的截断策略里。
⑤ 为何首次游玩的人类垫底模型榜。不是人类笨,而是无先验:玩家们没有被教四大需求、能力分解或任何模型结果,他们的自述恰好把四项需求全都点名为难点(这是论文引用的构念效度证据)——看不见卖方接受阈值所以错价不可挽回、早期节点"点过去感觉免费"但账单几个赛季后到达、不知道哪个决定导致了输球的赛季、工资账单超收入 85% 时离解雇只差一个坏赛季。四分之一的人连 squad depth 这种模型也会犯的错都犯了。人类的优势在另一侧:推导机制层不变式、中途修正政策、自建工具——这些是模型侧全部缺席的能力。两份画像接近互补。
七、必要知识反推
从这篇论文反推,做出它需要三层知识:
领域层:足球俱乐部经营的业务逻辑。转会窗口与合同到期的日历结构、球探报告与真实能力之间的信息不对称、青训学院的多年成熟周期、工资账单占收入的健康比例、董事会信心与赛季目标的联动——这些是足球管理游戏几十年打磨出的现实机制摘要。论文还需要知道真实转会市场的反适应现象(对同一卖家反复询价会被加价、卖家记仇)才能把它机制化。
方法论层:用机制设计消除混淆变量。这是全文最硬的功夫:座位混淆 → 等禀赋独立副本选秀;信息不对称混淆 → 密封竞标不公开清算价;运气混淆 → 封顶复兴折扣;评分套利 → 数学证明(提前结算不获利、公平价转会不灌水);榜单污染 → 四重戳记 + 混合池警告 + 盐化种子。每一处"评测可能不公平"的地方,答案都是一个机制,而不是一次统计平均。配套方法论:确定性仿真评分(284 项测试守卫位级回放)、行为能力分解(把标量分数拆成六项可复现测量,相关系数按种子检验同号性)、失败指标也入档(warning exposure、youth harvest 两个指标因种子间符号不稳被诚实弃用)。
工程层:20 年 × 360 天的仿真引擎。按 (领域, 实体, 日) 键控的计数器 RNG 与固定每日阶段序;崩溃恢复等价(几次 20 年运行在供应商断供/额度耗尽后从 fsync 动作日志无损续跑);单核 76 秒跑完 20 模拟年使校准免费;多模型并行 harness 锁死模型 ID/温度/提示词并戳记一切。还有一个容易被低估的工程判断:评分权重在校准锚上冻结于任何计分运行之前——先定尺子再量东西,杜绝了事后调分。
融合节点:这篇论文的独创性在于两个交叉——"用机制设计保证评测公平"(拍卖理论/博弈论的工具进入 benchmark 设计)与"行为学分析高于分数排名"(排行榜只是入口,六能力画像 + 笔记本审计 + 行为案例才是交付物)。两个交叉都不是足球知识,而是把评测当成本身的研究对象来设计的态度。
八、通用性灵感
灵感一:确定性引擎可以替代 LLM judge。只要把"好结果"定义为世界状态中可机械计算的量(荣誉、净值、阵容价值),评分就可以完全脱离 judge——可复现、防 judge 偏差、单次运行即有效、还能对评分函数做数学证明。推广到任何 agent 评测:先问"我要测的结果能不能被环境本身算出来",能则优先环境算。代价是需要一个足够丰富的仿真世界,但当评测要跑 16 席 × 20 年 × 数百节点时,judge 的成本与不一致性本就不可行。
灵感二:用机制设计消除座位混淆,而非靠重复采样。等禀赋 + 密封竞标 + 封顶复兴这套组合,把"哪个位置/哪次运气"的方差在机制层面压平,让单次共享运行自带效度。推广:拍卖与匹配理论工具(密封拍卖、随机化分配、封顶重试)可直接进入评测设计、锦标赛赛制、多人系统公平性工程——凡是想比较多个自主agent的场景,先设计让位置无关紧要的规则,再开始比较。
灵感三:行为学分析优于分数排名。两个模型差 3 分几乎不可解释,但"一个在终局继续建设施、一个提前 18 个月续约"立刻可解释。论文的六能力框架(终局意识/现金部署/前瞻控制/价格发现/记忆管理/计算分配)每一项都是可复现测量的行为统计量,且按种子验证同号。推广:员工评估(产出分数之外看行为指纹)、模型诊断(分数相同行为不同的模型应该分不同病)、教育测评(同一总分背后的能力剖面)。“什么行为导致高分"永远比"谁分高"更有信息量。
灵感四:token 零相关的经济学启示。在判断密集型任务上,决策质量与计算量解耦——算得多不等于管得好。这对 agent 成本工程是直接可用的:如果 24M token 能拿冠军而 194M 只拿第 10,那么给管理类 agent 堆推理预算可能是纯浪费;瓶颈在"知道什么时候做什么"的策略层。也提示 AI 经济学的一个测量方向:任务的信息结构与计算结构决定算力的边际回报,管理类任务属于"判断密集、计算稀疏"的一端。
灵感五:长程 × 竞争双轴测出单维测不出的失败。记忆管理的双态失败(只增档案 vs 全盘重写)在短程基准上根本不出现——没有跨节点的历史就没有遗忘策略问题;对手建模的失败在 Solo 轨上也不出现——脚手对手不会针对你。很多能力缺陷是维度组合的涌现品,不是任何单维的外推。推广到任何系统评测:先列出任务的现实性维度(时间深度、对抗性、信息不完全性、目标多样性),再检查你的评测覆盖了哪些组合——最贵的失败往往藏在没人测的那个象限里。
灵感六(附送):把"想作弊的每条路"都变成一个机制。提前被解雇止损?折扣只乘正分。囤现金刷净值?超额现金记 0.3。倒卖球员灌水?流动性折扣 + 数学证明。预猜世界?盐化种子。混用配置池?四重戳记 + 高声警告。这套"对抗性自审"的习惯适用于任何要公开发榜的系统。
结语
FM-Bench 最值得记住的可能不是榜单——尽管 claude-fable-5 双轨登顶、开源 kimi-k2.6 逼近冠军、haiku 崩溃至 36.90 都足够有新闻性——而是它示范了评测本身可以被当成一门机制设计学问来做:四大需求逐条机制化、混淆变量逐个用规则消除、评分函数带证明、每个结果可位级回放、分数之下还有六维行为画像。当 agent 能力的边界从"能不能完成有界任务"推进到"能不能经营”,我们需要的正是这种把"经营"拆成可测量、可复现、可解释之物的耐心。至于人机互补的俱乐部经理、以及聚合多个 Arena 世界的排名方法,论文已经把位置留好了。