FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents 精读
AnalogyAI 发布 FM-Bench:让 LLM agent 经营一家足球俱乐部 20 个游戏年,通过 26 个工具在约 340-400 个决策节点上转会、谈判、投资、排阵容,由确定性引擎累计出唯一终分(无 LLM judge)。基准将管理者的四大压力——隐藏信息、累积后果、反适应市场、多目标压力——全部机制化,并以 Solo(1 模型对 15 脚本)与 Arena(15 个 LLM 同世界头对头)双轨评测 15 个前沿模型。结果:claude-fable-5 以 90.94 登顶(达特权 oracle 的 95%),规模、价格、厂商均不预测排名,token 花费与得分零相关;区分模型的是管理行为——终局前削减慢回报投资、保持现金部署、提前开启续约。Arena 中联赛冠军在 10 个模型间轮换,首次游玩的人类垫底模型榜。