SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读
SPADE 由九所高校联合提出,让单一 LLM 在自我对弈中同时扮演 Environment Designer 与 Reasoning Agent 两个角色:前者以 Python 代码生成带 reset/step 接口的完整可执行 MDP 训练环境与特权提示,后者解题学习。Designer 的奖励是提示前后的回报差(hint-based regret),能持续瞄准学习前沿,配合预训练语料接地与环境记忆防止坍缩。30B 模型在 8 个 held-out 基准平均 58.3(较 base +8.1),工具使用基准 ACEBench-Agent +13.9,验证了环境设计本身可学习这一迈向开放式自提升的关键一步。