Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science 精读
语言模型能产出看似合理的短证明,但在长程研究问题(不确定且相互依赖的决策序列)上不可靠——短证明能力与长程研究能力之间存在结构断层。Stellar Colosseum(CMU×Google Research)给出 model-agnostic 的多 Agent harness:策略探索后 readiness gate 决定何时分解、证明计划表示为 section 级相互依赖子问题、verifier 反馈路由回受影响部分;并行候选生成+定向证伪+重叠随机采样树聚合。已在数学与理论计算机科学问题上产出实际研究进展。本精读覆盖’长程=决策序列管理’的问题重构、readiness gate 的推理分配经济学与树聚合的抗噪声机制。