SEABench × Audit the Scaffold × REUSE:递归自我改进的测量、理论与统计三重保障 精读
同一周出现的三篇论文,恰好构成递归自我改进(RSI)治理的三根支柱:SEABench 用配对反事实与归因裁判测量「自进化会不会内生地变坏」(安全失败率 43.9% vs 0%);Audit the Scaffold 用 Lean 4 验证的平稳性二分法回答「自我改进何时必然耗尽、何时可能失控」(改脚手架可扩类不碰权重,冻结权重≠安全);REUSE 用决策-only 反馈与全历史 union bound 保证「每一次晋升都是真实总体改进」(75 次假晋升→0 次,提升不损)。本精读从「是什么」讲起,拆解三篇的方法机制、评估证据与优势根源,并交叉验证其在 2026 年 RSI 治理浪潮中的位置。