Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读
深度精读 NUS+UCL+KCL+港科大广州(25 Aug 2026)论文 Ockhamareto:用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」,单次生成 2.60 个测试拿下 49.9% 突变分数,比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试,4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。