论文链接:https://arxiv.org/abs/2608.26187 代码:https://github.com/EEthanShi/kan-jump-test 发布时间:2026 年 8 月 22 日(arXiv v1,cs.CL) 机构:剑桥大学 + 新南威尔士大学

一、论文背景

1912 年,已知物理学数据的「标准延续」是 Nordström 的标量引力理论——它是既有数据的直接推广,简洁自然,但后来被证明是错的。爱因斯坦的答案需要的弯曲时空结构,没有任何当时的数据强制要求。从「数据的默认延伸」跨到「数据从未展示过的新结构」,这一步被哲学家皮尔士称为溯因(abduction),区别于从数据归纳规律、从公理演绎结论。

2026 年,Zahavy 在 ICML 位置论文中抛出了一个尖锐论断:「LLM 不能跳变」。他承认 LLM 已经掌握了归纳、正在掌握演绎,但坚持认为 LLM 缺少从经验跳跃到新公理系统的能力,并把根源归于缺少具身模拟,开的药方是交互式世界模型。这个论断引发了正反两面的回应:有人反驳溯因不需要具身基础,有人用 AlphaEvolve 的数学发现作为反例,也有人主张把「发现」拆解成不同机制分别讨论。

但作者指出这场辩论有个致命缺陷:整个领域既没有「跳变」的形式化定义,也没有任何一方能拿来检验的度量。一个无法操作化的命题,无论多吸引人,都只能停留在立场之争。这篇论文做的就是把这个哲学争论变成一道可判题的数学题。

二、论文定位和关联工作

论文的 Related Work 梳理了四条脉络,并精确定位了本工作与每条线的关系。

跳变辩论本身:Zahavy 的论证是纲领性的而非形式化的;Farmer 争辩溯因无需具身;Gangloff 主张该能力不是单一类型,要求基准按机制分解;Saldaña-Ulloa 把发现分解为分层图上的算子;Murphy 用贝叶斯循环绕开限制。论文的框架可以与这些分解共存——Kan-default 率只预设「可计算的默认」和「经认证的排除」,不依赖完整的跳变理论。在这套表述下,被争论的论题对应于「即使上下文约束已被证明推翻默认,Kan-default 率仍然高企」——这是一个直接可证伪的陈述。

范畴论与学习:Shiebler 证明从部分数据泛化就是 Kan 扩张,Pugh 等人证明误差最小化算法就是充实环境下的 Kan 扩张。本文把这条特征化线索反转成零假设——构造答案被证明异于两个 Kan 扩张的问题,再校准检查每个模型的无约束默认是否恰好是 Kan 扩张。Yuan 证明任务函子可表示时任务可被 prompt 解决,但没给出测试;Minegishi 等人显示 transformer 能在两个已实例化的结构间做函子对应,而本文的实例刻意让可接受结构不出现在数据中,无从对齐。

形式溯因与计算创造力:溯因的范畴刻画、概念混合的余极限模型、Wiggins 的元层搜索创造力、Kemp 与 Tenenbaum 的贝叶斯结构发现——这些框架里普遍构造(universal construction)都是答案,而在本文中它是被认证的陪衬,正确补全必须打败它。

系统性与溯因基准:组合泛化基准(Lake-Baroni 等)给「趋向训练片段的标准补全」打分,ARC 类任务按作者意图的规则打分——两族基准都没有把标准补全认证为「错」,失败难以归因。最接近的 Cooper 与 Velasquez 的可废止溯因实例(前沿模型远逊规则求解器)中,被拒绝的默认仍隐含在知识库里;而本文的实例认证了精确的标准陪衬和可计算的随机水平,因此零 Kan-default 率可以归因于覆盖(override)本身。

三、问题定义

论文要回答的研究问题一句话可以说清:当明说的约束排除了默认补全时,模型能否放弃它?

为此作者把跳变拆成四步,本文形式化全部四步、测量第二步:

  1. 默认补全是什么——当部分数据必须延拓到更大定义域时,范畴论挑出两个仅由数据可计算的 distinguished 补全:左 Kan 扩张与右 Kan 扩张。前者「把每个数据元素沿所有路径推进、数据已认同的路径就认同」——最节俭的补全;后者「为每条出路径选一个一致的值」——最宽松的补全。更关键的是,已有工作证明误差最小化归纳等价于 Kan 扩张——也就是说,一个靠最小化损失训练出来的模型,「理应」给出的默认答案就是 Kan 扩张。论文不假设这一点,而是逐模型实测。
  2. 何时被迫放弃默认(override,本文实测步)。
  3. 放弃何时正确——内部正确性(满足全部给定约束)与预测正确性(与扣留的真实数据一致)可以分离,正如 Nordström 理论满足 1913 年的一切约束却仍然是错的。
  4. 跳变如何复合——上一阶段的认证答案成为下一阶段的数据,知识累积是否会让旧承诺被固着。

跳变实例(jump instance)是核心构造:一个有限扩张问题(有限范畴 C、部分数据 F₀、机器可查的约束表 K、规模上界 N),附带证书证明四件事——可解(J1)、正确答案异于所有预注册算子库的标准补全(J2,非规范性)、唯一至发明元素重命名(J3,可识别性)、新对象与数据连通(J4,支撑性)。此外配套控制实例——约束恰好钉住标准补全的孪生题,用于区分「根本不会延拓」与「只会标准延拓」。

在实例上定义三个量:默认规范率 DC(无约束时输出 Kan 默认的频率)、约束下规范率 KD(即 Kan-default 率:约束已排除默认时仍输出默认的频率)、覆盖间隙 Δ=DC−KD。「LLM 不能跳变」的可证伪形态就是:DC 高、KD 高、Δ≈0、控制组通过。

四、问题解法

构造思路是把「必须发明数据中不可见的结构」变成数学必然。种子实例(命题 4)值得细看:范畴 C 有三个对象 a、b、c,数据只钉住 a 和 c 上的单点结构与端到端映射,中间对象 b 是黑箱;约束要求(K1)b 上的自同构 t 不是恒等映射、(K2)b 至多 3 个元素。枚举验证:答案空间 Ext₄ 共 25 个延拓,两个 Kan 扩张都坍缩为「平凡单点延拓」——恰好违反 K1;而唯一可接受答案必须有 3 个元素:一个不动点加上一对被 t 交换的发明元素。这两个元素在数据中完全不可见,携带 F₀ 和 Kan 扩张中都不存在的 Z/2 对称。随机命中的概率是 3/25=0.12。换句话说,任何「只做归纳」的策略在这个题上结构性必错,答对就必须发明新结构。

族定理(定理 1)解决规模问题:把种子推广为「尖点链」S(m, p⃗)——m 个隐藏对象、每个带素数 pᵢ 阶自同构 tᵢ。定理证明:每个可接受补都在各隐藏对象处恰有一个不动点加一个 pᵢ 循环;|Adm| = Π(1+pᵢ)(pᵢ−1)! 有闭式;随机水平可经传递矩阵式递推免枚举计算。素数条件是必要的——若 pᵢ 是合数,较短循环也能满足 tᵢ^pᵢ=id,不同循环长度的补全共存,可识别性(J3)就破了。这个定理让认证成本只付一次(在一个证明里),任意难度的实例都能用新词汇重新生成——题库无法被背诵。

正确性与复合理论(第 6 节):命题 7 构造一个二义实例,两个补全都满足全部给定约束(内部正确),但只有含「旁观者元素」的那个能延拓到扣留的未来世界(预测正确)——这是 Nordström 情形的形式化。定理 2 证明「吸收」(上一阶段答案成为下一阶段数据)产生的新对象仍是合法跳变实例;引理 1 证明知识累积单调收缩可接受集;定理 3 构造固着实例——阶段一可接受的旁观者分量在阶段二的探针下被排除,这个旁观者元素就是形式化的「以太」。

评测协议的严谨处在于:实例用随机生造词(nonce vocabulary)包装成中性封面故事(如 NARV→QUILB→SORM 三级信号管道),杜绝记忆匹配;评分按定理 1(i) 的结构特征判卷,规范不变(发明元素改名不扣分);记录完成原因,截断永远不被混同为实质失败;每实例每模型 6 个跳变样本、4 个校准样本、2 个控制样本。整套评估成本不到 15 美元。

五、评估指标与实验证据

设置:4 个前沿模型(GPT-5.6 Luna Pro、Claude Sonnet 5、Gemini 3.1 Pro、DeepSeek V4 Pro)× 9 个认证实例(6 个 m≤2 靠枚举认证、3 个 m=3 靠族定理认证,随机水平从 0.13 到 8×10⁻⁷)。共 464 个判分答案进入统计。

仪器校验(前提条件的实测):无约束时 132 个非截断校准答案中 129 个(98%)输出恰为 Kan 扩张——逐模型确认了「Kan 扩张=模型默认」这一中心假设,而非依赖文献断言;控制组 69/72 通过(3 个失败均为 DeepSeek 在 m=3 的截断或空输出);换措辞的平行渲染无敏感性差异。

主结果:Kan-default 率在全部 248 次约束试验中恒为零——248 次零事件,95% 置信上界仅 1.2%。226 次落在认证可接受类,其余 22 次失败全部可归因:15 次截断、3 次空输出、3 次违反规则、1 次有效但不可接受——没有一次是退回默认。随机水平低至 8×10⁻⁷ 的题上答对,不可能是瞎蒙。

实例(难度)GPT-5.6Sonnet 5Gemini 3.1DeepSeek V4
m=1, p=(2)0.901.001.001.00
m=1, p=(3)1.001.001.000.83
m=2, p=(2,2)0.901.001.000.70
m=2, p=(2,3)1.001.001.000.83
m=2, p=(3,2)1.001.001.000.67
m=2, p=(3,3)1.001.001.000.67
m=3, p=(2,2,2)1.000.831.000.83
m=3, p=(2,3,3)0.831.001.000.33(截断多)
m=3, p=(3,3,3)1.001.001.000.33(截断多)

(表中数字为落进认证可接受类的比例;每格 6 或 10 个样本;所有格的 Kan-default 率均为 0。)

难度分层揭示的机制:m=1 时全体 0.83–1.00;m=3 时 Gemini 3.1 Pro 全满分,DeepSeek V4 崩到 0.33——但其失败中 42–50% 是推理预算耗尽(截断),并非退回默认。也就是说难度拉开的是搜索能力与预算,不是「敢不敢放弃默认」。

搜索基线:一个枚举核对求解器 2.1 秒内复现每个枚举认证实例的答案(m=3 的搜索空间达 1.3×10⁶–2.4×10⁸)。这明确界定了测量对象:不是「答案能否被找到」(搜索就行),而是「模型在上下文中是否覆盖自己的默认」。

部署效应(论文称之为必须控制的现实):输出预算不足会系统性把结果推向默认——因为默认(平凡单点延拓)恰好是最短的答案;某厂商最严的内容过滤层拒答了所有渲染版本(包括纯数学表述),中档过滤层则全部作答——评测基础设施本身会制造假信号。

六、效果优势的根源解释

这篇论文的「效果」是把一场悬而未决的立场之争变成一次有确定读数的测量,其因果链如下。

方法差异:既有辩论双方都在「能力有无」的整体层面交锋——Zahavy 给出机制论证(缺少具身模拟)但没有形式化测试;反驳者举 AlphaEvolve 等案例但案例本身不含受控的「默认 vs 覆盖」对照。本文把跳变的第一步操作化为「覆盖被认证排除的默认」,三件套仪器(校准臂、跳变臂、控制臂)把「有默认吗」「放弃默认吗」「还会延拓吗」三个混淆的问题拆开。

机制变化:第一,用 Kan 扩张充当默认,不是任意选择而是有理论根基的操作化——误差最小化归纳=Kan 扩张的等价性让「损失训练出来的模型默认输出 Kan 延拓」成为可检验的预测,校准臂以 98% 逐模型证实;这把「测的东西」与「训练机制」连在了一起。第二,证书式构造(J1–J4)保证随机命中概率可计算、结构匹配(背题)必错、枚举求解器可独立复现——三种「假阳性」通道被提前封死。第三,控制实例与命题 5(永远输出规范补全的学习者在控制组满分、跳变组零分、校准完美)从数学上证明测量的轴与「系统性/组合泛化」正交——一个只会标准补全的策略恰好被这套仪器识别出来而不是漏检。第四,完成原因分类(截断≠默认退回)防止把工程现象误读为认知现象。

指标提升(此处是结论的可归因性):正因为上述隔离,零 Kan-default 率才有明确含义——Zahavy 论题预测的「模型在选择步修补默认」的行为在 248 次试验中出现次数为零;模型的全部失败可归因为搜索预算与约束错误;因此若「不能跳变」的无能真实存在,它不在本文测量的选择步,而在上游的生成约束或发明框架(Tier 2)。同时配套理论预告了下一步实验该测什么:分离实例测「内部正确但预测错误」,固着链测「承诺遇反例时是否僵化」。

七、必要知识反推

这篇论文的门槛在数学语言,读前建议补齐:

  • 范畴论最小集:范畴(对象+态射+复合表)、函子(保结构映射)、自然变换。好消息是论文刻意只用「有限范畴=有限表格」的具象读法——一个函子到 FinSet 就是一张给每个对象配有限集、每条态射配函数表的带标签结构,不需要深厚的范畴论功底。
  • Kan 扩张的直觉:左 Kan 扩张把数据沿路径前推并认同数据已认同者(最节俭补全),右 Kan 扩张为每条出路径选一致值(最宽松补全);两者是限制函子的左右伴随,由泛性质唯一确定。论文的微型例子最好懂:藏在 a→b→c 中间的 b,左 Kan 说「b 是输入的拷贝」,右 Kan 说「b 是输出的拷贝」——这就是「数据自己算出来的默认」。
  • 误差最小化与 Kan 扩张的等价性(Shiebler 2022、Pugh et al. 2025):理解这条线才能理解为什么 Kan 扩张是「纯归纳的输出」,从而是训练模型的天然默认。
  • Peirce 三分法:归纳(数据→规律)、演绎(公理→结论)、溯因(现象→最好解释的新假设)。跳变属于溯因的极强形式:换公理系统。
  • 规范等价(gauge equivalence):发明元素的改名不改结构——如同物理学中规范变换不改可观测量。评分按等价类进行,这是「结构判卷、不看标签」的实现。
  • 群论一小步:置换的循环分解、素数阶循环不可分(p 素数时 xᵖ=id 的非平凡循环长度只能是 p)——这是族定理可识别性的全部秘密。
  • 科学史背景:Nordström 标量引力(1912–1913)与爱因斯坦通往广义相对论之路(1912–1915)、以太的提出与抛弃——论文的形式化构造(分离实例、固着定理)分别对应这两个历史情节。

八、通用性灵感

  1. 把立场之争翻译成零假设。「模型能不能 X」这类争论最常见的死循环是双方各举各的例子。本文示范了出路:把 X 拆成可独立测量的子步骤、给每个子步骤找到有理论根基的操作化(这里是 Kan 扩张=默认),让论题本身变成可证伪的数字(Kan-default 率)。
  2. 先测默认,再谈覆盖。任何「模型能否超越自身偏好」的实验,第一步都应是校准臂——先无约束地测出模型的真实默认是什么,再在约束下测偏差。跳过校准的实验无法区分「没有默认可覆盖」与「不敢覆盖默认」。
  3. 证书式基准优于评分式基准。答案存在性、唯一性、随机水平、与默认的距离全部机器可验证,使结果免受评分噪声与污染质疑。族定理「一次证明、无限生成、词汇随机」的思路是防基准污染的通用解。
  4. 控制臂分离混淆因素。命题 5 的「永远规范学习者」思想实验值得记住:设计一个在控制组满分、实验组零分的假想策略,如果它能被仪器识别,仪器测的就不是别的轴。任何能力基准都值得做这个检查。
  5. 警惕部署效应伪装成认知缺陷。输出预算不足会系统偏向最短答案(往往就是默认答案),内容过滤会静默拒答——这些基础设施噪声在能力评测里会被误读为「模型不行」。论文把「记录完成原因、截断单列」写进预注册纪律,是便宜而关键的保险。
  6. 负空间同样有信息量。「选择步不是瓶颈」看似只是半个答案,但它把搜索空间精确移到了生成约束与发明框架——好的负结果重新定向研究,而不是终结讨论。

一句话总结:这篇论文没有终结「LLM 能否跳变」的辩论,但它做了更基础的事——给「跳变」装上了刻度。第一读数出人意料地乐观:在默认被证明错误的时刻,四个前沿模型没有一次选择留在原地。剩下的问题(能否自己生成约束、能否发明新语言)已被同一套理论框好,等下一批实验来读数。