论文链接: arXiv:2608.09888
开源代码: github.com/pathwaycom/arc-task-gen
发表时间: 2026 年 8 月
机构: Pathway 公司(Björn Engdahl, Jan Chorowski, Adrian Kosowski 等 9 人合著)。Pathway 是一家专注于"动态可学习数据基础设施"的欧洲 AI 公司,本文是其面向"抽象推理"(流体智力/Fluid Intelligence)这条路线的旗舰实验。论文未走传统顶会路线,而是以预印本 + 公共排行榜 + 第三方独立审计(Bielik AI、纽约大学复现)的形式发布结果,强调可复现性。
领域标签: 序列模型、潜在推理(Latent Reasoning)、循环记忆、ARC-AGI、上下文学习(In-Context Learning)。
一、论文背景
要理解 BDH-CQ 为什么值得读,得先回到 AI 领域近两年最热闹的一个分歧:“会说话的推理"和"会思考的推理”,究竟是不是一回事?
1.1 思维链:把推理"说"出来
2022 年前后,研究界发现了一个非常有效的"开关":在大语言模型后面补一句 “Let’s think step by step”(让我们一步一步想),模型在数学题、逻辑题上的得分会暴涨。这就是 Chain-of-Thought(思维链,CoT)。
思维链的本质,是把原本藏在模型内部、一步到位的计算,摊开成了一串自然语言 token——就像要求学生"考试时必须把解题过程写在草稿纸上"。每生成一个 token,模型就被迫把中间状态"显式化"一次。对 GPT、Claude、Gemini 这类 Transformer 大模型来说,这相当于给自己开辟了一块"外部工作内存"。
但思维链有两个难以回避的代价:
- token 成本爆炸。一道难题常常要写几百到几千个"思考 token",每一个 token 都要走一遍几百亿参数的网络。这就是为什么我们在 API 上调一次"深度思考"模型(o1、DeepSeek-R1 等),账单会比普通模型贵十倍以上。
- 推理被语言绑架。模型必须在自然语言这个"低带宽通道"里表达中间状态。但很多推理本质上是空间、几何、关系网络的——硬塞进文字会失真。你让模型"想象一个 3D 立方体在 5 维空间里旋转 30 度",它得用一大段文字去描述,每一步都可能走偏。
打个比方:思维链推理就像你让一个人必须把心算过程全部念出来。念得越慢、越啰嗦,越不容易出错,但喉咙(token 预算)会先撑不住。
1.2 潜在推理:把"想"搬回脑子里
既然"念出来"这么贵,那能不能让模型在内部"安静地"想?
这就是 潜在推理(Latent Reasoning) 的动机:不让模型输出自然语言中间步骤,而是在它的高维隐空间里反复迭代几轮,让神经元之间"自己讨论"出答案,最后再把结论解码成可见输出。
类比:人类做"7×8"时不会念"7 加 7 加 7……",脑子里有个直接给出 56 的"黑箱"。这就是潜在推理最直观的对应。再比如老司机遇到前车急刹,根本不会有意识地念出"刹车—看后视镜—打方向",身体已经把整套推理压缩成了一个本能反应——这也是潜在推理。
技术圈其实早就摸到了这个方向:
- Pause Token / Think Token:在输入里插入特殊占位符
<think>,让模型"停顿"几步再输出,每一步都是一次隐状态的前向计算。 - Latent CoT / Coconut:把语言模型的中间隐状态直接喂回自己的输入,不走"解码成文字"这一步。
- 搜索 + 价值网络(AlphaGo、o1 内部):在隐空间里展开一棵搜索树,挑价值高的分支走。
这些方案的共同信号是:“会说话”≠“会思考”,把推理从语言通道里解放出来,是下一代模型的重要方向。 BDH-CQ 正是这条路线上的一个激进版本。
1.3 ARC-AGI:用来"卡"推理的试金石
光说"潜在推理更强"没用,还得有个公认的考场。这个考场就是 ARC-AGI(Abstraction and Reasoning Corpus for AGI),由 AI 研究者 François Chollet(也是 Keras 的作者)提出,2024 年升级为 ARC-AGI-2。
ARC-AGI 是什么?一句话:它是一道道"找出隐藏规律"的格子谜题。
每道题给你 2–5 张小图(输入/输出对),每张图是一个 30×30 以内的彩色方格网,要求你推断出输入到输出之间的变换规则,然后在新的输入上应用这个规则。
示例(颜色用字母代替):
训练 1:输入 [2 2 2] 输出 [4 4 4]
训练 2:输入 [3 3 3] 输出 [5 5 5]
测试: 输入 [7 7 7] 输出 ?
正确答案:[8 8 8] (规律:每个数字 +2)
ARC-AGI 的设计哲学专门针对当前 LLM 的软肋:
- 每道题都是全新的,靠死记硬背训练数据没用;
- 题目不能靠"概率最大 token"糊弄过去,必须真的抽象出规律;
- 不能用自然语言"凑答案"——最终输出必须是格子,错了就是错了。
Chollet 把这种能力称为"流体智力"(Fluid Intelligence)——和"晶体智力"(Crystalized Intelligence,即学到的知识)相对。它在心理学上专指面对新问题时,从零开始抽象规律、解决问题的能力。ARC-AGI 的野心,就是把它做成 AI 的"IQ 测试"。
到目前为止,ARC-AGI 是出了名的难:
- GPT-4o 早期只能拿个位数百分数;
- 即便用了大量思维链 + 程序生成(“先写代码再跑”),顶级模型 2024 年底也才在 ARC-AGI-1 上摸到 10–20%;
- 公共排行榜上 30%+ 的成绩,每涨一个百分点都是大新闻。
所以,当一个 150M 参数的小模型,宣布在 ARC-AGI-1 公共集上拿下 29.5%、单任务只花 0.0007 美元时,整个社区都竖起了耳朵——它不仅便宜 50 倍以上,而且用的根本不是"思维链"那套思路。这正是 BDH-CQ 引起关注的背景。
二、论文定位和关联工作
BDH-CQ 不是凭空冒出来的,它站在三条研究脉络的交汇处。下面把它们梳理清楚,方便理解本文在"潜在推理"这条赛道里的位置。
2.1 谱系一:Transformer + 思维链范式(主流 baseline)
这是当前最主流的"推理派别",代表选手是 OpenAI o1、DeepSeek-R1、Anthropic Claude(启用 extended thinking 时)、Google Gemini 2.5 Thinking 等大型推理模型。
核心思想:把推理过程显式展开为自然语言 token 序列,让模型"念出"每一步。每一步的隐状态都会被下一层的注意力机制读到,相当于在 Transformer 的前向计算里"开了一个长草稿"。
优势:表达能力强、可解释性高(你能看到模型在想什么)、可以直接复用现有的预训练 + RLHF 流水线。
根本局限:成本随推理深度线性膨胀。每多想一步就多一串 token,每个 token 都要走几百亿参数。这是 BDH-CQ 要打破的瓶颈。
代表工作与公开成绩:在 ARC-AGI-1 上,GPT-5.6 Luna(Low) 模式推理一次的成本约 0.040 美元/任务,是 BDH-CQ 的 57 倍。
2.2 谱系二:潜在 CoT / Pause Token(“安静思考"派)
这条路线保留了 Transformer 主干,但不让模型输出文字 token,而是插入"思考槽位”,让隐状态在槽位里反复前向传播。
代表工作:
- Pause Token(Goyal 等, 2023):在输入序列里插入可学习的
[PAUSE]占位符,让网络多前向 K 步。 - Coconut(Hao 等, 2024):把上一步的最终隐状态直接当作下一步的输入嵌入,相当于"绕过"解码器,形成隐式的 CoT。
- Latent Reasoning with Inner Monologue(Meta, 2024):把内部独白压成若干连续向量。
关键区别:这一派大多仍用标准 Transformer 结构,隐状态维度是稠密、连续的,更新方式仍是"堆注意力层"。BDH-CQ 不一样:它的隐状态有"高维 + 极度稀疏"的特性,并且显式引入了循环记忆与工作空间的分离(下面会详细讲),更新方式不是"堆层"而是"同一层反复跑"。
2.3 谱系三:非 Transformer 架构 / 状态空间模型(“动态系统"派)
近两年有一批工作质疑 Transformer 的根本结构,认为它的注意力机制每次都要看完整序列、KV 缓存随上下文线性增长这件事不可持续。代表方向:
- Mamba / S4 / S6(Gu & Dao, 2023):状态空间模型,用一个低秩递推矩阵维护"摘要状态”,推理时是 O(1) per token。
- RWKV:把注意力改写成线性递推形式,兼具 RNN 的推理效率与 Transformer 的训练并行性。
- Hyena / RetNet:用长卷积或衰减机制替代 softmax 注意力。
- Sparse Distributed Representations / HD Computing:用超高维(几万维)、极度稀疏的二值向量做记忆,模拟大脑皮层的稀疏编码。
关键区别:这一派大多追求"替换注意力机制、做长序列压缩",目标仍然是"处理序列"。BDH-CQ 的立场更激进:它的循环不只是"压缩历史",而是故意停在某一步反复迭代,把"推理深度"做成一个独立的旋钮。结构上,它属于 Dragon Hatchling(BDH)架构家族——一类强调"高维稀疏激活 + 低秩通信 + 循环关联状态"的后 Transformer 模型。
2.4 谱系四:上下文学习(ICL)与少样本抽象
ARC-AGI 是典型的 In-Context Learning(上下文学习) 场景:你给模型几道例题,它不更新参数,直接从例题里"悟"出规则。这一方向的关键问题:
- 示例如何被"记住"?标准 Transformer 是把示例塞进 KV 缓存,推理时每一步都要对它们做注意力。
- 示例信息和推理过程怎么分工?这是 Transformer 没有显式区分的——同一个 KV 缓存既装着示例,也装着中间推理步骤,两者混在一起。
BDH-CQ 的关键创新之一:把"记住示例"和"做推理"拆成两个独立的记忆体——一个叫循环记忆 S(装示例),一个叫推理工作空间 H(装计算)。这是它和所有 Transformer-based ICL 方法最本质的区别。
2.5 定位小结
下表把几条路线放到一张图里:
| 维度 | Transformer + CoT | 潜在 CoT / Pause Token | Mamba / RWKV 等 SSM | BDH-CQ(本文) |
|---|---|---|---|---|
| 推理载体 | 自然语言 token | 连续隐状态(密集) | 状态向量(低秩) | 高维稀疏隐状态 + 循环记忆 |
| 推理深度控制 | 长度 = token 数 | 槽位数 | 序列长度 | 独立旋钮 R 次 |
| 示例 vs 推理存储 | 混在 KV 缓存 | 混在隐状态 | 单一状态 | S 和 H 分离 |
| 单任务成本 | 高(随深度线性涨) | 中(槽位数 × 前向) | 低 | 极低(0.85 GPU-秒) |
| ARC-AGI-1 表现 | 中(强模型可达 ~30%,但贵) | 较弱 | 一般 | 29.5%,便宜 50×+ |
定位结论:BDH-CQ 不属于"换注意力"派,也不属于"加思考 token"派。它属于第三条路——重新设计"记忆—推理"分工的循环架构,把推理深度从"token 长度"里解放出来,做成一个可以单独调的旋钮。这正是它在 ARC-AGI 上能"以小博大"的结构性原因。
三、问题定义
读完背景,我们站在 BDH-CQ 的视角,看看它要解决的本质问题到底是什么。
3.1 从具体场景到抽象问题
具体场景:给定 ARC-AGI 这种"少样本格子谜题"——K 张输入/输出示例对 {(x_k, y_k)} 加一张测试输入 x*,求预测 ŷ。
朴素做法(Transformer ICL):把示例和测试输入拼成一条长序列,送进模型,模型输出答案。问题在于:示例信息必须全程占用 KV 缓存,推理时每个新 token 都要对它做注意力;而推理过程本身(思维链 token)又不断写入新的 KV,导致缓存越来越长,开销线性膨胀。
BDH-CQ 的洞察:把"装载示例“和”执行推理“这两件事,视为两种性质完全不同的计算,应该用两套不同的状态来承担。
3.2 类比:工作记忆 vs 长期记忆
这正好对应到认知科学里的一个经典划分:
| 心理学概念 | 含义 | BDH-CQ 对应 |
|---|---|---|
| 长期记忆(Long-Term Memory) | 稳定、容量大、更新慢 | 循环记忆 S_t:随示例累积演化 |
| 工作记忆(Working Memory) | 临时、容量小、变化快 | 推理工作空间 H_r:承载迭代计算 |
你做数学题时,“公式"和"题目条件"装在长期记忆里(稳定),而"演算"发生在工作记忆里(飞快地变)。如果把两者混在一起,你的草稿纸会越写越乱——这正是标准 Transformer ICL 的处境。
3.3 形式化问题定义
基于以上洞察,BDH-CQ 把问题抽象为:
给定
- 一组示例对序列 $S_K = \{(x_1, y_1), \dots, (x_K, y_K)\}$
- 一张测试输入 $x^*$
- 推理深度 $R$(循环次数)
求:预测 $\hat{y} = \mathrm{Model}_\theta(x^*, S_K; R)$
约束
- 成本约束:单任务总前向计算量与 $R$ 成线性关系,且不随示例数 K 或历史长度增长(即不能像 CoT 那样 KV 缓存越积越长)。
- 状态约束:示例信息必须从 S 中读取,推理过程必须在 H 中进行,二者职责互不重叠。
- 表示约束:H 是高维 + 高度稀疏的(大部分维度为零,少量为强激活),不能是稠密浮点向量。
3.4 这个抽象的精妙之处
这个抽象把"成本随深度爆炸"的痛点直接做成了约束条件,逼着自己必须用循环 + 独立状态的结构,而不是堆叠更多层或生成更多 token。
更进一步,“高维 + 稀疏” 这个约束意味着模型不能简单复用稠密的 Transformer 隐状态——它必须像大脑皮层那样,用极少数强激活的神经元表示概念,每次更新只动一小撮维度。这种表示方式让"在同一层反复迭代"变得可行(因为每次只改一点点),也为后面讲的"低成本推理"打下了基础。
可以说,BDH-CQ 的问题定义本身就已经暗含了它的解法方向——约束即结构。
四、问题解法
现在来看 BDH-CQ 究竟怎么解这个问题。我们先把整体流程画出来,再逐个组件拆解。
4.1 全景:三阶段流水线
示例 + 测试输入
│
▼
┌──────────────────────────┐
│ 阶段 1:编码 │ H_0 = E_θ(x*, S_K)
│ (读示例 + 测试, │ 同时把示例写入循环记忆 S_K
│ 输出初始工作空间 H_0) │
└──────────────────────────┘
│
▼
┌──────────────────────────┐
│ 阶段 2:潜在推理(循环) │ for r = 0 to R-1:
│ H_{r+1} = F_θ(H_r, S_K) │ H = F(H, S) ← 无自然语言输出
│ (R 次迭代,每次同一组 │
│ 参数 F_θ) │
└──────────────────────────┘
│
▼
┌──────────────────────────┐
│ 阶段 3:解码 │ ŷ = G_θ(H_R)
│ (从最终工作空间读答案) │
└──────────────────────────┘
│
▼
预测输出 ŷ
三个阶段共享同一套模型参数 θ,但用三个"功能头”:
- $E_\theta$:编码器(Encoder)
- $F_\theta$:推理核(Reasoning Kernel)—— 这是反复迭代的核心
- $G_\theta$:解码器(Decoder)
而 循环记忆 S 在三个阶段里都参与:编码时被写入,推理时被读取,解码时也可被引用。
4.2 组件一:循环记忆 $S_t$(长期记忆)
类比:循环记忆就像一本会自动更新的笔记本。你每读一道例题,就把例题的"要点"用一种紧凑的格式记下来;之前的笔记不会被擦掉,而是和新笔记一起整合。
形式化:设第 $t$ 步读到的示例片段是 $D_t$,则
$$S_t = U_\theta(S_{t-1}, D_t)$$- $S_t$:第 $t$ 步的循环记忆状态;
- $D_t$:第 $t$ 个示例片段(比如一对 (x, y));
- $U_\theta$:更新函数(同一套参数反复用)。
关键特性:
- 容量有界:$S_t$ 的维度是固定的,不随示例数增长。10 道示例也好,100 道示例也好,$S$ 都一样大。
- 累积演化:新示例不是覆盖旧示例,而是增量更新——这类似于 RNN 的隐状态,但作者强调了"示例角色"的特殊处理。
- 低秩通信:$S$ 的更新只动一小部分维度(低秩),保证每次更新便宜。
和 KV 缓存的本质区别:Transformer 的 KV 缓存随示例数线性增长,且每个新 token 都要对它做完整的注意力——这是 O(K) 的开销。而 $S_t$ 是固定大小、固定更新成本,是 O(1) 的。
4.3 组件二:推理工作空间 $H_r$(工作记忆)
类比:$H$ 就像你的大脑皮层工作区——不是装知识的,是用来算东西的。它维数极高(远超 Transformer 的几千维),但任何时刻只有极少数维度被"强激活”。
形式化:
$$H_{r+1} = F_\theta(H_r, S_K)$$- $H_r$:第 $r$ 轮推理的工作空间;
- $S_K$:装载好的循环记忆(编码阶段完成后基本固定);
- $F_\theta$:推理核,每次迭代都用同一组参数。
关键特性:
- 高维 + 稀疏:$H$ 的维度可能上万,但只有一小部分维度有强激活值(>0),其余接近零。这是它和稠密 Transformer 隐状态最大的不同。
- 正激活值:激活值基本都是正数(非负),类似生物神经元的发放率。
- 反复迭代:$F_\theta$ 不是堆 R 层,而是同一层跑 R 次——这是"循环"的含义。
为什么用稀疏 + 高维?作者(以及神经科学界)的依据是:稀疏表示对噪声鲁棒、对容量扩展友好、对"只动一小撮维度"的更新特别高效。如果 $H$ 是稠密浮点向量,每次迭代都要全量更新,计算量随维度爆炸;而稀疏表示只需要更新激活的那些维度,成本天然可控。
打个比方:稠密 Transformer 隐状态像"白板,每次擦了重写";稀疏高维 $H$ 像"一张巨大的格子纸,每次只在几个格子里画/擦",自然省力。
4.4 组件三:推理核 $F_\theta$(“想一遍"的动作)
$F_\theta$ 是整套架构的心脏。它的职责是:读一眼笔记(S),在工作区(H)里推进一步,写出新的 H。
输入:当前 $H_r$ 和记忆 $S_K$ 输出:下一步 $H_{r+1}$ 内部计算(伪代码,省略低秩通信细节):
def F_θ(H, S):
# 1. 从记忆里读出相关条目
retrieved = attention_or_lookup(S, query=H) # 低秩通信
# 2. 把检索结果和当前工作空间混合
mixed = combine(H, retrieved)
# 3. 非线性激活(产生稀疏 + 正激活)
H_new = sparse_activation(mixed) # 大部分维度被压到 0
return H_new
关键点:
- $F_\theta$ 是参数共享的——不论 R=3 还是 R=100,用的都是同一个 $F_\theta$。这让推理深度 R 可以在推理时调整(像旋钮一样),不需要重训模型。
- “低秩通信"意味着 $F_\theta$ 内部的信息交换不是全连接的稠密矩阵乘法,而是低秩近似(类似把一个 $d \times d$ 矩阵拆成两个 $d \times k$ 和 $k \times d$ 的小矩阵,$k \ll d$)。这是 BDH-CQ 单步成本能压到 0.85 GPU-秒的关键。
4.5 组件四:编码器 $E_\theta$ 与解码器 $G_\theta$
这两个组件相对常规,但仍有讲究。
编码器 $E_\theta$:
- 输入:测试输入 $x^*$ 和示例集 $S_K$。
- 输出:初始工作空间 $H_0$,同时把示例写入循环记忆 $S_K$。
- 做法:把每个格子的颜色编码成稀疏高维向量,逐道示例读入,更新 $S$;最后把 $x^*$ 编码成 $H_0$。
解码器 $G_\theta$:
- 输入:最终工作空间 $H_R$。
- 输出:预测 $\hat{y}$(一张格子图)。
- 做法:从 $H_R$ 里"读出"每个格子的颜色概率,组装成输出网格。
4.6 推理深度 R:一个独立的"思考预算"旋钮
把三个阶段串起来,推理深度 R 是 BDH-CQ 相对于所有 baseline 最显著的结构性优势:
| 模型 | 如何控制"想多深” | 代价 |
|---|---|---|
| Transformer + CoT | 多生成思考 token | KV 缓存线性增长,token 成本爆炸 |
| Pause Token | 多插入槽位 | 槽位也要走前向,成本线性 |
| BDH-CQ | 调大 R | 每步成本固定(0.85 / R GPU-秒),状态不积累 |
论文里有一个消融实验直接验证这点:把 R 从 LOW 调到 HIGH,ARC-AGI-1 准确率从 21.0% 涨到 29.5%,而成本只是按比例线性增加——没有"指数膨胀"的惩罚。
4.7 全景对比表
把 BDH-CQ 的所有组件放到一张表里:
| 组件 | 角色 | 类比 | 关键设计 |
|---|---|---|---|
| 循环记忆 $S$ | 长期记忆 | 笔记本 | 固定容量、低秩更新、累积演化 |
| 工作空间 $H$ | 工作记忆 | 大脑皮层 | 高维、稀疏、正激活 |
| 推理核 $F_\theta$ | “想一遍” | 一个思考动作 | 参数共享、低秩通信、可循环 |
| 编码器 $E_\theta$ | 读入 | 把题抄进脑子 | 把示例写入 S、把测试写成 H_0 |
| 解码器 $G_\theta$ | 输出 | 把答案念出来 | 从 H_R 读出格子颜色 |
| 推理深度 R | 思考预算 | 想几遍 | 独立旋钮,成本线性 |
到这里,BDH-CQ 的"骨"就清晰了:用循环记忆装示例,用稀疏工作空间做计算,用参数共享的推理核反复迭代 R 次,最后解码输出。下一节我们看它在实验里到底跑出了什么成绩。
五、评估指标与实验证据
论文的实验部分非常硬核,用了一系列相互印证的实验来支撑"BDH-CQ 在潜在推理 + 循环记忆这条路线上确有实效"这个核心主张。我们分四个层次看:主实验、细分能力实验、消融实验、第三方独立审计。
5.1 评估指标体系
| 指标 | 定义 | 衡量的本质能力 |
|---|---|---|
| pass@1 | 每题只采样一次,答对的比例 | 单次推理的可靠性 |
| pass@2 | 每题采样 2 次取最好,答对的比例 | 推理多样性的上限 |
| Wilson 95% 置信区间 | 有限样本下的统计区间 | 结果的可信度(不靠"凑巧”) |
| 单任务成本 | 美元 / GPU 秒 per 任务 | 算力经济性 |
| 受控泛化 | 在合成变体上的准确率 | 是真"理解"还是死记硬背 |
5.2 数据集:为什么选 ARC-AGI-1
- ARC-AGI-1 公共集(400 题):论文的主战场,公认的"流体智力"基准。每题都是全新的,专门卡死记硬背型模型。
- ConceptARC(480 题,16 个概念族):把 ARC 按概念类型(如"复制"“填充"“变换”)细分,能定位模型的强项和弱项——这是单纯刷排行榜做不到的。
- 作者自建的合成测试集:用于做"受控泛化"实验,检验模型是否真的学到了规则而不是记忆。
为什么不用 MMLU、GPQA 这些?因为它们主要考知识(晶体智力),而 BDH-CQ 想证明的是推理(流体智力)。ARC-AGI 是当前最干净的"纯推理"考场。
5.3 主实验:ARC-AGI-1 公共集
| 模型 | pass@2 | pass@1 | 单任务成本 |
|---|---|---|---|
| GPT-5.6 Luna (Low) | (报告时高于 BDH-CQ) | — | $0.040 |
| BDH-CQ (HIGH) | 29.5%(118/400) | 24.25% | $0.00070 |
| BDH-CQ (MEDIUM) | 27.0% | — | ~$0.00045 |
| BDH-CQ (LOW) | 21.0% | — | ~$0.00025 |
关键解读:
- 29.5% pass@2,95% Wilson 区间 25.24%–34.15%——这是统计学上显著的"30% 左右”,不是抽签抽出来的。
- 单任务 0.00070 美元 ≈ 0.85 H200 GPU-秒。对比 GPT-5.6 Luna(Low) 的 0.040 美元,便宜约 57 倍。论文还做了一个"最悲观"假设:即便 Luna 降价 80%,BDH-CQ 仍然便宜约 11 倍。
- pass@2 比 pass@1 高约 5 个百分点,说明模型有一定的"多样性"——换一次采样可能想到不同答案。
注意点:BDH-CQ 的成绩是 pass@2,一些 baseline 报的是 pass@1。论文在附录里也给了 pass@1 对比,结论仍然成立。读者引用时需要注意口径。
5.4 细分能力:ConceptARC 16 概念族
ConceptARC 的 480 道题分布在 16 个概念族上,BDH-CQ 的整体 pass@2 达 59.38%(远高于公共集的 29.5%,说明 ConceptARC 的题目平均更"标准"、更接近训练分布)。
更有意思的是按概念族拆分:
| 能力类别 | 表现 | 解读 |
|---|---|---|
| 填充 vs 未填充识别 | 9/10 | 极强:能区分"填进去"还是"留空白"这种空间模式 |
| 上下/左右 2D 变换 | 9/10 | 极强:对几何变换抓得很准 |
| 边界延伸 | 8–9/10 | 强:能把图案向外"长出去" |
| 复制 | 2/10 | 弱:反而是"简单复制"做不好 |
| 排序 | 2/10 | 弱:对"按某规则排列"的能力差 |
| 颜色交换 | 26/72 | 中下:在颜色映射上不够稳定 |
这个分布非常有启发性:
- 强项都是"空间结构 + 局部变换"——这和 BDH-CQ 的稀疏高维表示天然契合(空间结构容易稀疏编码)。
- 弱项是"序列化 + 全局重排"(排序、颜色交换)——这类任务需要全局比较和多步串行决策,而 BDH-CQ 的推理核是"局部稀疏更新"为主,全局一致性可能不足。
这说明 BDH-CQ 不是"什么都强",它有自己的"能力指纹"。这一点比单纯看总分更值得关注。
5.5 受控泛化:是"理解"还是"记忆"?
为了证明模型真的"悟出规则"而不是"背答案",作者做了一组精心设计的合成实验:
实验 1:密集映射绑定(2–8 个颜色)
- 任务:学会一个颜色到颜色的映射(如红→蓝、绿→黄……),然后在新的格子上应用。
- 结果:2 到 8 个颜色,96/96 全对。
实验 2:传播距离(2–8 步)
- 任务:某种模式需要向某方向"传播"若干步。
- 结果:2 到 8 步距离,48/48 全对。说明模型能把规则外推到训练时没见过的距离。
实验 3:排序规模
- 任务:对 N 个物体按某规则排序。
- 结果:N ≤ 5 时近乎饱和;但 N = 8 时骤降到 1/24。
解读:
- 前两个实验说明 BDH-CQ 真的学到了规则(能外推到新颜色数、新距离),不是"见过的才会"。
- 第三个实验说明它的串行处理能力有上限——一旦物体超过 5 个,推理深度 R 可能不够用了。这恰好对应了"循环推理深度有限"这个结构特性。
5.6 消融实验:推理深度 R 的作用
| 推理努力 | pass@2 |
|---|---|
| LOW | 21.0% |
| MEDIUM | 27.0% |
| HIGH | 29.5% |
结论:推理深度 R 是真的有用的——从 LOW 到 HIGH 涨了 8.5 个百分点。而每一步的成本是线性的,所以这不是"指数级烧钱换性能"。
5.7 第三方独立审计:可信度的最后一块拼图
ARC-AGI 排行榜有个老问题:各家自报成绩,口径不统一。论文专门请了两个独立团队复现:
- Bielik AI(波兰开源模型团队)
- 纽约大学(NYU) 相关研究组
两边都独立复现了 29.5% pass@2 这个数字。这是论文可信度最硬的一块拼图——尤其在 ARC-AGI 这种"一道题就能影响 0.25 个百分点"的小数据集上,独立复现尤其重要。
5.8 实验小结
| 实验层次 | 结论 |
|---|---|
| 主实验(ARC-AGI-1) | 29.5% pass@2,便宜 57 倍 |
| 细分(ConceptARC) | 强空间 / 弱串行,能力指纹清晰 |
| 受控泛化 | 颜色绑定、传播距离完美外推,排序规模有上限 |
| 消融(R) | 推理深度有效,成本线性 |
| 独立审计 | Bielik + NYU 双重复现 |
这套实验设计的精妙之处在于:它不是"只刷一个总分",而是从多个角度交叉验证"潜在推理 + 循环记忆"这条路确实在做事。下一节我们从机制层面解释,为什么这套设计能跑出这样的成绩。
六、效果优势的根源解释
本节是全文最关键的分析:为什么 BDH-CQ 能用 150M 参数 + 0.85 GPU-秒,跑出和几千亿参数 CoT 模型相提并论的成绩? 我们拒绝"因为用了潜在推理所以好"这种表层解释,而是从机制因果链上追根溯源。
6.1 明确对比对象:Transformer + CoT 的根本局限
baseline 是以 GPT-5.6 Luna(Low) 为代表的"大 Transformer + 思维链"路线。它为什么有效?
- 大模型 + 自然语言 CoT 相当于一块"无限长草稿纸":模型可以把中间状态摊开成文字,每写一个 token,注意力机制就能从任意历史位置取信息。
- 这套机制在知识密集任务(MMLU、GPQA)上近乎无敌,因为那些任务本来就用语言表达。
但它的根本局限在哪?三点:
- KV 缓存随推理深度线性膨胀。每多想一步就多几个 token,每个 token 都要在 KV 里占一行;后续每一步的注意力都要扫一遍所有历史 KV。这意味着推理深度 D 的成本是 O(D²)(朴素注意力)或至少 O(D)(即使有 FlashAttention)。
- 自然语言是低带宽通道。一个浮点数的信息量 ≈ 32 比特;一个自然语言 token 的信息量在 ARC-AGI 这种小词表场景下可能只有几比特。把高维隐状态"翻译"成 token 再翻译回来,信息必然失真。
- 示例信息与推理过程混在同一 KV 里。模型一边读例题、一边写思考、一边生成答案,三种信息挤在同一条缓存里相互干扰。
这三条不是"它没做 X",而是"它的 X 导致了不可逾越的代价"——即便给它更多参数、更多 GPU,成本曲线也不会变平。
6.2 BDH-CQ 的根本性改变:三道结构性"换轨"
BDH-CQ 不是"在原路上跑得更快",而是换了三条轨。
改变 1:把推理深度从"序列长度"剥离出来
在 Transformer + CoT 里,“想多深” = “生成多少 token” = “KV 增长多少”——三者捆绑在一起。
BDH-CQ 的改变:推理深度 R 是独立旋钮。每次迭代用的是同一组参数 F_θ,工作空间 H 的维度固定,循环记忆 S 的维度也固定。所以"想 10 次"和"想 100 次"的差异,只是 10 次前向 vs 100 次前向——完全线性,没有缓存膨胀。
机制因果:参数共享 + 固定状态大小 → 推理深度的成本是 O(R),而非 O(R²)。
改变 2:把"装载示例"和"执行推理"分进两个状态
Transformer 的 KV 缓存是"什么都装"的混合仓库。BDH-CQ 拆成:
- S(循环记忆) 只装示例 —— 稳定、容量有界、低秩更新;
- H(工作空间) 只装推理 —— 高维、稀疏、快速变化。
机制因果:职责分离 → 示例信息不会在迭代中被"推理过程"覆盖或污染 → 模型可以放心地在 H 里反复迭代,而不必担心"忘掉例题"。
这一点在 ConceptARC 的"颜色绑定"实验里体现得最清楚:2–8 个颜色的映射 96/96 全对,说明 S 把映射表"钉死"住了,H 只管应用——两者配合才能这么稳。
改变 3:高维 + 稀疏表示替代稠密浮点
Transformer 的隐状态是几千维稠密浮点向量,每次前向都要全量计算。
BDH-CQ 的 H 是高维(可能上万维)+ 极度稀疏(大部分为 0)+ 正激活。这带来两个结构性优势:
- 每次迭代只动少数维度 → 等价于"稀疏更新",FLOPs 天然变少。
- 稀疏表示对噪声鲁棒 → 在迭代 R 次的过程中,误差不会像稠密向量那样指数积累。
机制因果:稀疏高维表示 → 单步成本低 + 误差不积累 → R 可以调得比较大而不崩。
6.3 建立完整因果链
把三道改变串起来:
BDH-CQ 结构性改变
│
├─ 改变 1:推理深度独立 ────────┐
├─ 改变 2:示例/推理状态分离 ────┤
└─ 改变 3:高维稀疏表示 ────┤
▼
机制层面的三重变化:
(a) 单步成本 O(1),深度成本 O(R)
(b) 示例不被推理污染
(c) 稀疏更新 → 单步便宜 + 误差不爆
│
▼
指标层面的三重提升:
· 单任务成本压到 0.0007 美元(便宜 57×)
· ConceptARC 颜色绑定 96/96 全对
· ARC-AGI-1 拿下 29.5%(pass@2)
每一步都可验证:
- (a) 对应成本对比表(5.3 节);
- (b) 对应受控泛化实验(5.5 节);
- (c) 对应消融实验 + ConceptARC 稳定项(5.4、5.6 节)。
6.4 反事实推理:拆掉某个设计会怎样?
我们做一个"思想实验":
如果去掉"状态分离",把 S 和 H 合并:那么每次推理迭代都会改写示例记忆,K 道例题的信息会被推理过程冲淡。预期退化:颜色绑定类任务准确率会大幅下降(因为没有稳定的"映射表"可读)。论文的 ConceptARC 弱项(排序 2/10)其实部分暗示了这点——排序需要"全局一致的中间状态",而 H 的稀疏更新可能不足以维持。
如果去掉"稀疏 + 高维",改用稠密浮点 H:那么每次 F_θ 的前向成本随维度平方增长,R=100 时就会爆显存。预期退化:单任务成本会从 0.0007 美元涨到接近 baseline 水平。
如果去掉"参数共享",给每次迭代不同的 F:那 R 就不是独立旋钮了,必须重训模型才能改深度。预期退化:灵活性丧失,无法做 LOW/MEDIUM/HIGH 的消融。
这三条反事实说明:BDH-CQ 的三项核心设计是相互咬合的,缺一不可。
6.5 哪些提升暂时无法完全解释?
诚实地讲,论文也有些"工程性"的成分暂时难以纯结构解释:
- 29.5% vs 27.0% vs 21.0% 这条 LOW → HIGH 的曲线,为什么不是单调线性上升、而是有点"边际递减"?这可能是 R 增大后信息利用率到达瓶颈。
- 复制能力只有 2/10——这有点反直觉,因为"复制"看起来是最简单的。可能的原因是 BDH-CQ 的稀疏编码不利于"逐位置精确搬运"。这部分论文没有深入解释,留给了后续工作。
总结一句:BDH-CQ 的优势不是"凑巧好",而是三道结构性换轨在机制上必然带来的结果。这也意味着,这条路有继续挖掘的空间——下一节我们从论文反推作者必须掌握的知识。
七、必要知识反推
假设找一个完全没有相关背景的人去做 BDH-CQ 这项工作,他最少必须掌握哪些知识?我们按层次拆解。
7.1 领域知识层
ARC-AGI 的设计哲学
- 为什么 ARC-AGI 专卡死记硬背?因为它每题都是全新的、不可穷举的。
- 为什么"流体智力"是关键?因为它衡量的是"面对新问题的抽象能力",这是当前 LLM 最缺的。
- 为什么必须:不理解 ARC-AGI 的设计哲学,就不知道为什么不能拿 MMLU 凑数,也就找不到正确的评估靶子。
上下文学习(ICL)的机制
- ICL 是怎么"不更新参数就学会新任务"的?
- 当前 ICL 的瓶颈在哪?(KV 缓存膨胀、示例与推理混杂)
- 为什么必须:BDH-CQ 的核心创新是"重设计 ICL 的记忆结构",不理解 ICL 的痛点就无从创新。
认知科学里的"工作记忆 vs 长期记忆"
- 这两种记忆的分工、容量、更新方式。
- 为什么必须:这是 BDH-CQ “S/H 分离"的灵感源头。没有这个认知模型,作者可能想不到要把状态拆成两套。
7.2 方法论知识层
Transformer 架构及其 KV 缓存的代价曲线
- 注意力的 O(L²) 复杂度、KV 缓存的线性增长。
- 为什么必须:要知道 baseline 的瓶颈是结构性的,才能设计出真正"换轨"的方案。
状态空间模型 / RNN 的循环更新机制
- Mamba、RWKV 等如何用低秩递推做 O(1) per token。
- 为什么必须:BDH-CQ 的循环记忆 S 借鉴了这一思路。
稀疏分布式表示 / 超维计算
- 高维(万维以上)+ 极度稀疏的二值/整型向量如何表示概念。
- 为什么必须:这是 BDH-CQ 工作空间 H 的表示基础,决定了"单步成本低 + 误差不积累"的特性。
潜在推理的前序工作
- Pause Token、Coconut、Inner Monologue 等。
- 为什么必须:要知道前人试过什么、为什么没完全成功,才能定位自己的创新点(独立的 R 旋钮 + S/H 分离)。
循环神经网络的梯度稳定技术
- 如何让同一组参数反复迭代不发散(残差连接、归一化、激活约束)。
- 为什么必须:F_θ 要跑 R 次,训练时梯度必须稳定,否则模型根本训不出来。
7.3 工程知识层
ARC-AGI 的提交格式与评分协议
- pass@1 / pass@2 的计算方式、Wilson 区间、独立审计流程。
- 为什么必须:要在公开排行榜上被认可,必须严格按协议提交。
H200 GPU 的算力 / 显存特性
- 单卡 FLOPs、显存带宽、批处理效率。
- 为什么必须:把单任务成本压到 0.85 GPU-秒,需要对硬件有精确的把握。
合成数据生成与受控泛化实验设计
- 如何构造"训练时没见过的变体"来检验泛化。
- 为什么必须:不这么做就无法证明"真懂规则”,会被质疑"只是记忆"。
独立审计的组织能力
- 如何让 Bielik AI、NYU 等团队愿意花资源复现。
- 为什么必须:在 ARC-AGI 这种小数据集上,没有第三方复现,结果可信度大打折扣。
7.4 知识融合的关键节点
以上知识不是简单叠加,而是在三个关键节点上发生了"化学反应":
融合节点 1:把"工作记忆 vs 长期记忆"翻译成两套状态
- 认知科学(领域)× 循环更新(方法论)→ S 和 H 的分离设计。
- 这是论文最核心的创造性瞬间——把一个心理学划分,落地为两套不同的数据结构和更新规则。
融合节点 2:用稀疏高维表示解决"循环迭代会发散"
- 稀疏分布式表示(方法论)× 梯度稳定(方法论)→ H 的高维稀疏正激活设计。
- 这一步让"同一组参数反复迭代"在工程上变得可行,是融合节点 1 的必要支撑。
融合节点 3:用受控泛化实验证明"真懂规则"
- 合成数据(工程)× ARC-AGI 哲学(领域)→ 颜色绑定、传播距离等实验。
- 这一步把"我们的模型真懂规则"从口号变成了可验证的事实,是论文可信度的基石。
可以说,BDH-CQ 是认知科学 + 稀疏编码 + 循环架构 + 严谨评估这四股力量在"ARC-AGI"这个具体问题上的一次集中融合。
八、论文中可以提取的通用性灵感
BDH-CQ 虽然瞄准的是 ARC-AGI 这个具体基准,但它背后的设计哲学具有明显的普适性。下面提炼几条可以迁移到其他领域的灵感。
8.1 灵感一:把"思考深度"做成独立旋钮
核心思想:推理深度不应和"输出长度 / 上下文长度"捆绑,而应该是一个可在推理时调整的独立参数。
论文证据:BDH-CQ 的 LOW/MEDIUM/HIGH 三档对应 21.0% / 27.0% / 29.5%,而成本只是线性变化。这证明"推理深度独立化"是可行的,且收益显著。
可推广场景:
- 实时对话系统:简单问题用低 R(快答),复杂问题用高 R(深思),按用户耐心动态分配算力。
- 自动驾驶决策:常规路况低 R,复杂路口高 R,把"思考预算"和"安全等级"挂钩。
- 代码补全:单行补全低 R,跨文件重构高 R。
- 机器人控制:平稳行走低 R,复杂装配高 R。
- 金融风控:日常交易低 R,可疑交易高 R,兼顾吞吐和准确。
8.2 灵感二:职责分离——“装知识"和"做计算"用两套状态
核心思想:把"长期稳定的知识 / 上下文"和"快速变化的计算过程"分别用两套数据结构承担,避免互相污染。
论文证据:BDH-CQ 的循环记忆 S(装示例)和工作空间 H(做推理)分离,使得颜色绑定类任务 96/96 全对——如果混在一起,例题信息早就被推理冲淡了。
可推广场景:
- Agent 系统:把"用户长期偏好”(S)和"当前任务推理"(H)分开维护,避免 Agent 在长对话里"忘了用户是谁"。
- 数据库查询优化:把"schema 信息"(S)和"查询计划迭代"(H)分开,查询优化器可以反复迭代而不丢 schema。
- 推荐系统:把"用户长期兴趣"(S)和"当前会话意图"(H)分开,避免短期行为冲垮长期画像。
- IDE 编码助手:把"项目代码库摘要"(S)和"当前编辑上下文"(H)分开,长项目里也不会"忘了项目结构"。
- 教学系统:把"学生长期掌握情况"(S)和"当前题目推理"(H)分开,做个性化辅导。
8.3 灵感三:高维 + 稀疏表示天然适合"反复迭代"
核心思想:当一个系统需要反复迭代(而不是一次性前向)时,高维稀疏表示比稠密浮点更鲁棒、更便宜。
论文证据:BDH-CQ 的工作空间 H 是高维稀疏正激活,每次 F_θ 只动少数维度,单步成本压到 0.85/R GPU-秒;同时 R 可以调到比较大而不发散——这是稠密向量做不到的。
可推广场景:
- 嵌入向量检索:用稀疏高维向量替代稠密 embedding,检索时只比较激活维度,速度更快。
- 推荐系统用户画像:用稀疏高维向量表示兴趣,天然支持"增量更新"(加一个兴趣只动几维)。
- 物联网传感器融合:多源异构传感器数据用稀疏高维编码,便于分布式迭代融合。
- 知识图谱推理:实体关系用稀疏高维向量,多跳推理时误差不积累。
- 生物信息学:基因/蛋白质功能用稀疏高维表示,模拟生物神经编码方式。
8.4 灵感四:用"受控泛化实验"证明"真懂规则"
核心思想:当一个系统在某项任务上表现好时,不能只看总分,而要构造训练分布外的合成变体,检验它是否真懂规则。
论文证据:BDH-CQ 在颜色绑定(2–8 色 96/96 全对)、传播距离(2–8 步 48/48 全对)上做到完美外推,但排序规模到 8 个物体就崩到 1/24——这种"按能力维度细分 + 合成变体检验"的做法,让强项弱项一目了然。
可推广场景:
- LLM 评估:不只刷 MMLU 总分,构造"训练数据里没见过的变体"(比如改名字、改数字、改语序)来检验是否真懂。
- 代码模型评估:不只测 HumanEval,构造"函数签名变体"“逻辑等价改写"来检验泛化。
- 自动驾驶测试:构造"训练数据里没见过的路口变体”(罕见标志组合、特殊天气)来验证鲁棒性。
- 医疗 AI:构造"训练集里没见的病例变体"来检验诊断模型是否真懂病理。
- 教育评估:给学生"没做过的题型变体",区分"真懂"和"刷题刷出来的熟练"。
8.5 灵感五:独立审计是可信度的最后一块拼图
核心思想:在"小数据集 + 高方差"的评估场景下,第三方独立复现是结果可信度的必要条件,不是锦上添花。
论文证据:BDH-CQ 请 Bielik AI 和纽约大学两边独立复现 29.5%,这是它能在社区站住脚的关键。
可推广场景:
- 新模型发布:任何声称 SOTA 的工作,都应主动邀请 2+ 独立团队复现。
- 科研论文评审:审稿过程中引入"独立复现"环节,减少"不可复现的 SOTA"。
- 工业 A/B 测试:关键决策(改版、定价)引入独立团队复算指标,避免"自报数字"。
- 医疗新药审批:临床试验必须独立复现,这条规则其实在所有"高 stakes + 小样本"领域都适用。
- 安全审计:网络安全漏洞声明也应由第三方独立复现,避免误报或夸大。
8.6 灵感六:承认"能力指纹"而非追求"什么都强"
核心思想:一个有特色的系统往往不是"什么都强",而是有清晰的"能力指纹"——强项弱项分明。承认这一点比追求"平均分最高"更有价值。
论文证据:BDH-CQ 在空间变换类任务上 9/10,但在复制和排序上只有 2/10。论文没有回避这个事实,反而把它作为"BDH-CQ 适合什么场景"的依据。
可推广场景:
- 模型选型:不要只看"总分第一",要看能力指纹是否匹配你的任务(空间任务用 BDH-CQ 类,序列任务用别的)。
- 团队招聘:承认每个工程师的"能力指纹",按项目需求匹配,而不是追求"全能选手"。
- 产品设计:明确产品"擅长什么、不擅长什么",把不擅长的部分外包或集成第三方。
- 教育个性化:承认学生的能力分布,因材施教,而不是要求"每科都第一"。
- 投资组合:承认每种资产类别的"风险收益指纹",组合配置,而不是追求"单资产最优"。
结语:潜在推理这条路,值得继续走
BDH-CQ 不是终点,它只是一次有力的"概念验证":在 150M 参数的小模型上,通过循环潜在推理 + 状态分离 + 稀疏高维表示,可以在 ARC-AGI 这种纯推理基准上逼近几千亿参数的大模型,同时成本便宜 50 倍以上。
这件事的意义不在于"29.5% 这个数字",而在于它结构性地证明了:
推理不需要绑死在自然语言上,思考深度不需要绑死在 token 长度上,示例和推理不需要挤在同一块缓存里。
这三条"解绑",很可能是下一代推理模型的共同特征。无论 BDH-CQ 这个具体架构未来能走多远,它指出的方向——把推理从语言里解放出来——几乎肯定会被更多工作继承和发展。
对于关注 AI 趋势的读者来说,这篇论文值得放进"必读清单"的原因也正在于此:它让我们看到了大模型之外,另一条结构性的可能路径。
附:本文核心数据速查
- 模型参数量:150M
- ARC-AGI-1 公共集:29.5% pass@2(118/400,95% Wilson 区间 25.24%–34.15%),pass@1 24.25%
- 单任务成本:$0.00070(约 0.85 H200 GPU-秒)
- 成本对比:比 GPT-5.6 Luna(Low) 便宜约 57 倍;即便 Luna 降价 80%,仍便宜约 11 倍
- ConceptARC:16 概念族 pass@2 整体 59.38%
- 强项:填充/未填充识别 9/10、上下/左右 2D 变换 9/10、边界延伸 8–9/10
- 弱项:复制 2/10、排序 2/10、颜色交换 26/72
- 受控泛化:密集映射 2–8 色 96/96 全对;传播距离 2–8 步 48/48 全对;排序 ≤5 近乎饱和,8 物体仅 1/24
- 消融:LOW 21.0% / MEDIUM 27.0% / HIGH 29.5%
- 独立审计:Bielik AI、纽约大学双重复现 29.5% pass@2