论文链接:https://arxiv.org/abs/2608.26161 代码:未公开(论文附录提供完整 prompt 与日志规范) 发布时间:2026 年 7 月 10 日(arXiv v1,cs.CL) 机构:山东大学软件学院 + 浙江师范大学计算机科学与技术学院
一、论文背景
随着 LLM 越来越多地承担智能体模拟和合成数据生成任务,「按指定概率分布采样」从一个理论问题变成了硬性的工程要求。比如用 LLM 模拟一万个人的行为,如果模型连一个均匀分布的性别都抽不准,整个模拟的统计结论就站不住脚。
但大量证据表明,LLM 恰恰在这一步系统性翻车:GPT-4 掷骰子、抛硬币时出现稳定的数字偏好;20 个 LLM 玩石头剪刀布全部偏离均匀混合策略;用完整的 NIST 随机性测试套件检验,表现最好的 LLM 通过率不到三分之一,而 Python 的伪随机数生成器超过 87%。更有意思的是,这个缺陷是「执行层」而非「知识层」的——模型可以准确描述目标分布的形状,甚至能推导出博弈论上的最优混合策略,但一到实际采样就做不到。论文把这种现象称为「认知-行为鸿沟」,且加大模型规模、调节温度都无法消除。
现有应对思路主要有两条。第一条是外部化:让模型调用 numpy.random 或干脆把采样外包给代码执行环境。这就像模型不会算术就交给计算器——问题被绕开了,但模型本身的功能性缺陷被掩盖而非解决。第二条是内在化:代表性工作 SSoT(String Seed of Thought)让模型先生成一条随机字符串作为熵源,再自主从这个字符串推导出样本。但本文作者实测发现,SSoT 的根基不稳——模型生成的字符串本身就不是无偏的。
二、论文定位和关联工作
论文在 Related Work 中梳理了三条研究脉络。
LLM 随机性缺陷的记录:从早期的均匀整数生成、掷骰子、抛硬币等受控评估,到石头剪刀布中 20 个模型的系统性偏差,再到 NIST 测试套件的大规模审计,结论一致——LLM 的随机输出质量远达不到统计要求。根源被追溯到自回归生成的结构性质:数字上下文中的输出概率校准很差,偏差由词身份、呈现顺序和语料频率驱动。
缓解尝试:一类工作授予模型代码执行权限,把随机化委托给可执行代码;另一类用有偏硬币序列作为上下文证据,测试模型的贝叶斯更新能力。这些工作说明了工具或上下文证据能恢复什么,但没有给出一个内生的采样机制。
SSoT 及其局限:SSoT 让模型先生成随机字符串积累熵,再自主操纵字符串得出样本,理论上总变差距离随字符串长度指数下降。但本文指出它的两个硬伤:其一,它假设初始字符串是无偏字符源——本文第 3.2 节的实测直接推翻了这个假设;其二,它从字符串到样本的提取逻辑是黑盒,映射过程不透明、不可审计。此外,现有文献几乎只关注离散任务(骰子、硬币、石头剪刀布),而 Zhao 等人对 11 个模型、15 种连续分布的审计显示 10 个模型全军覆没,却没有人给出针对连续分布的构造性解法。DSC 正是填补这个空缺。
三、问题定义
论文要解决的问题可以严格表述为:在不借助任何外部工具的前提下,让 LLM 通过单次推理调用,从指定的一维连续概率分布 F₀(如均匀、正态、指数分布)中生成统计上保真的样本。
「保真」的度量采用两个拟合优度指标。KS 统计量 Dₙ 衡量经验分布函数与目标分布函数之间的最大垂直偏差,越小越接近目标;一阶 Wasserstein 距离 W₁(搬运距离)则对整个支撑集上的偏差做积分,对系统性低幅度偏差更敏感。离散任务上则用卡方统计量检验类别频率与目标概率的匹配程度。
在正式提出方法前,论文先做了一项奠基性的测量实验:让 6 个模型各生成 200×5 条 16 字符随机字符串(取自 95 个可打印 ASCII 字符),检验字符级均匀性。结果是全军覆没——所有模型的 KS 检验均拒绝均匀分布(统计量 0.082–0.197,p 值均小于 0.001)。#、@、数字和部分字母被严重偏爱,另一些字符几乎绝迹:Gemini 3.1 Pro 用满 94/95 个字符还算体面,Kimi-K2.5 只会使用 29 个字符。更糟的是前缀模板化:Claude Opus 4.5 有 53.4% 的种子共享重复的 4 字符前缀。这直接宣判了「单字符串无偏种子」假设的死刑。
四、问题解法
DSC(Dual-Seed Comparison)的核心洞察是:与其相信模型能生成无偏的字符,不如只利用两个字符之间「谁大谁小」这个相对关系。即使两条字符串共享同样的有偏字符分布,只要两串独立,任何一方的偏差都会在对称比较中互相抵消。整个流程分五个阶段,全部在一次推理调用内完成:
Stage 1 双种子生成与洗牌:模型生成两条相互独立的 16 字符随机串 s⁽¹⁾、s⁽²⁾,并各自内部洗牌(生成重排 π₁、π₂)。洗牌是关键补丁——由于自回归生成的位置相关性,模型常在固定位置输出固定模式,洗牌可以打散这种位置结构。
Stage 2 逐位序值比较:对每个位置 i,比较两个字符的 ASCII 码值:bᵢ = 1 当且仅当 ord(c⁽¹⁾ᵢ) > ord(c⁽²⁾ᵢ),否则为 0(含平局)。得到 16 位比特串。
Stage 3 二进制转整数:将 16 位比特串按大端序解释为无符号整数 N ∈ {0, …, 65535}。
Stage 4 归一化:计算 u = N/2¹⁶ ∈ [0,1),得到分辨率 2⁻¹⁶ 的伪均匀变量。这个粒度刻意保持在当代 LLM 单次前向能可靠完成的算术范围内。
Stage 5 映射到目标分布:对均匀分布直接返回 u;对其他分布,模型用自己的数学知识执行逆 CDF 变换 d = F₀⁻¹(u)。例如正态分布就是把 u 当作累积概率反查出对应的分位数。
理论保证来自附录 A 的分析:设字符边缘分布 P_c 的碰撞概率为 γ(P_c) = Σₐ pₐ²,则比较位满足 Pr(b=1) = (1−γ)/2,即偏离公平硬币的程度恰为 γ/2。均匀分布时 γ = 1/95,偏离仅约 0.005;只要字符分布足够弥散(没有单个字符占据过高概率质量),比较位就接近公平硬币,即便边缘分布本身并不均匀。论文还推导出每个比较位的香农熵为 h((1−γ)/2),均匀时接近 1 比特。
与 SSoT 的黑盒映射相比,DSC 的每一步中间产物(种子、比特串、整数、均匀变量、最终样本)都被强制显式输出,形成完全可审计的推理链。
五、评估指标与实验证据
实验设置:5 个模型(Claude Opus 4.5、Gemini 3.1 Pro、MiniMax-M2.5 三个专有模型,Qwen3.5-27B、Qwen3.5-9B 两个开源模型),5 种目标分布(均匀、正态、指数、Beta(2,5)、Gamma(2,2)),对比 Direct 直接采样与 SSoT 两个基线,每条件 200 次试验 × 5 次重复,温度 1.0。
主结果:DSC 在 25 个模型-分布条件中的 24 个取得最低 KS 统计量;50 项逐项指标对比中 48 项最优;以每种条件下 Direct 和 SSoT 的较优者为最强基线,DSC 将其误差中位数降低 58.5%。Qwen3.5-27B 在全部 5 个分布上 KS < 0.096(n=200 时 α=0.05 的临界值),即通过统计检验。
| 模型 | 指标 | Uniform (Direct/SSoT/DSC) | Normal (Direct/SSoT/DSC) | Beta (Direct/SSoT/DSC) |
|---|---|---|---|---|
| Claude Opus 4.5 | KS | .717 / .241 / .141 | .653 / .476 / .169 | .489 / .274 / .216 |
| Gemini 3.1 Pro | KS | .332 / .373 / .082 | .485 / .232 / .095 | .416 / .494 / .090 |
| MiniMax-M2.5 | KS | .303 / .117 / .104 | .185 / .159 / .135 | .302 / .226 / .163 |
| Qwen3.5-27B | KS | .268 / .184 / .082 | .274 / .233 / .079 | .413 / .241 / .076 |
| Qwen3.5-9B | KS | .272 / .162 / .089 | .274 / .234 / .120 | .401 / .248 / .053 |
最亮眼的单项提升:Qwen3.5-9B 的 Beta 分布上,DSC 把 KS 从 SSoT 的 0.248 降到 0.053(降 78.6%),W₁ 从 0.072 降到 0.017(降 76.4%)。仅有的两个例外都出现在 MiniMax-M2.5 上(指数分布 KS 0.097 vs SSoT 的 0.084;Beta 的 W₁ 0.080 vs Direct 的 0.076),差距小且局限于单一模型。
下游任务一(MCQ 生成,Qwen3.5-9B):要求正确答案均匀分布在 A/B/C/D 四个选项。Direct 方法 63.9% 的正确答案挤在选项 C、选项 A 只有 3.3%(χ²=174.3);SSoT 仍然显著偏离(χ²=34.3,p<0.001);DSC 四项分布为 26.2/25.0/24.7/24.1,χ²=2.9(p=0.458),无法拒绝均匀假设。
下游任务二(属性约束文生图提示词):四个属性需同时服从指定分布。性别上 Direct 和 SSoT 分别 78%、84% 偏向女性,DSC 达到 52.3/47.7 的近完美平衡(χ²=1.5);身高上 DSC 的均值 168.8cm、标准差 11.9cm 最接近目标 N(169, 10²);种族与外套颜色上 DSC 也取得最低 χ²(31.9 与 33.5),不过论文诚实地指出种族属性三种方法都仍未完全贴合人口普查目标。
管线诊断(附录 B/C):逐阶段 KS 追踪显示,20/25 个设置中最终 KS 与 Stage 2 的差不超过 0.02——偏差绝大部分在种子生成和比较位构造阶段就已定型,后续算术通常只是保持。种子来源消融证实:洗牌把 Claude 的 Dup-4 前缀重复率从 0.534 压到 0.053,其均匀分布 KS 从 0.342 降到 0.137;而换成 Python SystemRandom 程序生成的种子,所有模型所有分布的 KS 全部低于临界值(如 Claude 均匀分布达 0.055)——残差的最后一公里在种子质量本身。另一个反直觉发现:MiniMax-M2.5 的阶段执行正确率极低(Stage 2 仅 5.8%–23.7%),但其最终分布保真度却不算最差——中间值算错了,分布却可能没被大幅改变。
六、效果优势的根源解释
DSC 的优势可以拆成一条完整的因果链。
方法差异:Direct 把「按分布采样」压缩成一步生成,完全暴露于自回归模型的概率偏好;SSoT 引入了字符串熵源,但直接消费单条字符串的绝对字符身份,且从种子到样本的映射由模型自由发挥、不可见;DSC 则用「两条种子的相对序」替代「单条种子的绝对值」,并把后续变换固定为透明的确定性算术管线。
机制变化:第一,序值比较算子是本质性的去偏机制——两个字符谁大谁小,只取决于它们的联合分布而非各自的高频偏好。只要两串独立同分布,交换对称性保证大于和小于的概率严格相等,偏差只剩碰撞率 γ 的一半;实测中洗牌后的比较位聚合比例落在 0.485–0.494,比特偏差全部低于 0.017。第二,洗牌破坏了位置模板——DSC 逐位比较,若两条种子共享重复前缀,模板会直接渗入比较位,洗牌把固定位置结构打散(Claude 的重复前缀率降 90%)。第三,确定性的比特→整数→归一化→逆 CDF 管线让每个样本的产生过程可复算、可审计,消除了 SSoT 黑盒映射中不可控的自由度。
指标提升:正是上述机制,使 DSC 在 96% 的条件下 KS 最低、误差中位数降 58.5%;在下游任务中,把答案位置从 63.9% 挤在 C 校正到 χ² 检验无法拒绝的均匀分布,把性别偏差从 78–84% 的女性倾斜拉回到 52/48。而诊断实验反过来验证了因果链的每一环:偏差集中在 Stage 2(种子与比较位)、洗牌有效、程序种子能把误差全部压到临界线以下——说明剩余误差确实来自种子质量而非管线设计,改进方向被精确定位。
七、必要知识反推
想真正读懂这篇论文,需要具备(或补齐)以下知识点:
- 拟合优度检验三件套:KS 检验度量经验 CDF 与目标 CDF 的最大偏差(对尾部形状敏感),W₁ 距离对全支撑集偏差积分(对系统性小幅偏差敏感),卡方检验处理离散类别频率。论文刻意报告 KS 统计量而非 p 值,因为 p 值随样本量增长会拒绝任何微小偏差,无法比较方法优劣。
- 逆 CDF 变换采样:若 u ~ U(0,1),则 F₀⁻¹(u) 服从分布 F₀。这是所有采样算法的桥梁,也是 Stage 5 的数学依据。需要理解正态、指数等分布的分位数函数如何手工近似。
- 碰撞概率与瑞利商式的偏差控制:γ = Σpₐ² 刻画分布集中度,是均匀分布的下界 1/K;平局确定性映射为 0 会引入 γ/2 的系统偏置——这是理论残差的来源,也是「为什么不用随机平局裁决」的答案(那需要外部随机源)。
- 自回归生成的位置相关性:理解为什么 LLM 会在固定位置输出固定模式(前缀模板化)、为什么字符频率反映语料先验,就理解了洗牌为什么必要。
- NIST 随机性测试套件:作为背景知识,理解 LLM 随机数与工程级 PRNG 的差距量级。
八、通用性灵感
抛开采样这个具体任务,这篇论文留下几条可迁移的思想:
- 相对比较优于绝对生成。当模型的绝对输出带有系统性偏好时,构造两个独立采样再取其相对关系(谁大谁小、是否相等),可以让共享偏差在对称性下抵消。这个「互偏去偏」(mutual debiasing)思想可以推广到任何需要无偏信号但模型自带先验偏好的场景。
- 黑盒自由度是偏差的藏身处。SSoT 的问题不在于用字符串做种子,而在于让模型「自由地」决定如何使用种子。把中间步骤全部显式化、确定化,偏差就没有地方躲藏——这也是可审计性与统计保真度在同一条因果链上的原因。
- 先诊断、再归因、后改进。论文的管线诊断把最终误差逐阶段溯源,发现 80% 的偏差在 Stage 2 已定型,于是「改进种子生成」(如作者建议的注意力掩码保证独立性)成为明确的下一步。这种阶段级消融方法论值得任何多步推理系统借鉴。
- 执行错误 ≠ 分布失真。MiniMax-M2.5 算错大量中间值但最终分布没崩,提醒我们评估生成系统时应盯住最终统计性质,而非中间步骤的对错——反之,中间全对也不代表分布正确。
- 诚实的边界声明。论文明确警告 DSC 不是密码学安全 PRNG,LLM 内部状态确定、输出受 prompt 影响强,绝不能用于密钥生成等安全场景。一个去偏方法同时清楚自己不能去什么偏,这种克制本身值得学习。
总而言之,DSC 用一个几乎朴素的技巧——比较两个随机字符串的大小——撬动了 LLM 原生采样这个结构性难题,在 96% 的实验条件下取得最优保真度。它不能让 LLM 变成真正的随机数生成器,但它证明了:在承认模型偏差的前提下精心设计协议,统计意义上的公平是可以被「算」回来的。