一、论文背景

第三方 LLM API 的信任问题是什么?开源权重不等于便宜自托管——Kimi K2 的官方部署指南要求 FP8 权重+128K 上下文在 H200/H20 上最少 16 卡。这把绝大多数开发者推向第三方推理 API。但模型名只是声明:服务商可能路由到量化降级版、更小的模型、甚至不同家族的模型——性能、安全对齐、合规状态全部随之改变。这不是假想威胁:2025 年以来多个"套壳"事件(API 实际转发其他模型)被社区曝光,agentic 编码系统(Codex/Claude Code 深度依赖特定模型行为)让模型身份成为系统级可靠性问题。

**现有验证手段为何失效?**密码学远程证明需要硬件与协议支持(服务商不配合);要求 logprob 输出——多数第三方 API 不提供;单次输出人工判别——无法区分"随机路由"(时而真时而假)与"确定性诚实",因为单样本没有统计力。

二、论文定位和关联工作

研究谱系代表工作核心思想与本文的关键区别
远程证明TPM/TEE 体系硬件级运行时证据需服务商配合;本文纯黑盒
模型指纹模型行为指纹研究输出分布/特征匹配常需logprob或白盒;本文重构分布
LLM 供应链安全权重水印、模型谱系权重侧溯源本文API侧行为审计
API 基准审计简单延迟/成本检查服务质量监测不验证模型身份

定位结论:Ventor-QTest 把"模型身份声明"的审计形式化为随机过程估计,在零协作、零概率输出的约束下给出可操作的黑盒协议。

三、问题定义

具体场景:用户购买了模型 M 的 API 服务;实际后端可能是混合路由:以概率 p 服务真 M、以概率 1-p 服务替代模型(量化版/小模型/别家模型)。

核心洞察:冻结约束上下文(强约束的 prompt)下,模型对受限任务的输出分布具有判别力——不同模型的"类别输出分布"差异可测;从多次重发的文本计数重构该分布,等于对路由过程做抽样估计。

形式化:目标 API 为黑盒 oracle O;构造冻结约束上下文 c 与离散输出空间 Y(类别化后的响应);发送 N 次相同请求,得计数 {n_y};重构分布 p̂(y|c);与参考模型分布 p_ref(y|c) 比较,计算 AFL(平均保真损失)与 EFL(最坏情况期望保真损失)。求:在不假设获得任何概率信息的前提下,给出可判别的保真度量。

抽象的精妙之处:把"诚信问题"转化为"分布估计问题"—— cheating 不再是道德判断,而是与参考分布的偏离度。

四、问题解法

1. 威胁模型驱动设计。明确攻击者(服务商)能力:完全控制后端路由、可观察请求模式、可动态切换模型;约束:无法伪造真模型的分布(生成分布是其身份)。

2. 重复请求组件。冻结约束上下文多次重发;从返回文本计数重构类别分布。类别化设计(把开放文本响应映射到判别性类别)是分布可比的关键。

3. 双指标报告。AFL 捕捉平均保真(日常体验);EFL 捕捉最坏情况(长时程任务中偶发的降级路由——对 agentic 工作流是灾难:一次弱模型接管可能毁掉整条任务链)。论文论证两者必须联合报告:只报 AFL 会漏检"平均诚实、最坏降级"的攻击面。

4. 开源工程化。并入腾讯 AI-Infra-Guard 的 api_checker 服务,可对任意第三方 API 运行。

五、评估指标与实验证据

指标:AFL(平均保真损失,越低越好)与 EFL(最坏情况期望保真损失,越低越好)的联合报告;重构分布与参考分布的判别力。

实验设置:真实第三方 API 上的审计案例展示(论文正文与附录给出对公开托管服务的检测实例,含路由混合的识别)。

实验设计为何有证明力:冻结上下文+重复请求的设计使"分布差异→身份差异"的推断有统计力(N 次采样的计数构成分布估计);双指标分离平均与尾部行为——对 agentic 场景(长序列调用)的敏感性论证与任务结构直接挂钩。

六、效果优势的根源解释

单次判别的根本局限:一次输出只是分布的一个样本——无法区分"诚实模型的一次不典型输出"与"替代模型的一次典型输出";人工判别在此基础上还引入判别者的主观阈值。

Ventor-QTest 的机制因果链:冻结约束上下文 → 把模型的自由生成压缩到判别性类别空间(信噪比提升)→ 多次重发的计数 → 类别分布的重构(单样本升级为分布估计)→ 与参考分布比较 → 路由混合权重可估计(谁的"平均"与"最坏"都现形)。

反事实:若服务商提供 logprob,单次请求即可得分布——但这正是威胁模型排除的假设;若不冻结上下文,输出分布被 prompt 方差淹没,计数不可比。

七、必要知识反推

领域知识层:LLM 推理服务的工程现实(部署成本、量化变体、路由策略)——威胁模型的现实依据;agentic 系统对模型行为一致性的依赖——EFL 指标的场景动机。

方法论知识层:统计估计(从计数重构分布、抽样方差);假设检验与判别力分析;远程证明的密码学范式(作为对比与不可行性论证的参照)。

工程知识层:冻结上下文的类别化设计(开放文本→判别类别);大规模重复请求的成本控制;开源工具与现有安全平台的集成。

知识融合的关键节点:“模型身份 = 输出分布"的行为主义还原——把密码学解决不了的问题(无证明协议)转成统计学可解的问题(分布比较)。这要求同时放弃"必须密码学保证"的执念与"人工看看就行"的懒惰。

八、论文中可以提取的通用性灵感

1. 身份可以定义为行为分布:当证明协议不可得时的验证路径。推广场景:食品溯源(无标签时的成分谱检测);艺术品鉴定(风格统计指纹);社交账号真实性(行为模式分布)。

2. 平均指标会掩盖尾部作弊:关键场景须双指标。AFL/EFL 分离。推广场景:SLA 的可用性与尾延迟并报;供应商审核的平均合格率与最差批次;模型安全的平均通过率与最差子群体。

3. 冻结条件+重复测量=统计力的最小配方。控制输入方差、累积输出样本。推广场景:A/B 测试的固定实验单元;质检的固定样品重复测量;心理测量的重测信度。

4. 供应链的每个转包环节都须可独立审计。API 是模型供应链的转包层。推广场景:云服务的下游依赖审计;食品链条的每个加工环节;临床试验的每个外包中心。

5. 把信任问题形式化为估计问题,工程上才可行动。“是否作弊”→“分布偏离多少”。推广场景:内容真伪的概率化判定;员工诚信的行为化度量(而非动机揣测);设备健康度的性能分布漂移监测。