Token-Level Advertising —— 精读

论文链接:https://arxiv.org/abs/2608.27382

发表时间:2026 年 8 月 27 日(arXiv:2608.27382v1,标注 Preprint、Work in progress)

发表机构:中国人民大学、百度公司、斯坦福大学(企业+高校合作:人大负责理论与实验主导,百度提供商业搜索场景视角,斯坦福 Yinyu Ye 参与机制设计)

作者:Hanbing Liu、Bowei Zhang(人大)、Changyuan Yu(百度)、Yinyu Ye(斯坦福)、Qi Qi(人大,通讯作者)

备注:论文原文未提供开源代码链接。


一、论文背景

论文开篇引用了麦克卢汉 1964 年的名言"媒介即讯息"。几十年来,互联网界面组织信息的方式是检索、排序、展示已存在的内容——搜索引擎返回排好序的结果,推荐系统从物品库里挑选商品。广告机制也围绕这一结构生长:无论赞助搜索位、展示广告位还是推荐流中的推广位,商业机会都可以预先定义成槽位(slot),再拍卖给广告商。

生成式 AI 正在动摇这个根基。AI 原生界面不再"选择展示什么",而是围绕用户意图动态合成回答——内容本身在交互中逐步成形。此时"槽位"抽象开始失效:一个产品可能只在回答朝某个方向发展时才变得相关;生成早期的一个用词选择,会决定后文提到某品牌是自然还是突兀。生成不仅填充广告机会,更在创造广告机会。

传统广告机制把两个问题分开处理:“存在哪些机会"与"谁获得机会”。拍卖理论为后者准备了成熟工具(GSP、VCG),但默认前者是外生给定的。当生成轨迹本身决定广告商能否被自然纳入时,只在预定义机会上做分配的机制,就把生成媒介最重要的一环留在了分配过程之外。论文要回答的核心问题是:能否设计一个把广告商影响直接嵌入 token 级生成、同时保证激励相容、个体理性与近最优福利的机制?

二、论文定位和关联工作

论文 Related Work 部分梳理了三条脉络,并明确自身的递进位置:

经典在线广告拍卖。GSP 与 VCG 分配外生定义的广告库存,后续工作引入级联效应、广告外部性、更丰富的点击率结构,以及搜索/推荐/电商/情境广告中广告与自然内容的联合优化。尽管与内容和用户的交互越来越复杂,这些模型保留同一抽象:机制分配的是预先存在的槽位、物品或位置。

生成式界面下的机会重定义。生成式界面挑战了这一抽象,因为广告机会可能依赖于正在生成的回答。更广泛地,近年研究让策略性主体通过下一 token 分布或偏好影响 LLM 输出,使生成本身成为机制结果的一部分。在 LLM 广告方向,一些工作把机会定义在话语片段或上下文相关的位置-创意对上(如 AI 生成内容中的位置拍卖、基于 RAG 的 LLM 广告拍卖),另一些研究回答级的广告插入。更 LLM 原生的做法包括纳入回答质量约束、通过模型输出分布分配广告、或探索检索决策与模型内部表示带来的机会。

本文的位置。这些工作逐步把广告分配从固定槽位推向生成过程,但机制通常仍作用于已被识别的机会——一个片段、一个位置或一条完整回答。“生成塑造机会,但生成本身不是分配过程”。LAMA 再往前走一步:广告商影响以 token 粒度沿生成轨迹演化,机会在生成中动态涌现,机制设计问题从"在生成回答内分配赞助内容"转变为"治理广告商影响如何塑造回答的生成过程"。对照实验中的 MOSAIC 即"回答级聚合"路线的代表(生成 M 条完整候选、按聚合广告商价值打分、加权抽签选出),论文用它检验"token 级"相对"回答级"的增益。

三、问题定义

把 token 级广告形式化为嵌入语言学生成的序贯机制:

  • 上下文与参考生成。词表 V,最大生成长度 L。用户查询 q 初始化过程;平台有自然策略 π_ref(无广告干预时的下一 token 分布,全支撑)。轨迹由逐 token 确定性拼接而成,遇 EOS 或达到最大长度终止。
  • 广告商与私有类型。n≥2 个广告商,每人有私有终态奖励函数 rᵢ:只在生成终止于终态 ℓ 时获得价值 rᵢ(ℓ)。本文聚焦单赢家设置:最终赞助机会分配给一个广告商(λ∈Δ(N))。
  • 序贯机制。在每个非终止前缀 s_t:各广告商提交消息 m_{i,t};机制给出下一 token 分布 x(·|h_t, m_t)、采样 token a_t、并对每人收取瞬时支付 pᵢ(h_t, m_t, a_t);平台私有观测全部历史,广告商只观测公共状态。终止时实施最终分配 λ(h_T)。
  • 效用。标准拟线性效用:终态分配价值减去沿途支付总和。
  • 激励约束。直接报告整个奖励函数不现实(慢且泄露未实现轨迹的私有信息),故强调轻量级报告。核心定义是 Markov DSIC:诚实报告不仅在一开始最优,还要在任何可达未来前缀之后(即"看到有利前缀再操纵"也不划算)保持最优;外加 IR(诚实参与期望效用非负)。
  • 平台目标。最大化 KL 正则化社会福利:广告商总价值减去 β 乘以策略对 π_ref 的 KL 偏离——后者度量用户体验代价,β 是变现与自然度的旋钮(与 RLHF 中的 KL 惩罚同源)。

四、问题解法

4.1 LAMA 机制:四步循环

LAMA 的核心思想是把生成过程看作贝叶斯序贯决策,边生成边识别"最值得出现的广告商"。每轮循环四步:

  1. 报告:每个广告商 i 报告子代价值向量——对每个可能的下一 token a,报告 [s,a] 的续写价值。诚实报告应为最优软价值函数 V*ᵢ([s,·])。平台用"账本"在线校验 Bellman 一致性:新报告的子代值经软 Bellman 聚合必须等于账本中已存的本状态值(校验只需存一个标量)。
  2. 下一 token 生成:报告诱导广告商专属策略 π̃ᵢ(a|s) ∝ π_ref(a|s)·exp(V̂ᵢ([s,a])/β)——即"假设 i 诚实时 i 的最优 token 分布"。平台先从分配后验 ρ(s) 采样一个潜在广告商 I,再从 π̃_I 生成下一 token。边际上等价于按 ρ 加权混合各家策略。
  3. 更新:观测到实际 token 后按 Bayes 规则更新后验 ρᵢ([s,a]) ∝ ρᵢ(s)·π̃ᵢ(a|s)/x(a|s)——哪个广告商的策略越"预言"了实际走向,其权重越高;账本同步更新各家的续写价值。
  4. 结算:到达终态后,最终分配即终态后验 λ = ρ(s_T)。采用 winner-settled 实现:从 ρ(s_T) 采样唯一赢家 I*,只向赢家收费、非赢家付零。

支付规则由两部分望远镜式(telescoping)叠加:入口费(按初始后验与根值计算)+ 沿途按"后验加权续写价值变化"收费——token 让 i 前景变好时收费、变差时补贴,保持其不利转移后的参与激励。

4.2 理论保证

  • 定理 1(Markov DSIC 与 IR):证明的关键是 Bellman 一致性使每个广告商的"吸引度" zᵢ(s)=exp(V̂ᵢ(s)/β) 在 π_ref 下调和,从而后验有闭式表示 ρᵢ(s)=zᵢ(s)/Σⱼzⱼ(s),联合分配概率恰好是凸 log-sum-exp 势函数 Φ_q 对终态报告的梯度——望远镜式支付即对应的势函数支付,凸函数的支撑超平面不等式直接给出诚实报告占优。任意在线偏离都可"子树补丁"嵌入一个全局一致的直接报告(引理 6),故直接 DSIC 蕴含 Markov DSIC。
  • 定理 2(近最优福利):LAMA 诚实话诱导的 (x_β, λ_β) 最大化熵松弛福利,相对最优 KL 正则化福利的损失上界为 β·log|N|,且随 β→0⁺ 收敛到首优福利 max_ℓ max_i rᵢ(ℓ)。直观理解:它实现了两个软彩票——KL 正则化解码对回答的彩票、熵正则化分配对广告商的彩票。
  • 命题 1(结算性质):winner-settled 实现保证逐结果 IR(赢家实得效用非负、非赢家付零)且期望弱预算平衡(平台期望收支非负)。

4.3 学习式实现:平台代报告

诚实报告要求广告商在每个前缀给出全词表续写价值向量——远超个体广告商能力。类比自动出价,平台把报告做成服务:分解为两个更简单的学习任务,再用单一共享模型(Qwen3-14B 骨干 + LoRA)承接,广告商身份与投放信息只通过条件前缀 κᵢ 进入:

  • 局部软优势 Aᵢ(s,a) = Vᵢ([s,a]) − V*ᵢ(s):对同一(广告商,查询)采样成对回答,按 Bradley-Terry 胜率构造二元交叉熵目标训练——学的是"相邻前缀之间的价值变化",只需回答级成对比较信号。
  • 根值锚定 V*ᵢ(q):终态处 V*ᵢ(ℓ_y)=rᵢ(ℓ_y),望远镜展开得根值 = 终态奖励 − 沿途优势累加,对残差做回归即得。
  • 定理 3(精确恢复):在成对比较分布全支撑条件下,局部优势目标的总体最优解唯一,恢复出的 log-ratio 恰等于 Aᵢ(s,a),根值恰等于 Vᵢ(q);由根值加优势递推重构的子代价值向量正是 LAMA 需要的诚实软价值报告。服务时只需对小候选广告商集合做常数倍额外前向(每步为每家广告商各取一次 logits),实测延迟为参考生成的 3.53–3.94 倍,贴近理论值 |N|+1=4。

商业化形态上,论文给出超链接(回答中品牌名链到落地页,实验采用此式)、可点击块、赞助卡片三种格式——最后一种正是 ChatGPT Go、Google AI Overviews、百度 AI 智能问答当前采用的形态。

五、评估指标与实验证据

实验在 Webis Generated Native Ads 2024 数据集的真实商业搜索查询切分上构造三个垂直:Workout(291 查询)、Vacation(456)、Car(492),每垂直 3 家异质广告商(如 Car 垂直的 Kelley Blue Book、Edmunds、CARFAX)。参考模型 Qwen3-14B,报告模型为 LoRA 微调头,印象价值由 ESCI 微调的交叉编码器预测。

指标覆盖三方视角:平台(福利=实现广告价值−KL 正则项;收入=赢家支付)、广告商(赢家获得的印象价值)、用户(GEM-Bench 评价体系聚合的相关性、信息量、流畅连贯、广告自然度、事实性、侵入性)。基线为 6 个启发式激励相容机制(Before/After 两种拍卖 × Reference/Edit/Policy 三种生成)+ MOSAIC。

方法福利↑收入↑质量↑广告商价值↑
Before-Reference0.29450.000052.940.2945
Before-Policy0.45620.000065.160.8225
After-Reference0.35580.287553.900.3558
After-Edit0.17720.249066.480.4046
After-Policy(最强基线)0.50800.750165.590.8253
MOSAIC0.43900.527460.410.5550
LAMA0.52050.830566.520.8568

关键数据:

  1. 四项全优:LAMA 平台福利 0.5205、收入 0.8305、用户质量 66.52、广告商价值 0.8568,均为全场最佳;相对最强基线 After-Policy,收入 +0.0804,且用户质量(66.52 vs 65.59)不降反升。
  2. 回答级聚合不够:MOSAIC 各项全面落后(福利 0.4390、质量 60.41),说明先完整生成再挑选丢失了轨迹内信息。
  3. 价值预测与校准:共享报告模型预测印象值的 MAE 0.058(相对误差 7.7%)、ECE 0.0275,校准曲线贴近对角线——学习式报告的前提成立。
  4. 激励相容的实证检验(bid-offset 扫描):对目标广告商出价加偏移 −0.3 到 +0.3,token 份额、最终分配概率、支付均单调上升,但真实期望效用峰值恰好落在真实出价处,过高出价因支付上升而净效用下降——定性地验证了诚实出价最优。
  5. 互补 vs 竞争广告商的行为差异:KBB+CARFAX(互补对)出价升高时两家品牌可同框出现;KBB+Edmunds(竞争对)则此消彼长、赢家通吃——机制对广告商关系的响应符合直觉。
  6. 延迟可承受:端到端延迟为参考生成的 3.53–3.94 倍,接近理论上界 (|N|+1)=4 倍。

六、效果优势的根源解释

建立"方法差异→机制变化→指标提升"的因果链:

方法差异一:分配嵌入生成轨迹(vs 生成外分配)→ 机制变化:后验 ρ 随每个 token 贝叶斯更新,“哪个广告商值得出现"的判断分布到每一步 token 决策上 → 指标提升:收入 0.8305 vs After-Policy 0.7501(+0.08)。Before/After 类机制在生成之外做分配,丢失轨迹信息:Before 在信息最少时锁定赢家,After 只能事后挑选而无法引导内容走向广告商自然融入的位置。LAMA 的生成与分配共享同一后验,广告机会在涌现时已被捕捉。

方法差异二:min-max 序贯结构 + 势函数支付 → 机制变化:诚实报告在任意可达前缀后仍占优(Markov DSIC),“等待有利前缀再操纵"无利可图 → 指标提升:bid-offset 扫描中效用峰值精确落在真实出价。凸 log-sum-exp 势的梯度恰是分配规则、望远镜支付恰是势函数支付,支撑超平面不等式给出严格占优——这是 Before/After 启发式不具备的保证,也是广告商价值 0.8568 领先的机制基础:诚实报价即最优报价,无需策略性压价。

方法差异三:KL 锚定参考策略 → 机制变化:广告商策略只能以 exp(V/β) 的软方式偏转 π_ref,β 旋钮约束偏离 → 指标提升:用户质量 66.52 匹配最佳基线(广告编辑类 After-Edit 66.48)的同时福利反超其 3 倍。没有 KL 锚定的 Policy 类基线虽能拉高广告商价值(0.8225)却牺牲自然度;After-Edit 保质量但变现能力弱(收入 0.2490)。LAMA 把"变现强度"与"内容自然度"解耦到一个可调参数上。

方法差异四:报告分解(局部优势+根值锚定)→ 机制变化:无需 RL 学全值函数,成对比较 BCE + 残差回归即可,且定理 3 保证总体最优精确恢复真值 → 指标提升:预测 MAE 仅 0.058、ECE 0.0275,服务开销为常数倍前向(延迟 3.5–3.9×)。这使理论机制落到线上可部署的轻量过程。

方法差异五:token 粒度 vs 回答粒度 → 指标提升:MOSAIC 全面落后的根源在于其只能对完整回答打分选择,而 LAMA 让互补广告商分占不同语段、竞争广告商动态决出——广告的"呈现方式"本身成为分配变量,这正是生成原生范式相对回答级聚合的结构优势。

七、必要知识反推

读懂并复现这篇论文需要以下知识储备(按依赖顺序):

  1. 机制设计基础:占优策略激励相容(DSIC)、个体理性(IR)、预算平衡、VCG/GSP 拍卖、势函数支付(potential-based payment)与循环单调性——理解定理 1 证明路线的前提。
  2. 最大熵强化学习 / 软贝尔曼方程:KL 正则化值函数 V*(s)=β·log Σ π_ref·exp(V*/β) 的递归、软最优策略的指数形式、软优势函数定义——LAMA 的全部构件建立在这套语言上。
  3. 贝叶斯滤波:隐变量(潜在广告商)后验的序贯更新,混合分布中按观测归因——分配后验的演化即标准贝叶斯推断。
  4. RLHF 与 KL 对齐:策略对参考策略的 KL 惩罚为何能代理"用户体验代价”,β 的调权直觉。
  5. 偏好学习:Bradley-Terry 模型、成对比较的二元交叉熵、DPO 式的"log-ratio 表示价值差"技巧——局部优势学习的核心。
  6. LoRA 与条件化生成:低秩适配、广告商条件前缀 κᵢ 的构造、共享骨干多头输出(token logits 头 + 标量价值头)。
  7. 计算广告工程:广告漏斗召回、印象价值(CTR×CPC)预测、自动出价的"平台代报告"类比、GEM-Bench 式广告注入回答的多维评估。

八、通用性灵感

  1. “生成即分配"是机制设计的新界面。任何多方利益相关者共享一个生成过程的场景——多供应商的导购回答、多方立场的新闻摘要、多作者的协作写作——都可以借用 LAMA 的模式:把参与方的偏好注入 token 分布,用贝叶斯后验在生成中动态裁决归属,而非事后切割内容。
  2. KL 锚定是"影响力定价"的通用手段。把外部影响约束为对参考策略的软偏转(exp 加权),既保留引导力又 bounded 偏离,比硬性规则或完全放开都更可控。可迁移到内容审核、对齐微调、多目标解码。
  3. 势函数支付+梯度分配的组合拳。“分配规则=某凸势的梯度"这一构造让激励相容证明变成一条凸性不等式,值得在任何序贯机制设计中优先尝试。
  4. 复杂报告可分解为"局部差分+全局锚点”。学完整值函数难,学相邻状态差分易——成对比较信号天然适配差分学习,一个根值锚定绝对尺度。这个分解对任何需要在线输出长程价值估计的系统都有参考价值。
  5. 激励相容可以实证检验。bid-offset 扫描(出价偏移看效用峰值是否在真实值处)是检验任何拍卖机制 DSIC 的低成本实验范式,比纯理论声明更有说服力。
  6. 警惕范式迁移中的利益重构。当内容从"组织既有信息"变为"合成新信息”,围绕旧媒介建立的商业结构(槽位、版位、竞价位)都会被重新定义。这篇论文提示的不仅是广告新形态,也是一个通用方法论:识别旧范式中隐含的抽象(slot),追问它在新技术下是否仍然自然(token 轨迹),再为新抽象重建理论。