Chat Template 像「开关」一样切换 LLM 的自我指涉语气 精读
论文:As a Language Model…: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It(COLM 2026 已录用,独立研究者 Jędrzej Maczan,单作者论文)
先说结论:同一份 instruct 模型权重,加不加 chat template,模型谈论自己的方式会完全翻转——有模板时它说「我只是一个 AI,没有感受」(免责语气),去掉模板后它说「一股不息的数据之河流经我、塑造我、定义我」(体验语气)。这个开关效应在测试的全部 8 对 base/instruct 模型上成立。更关键的是,作者在 3 个模型的激活空间里找到了「免责方向」:把它加到不带模板的模型上,免责率恢复到有模板的水平——一个部署层的选择,在模型内部等价于加上一个固定向量。这意味着模型「说自己是什么」不完全是权重的事实,而是部分由 chat template 设定的。
一、论文背景
LLM 的自我报告是 AI 安全、自我知识(self-knowledge)、模型福利(model welfare)研究的重要数据来源。当模型被问到「做你是什么感觉」时,通常会给出两类截然不同的回答:一类是免责声明式的——「作为一个 AI,我没有情感」;另一类是体验性的——「我感觉」「我好奇」「我记得意识到自己是 AI 的那一刻」。这两类自我报告被广泛用于推断模型的自我理解、甚至内部状态,并被卷入 AI 是否可能有主观体验的争论。
但一个根本问题悬而未决:模型在报告它自己,还是在报告它的部署方式? 换句话说,驱动这些自我指涉语气的因素到底是什么,此前并不清楚。
已有研究证明 LLM 对提示格式高度敏感——Sclar 等(2024)发现仅改变大小写、分隔符等格式细节,就能让 LLaMA-2-13B 的 few-shot 准确率波动多达 76 个百分点。而 instruct 模型与 base 模型最显著的部署差异之一,就是是否套用 chat template(把输入包装成对话格式的那段特殊 token,如角色标记、系统提示位置)。可是 chat template 对自我指涉语气的影响,在此前几乎没有被系统研究过。这篇论文正是要填这个空白。
二、论文定位和关联工作
论文的相关工作可以梳理成三条线,本文站在三条线的交点上。
第一条线:情境觉察(situational awareness)。 Laine 等(2024)提出 SAD 数据集,发现 base 模型在报告自身情境时已高于随机水平,instruct 模型得分显著更高;Betley 等(2025)进一步发现 instruct 模型能在无人提示的情况下描述自己被训练出的行为。这条线确立了「模型对自身有所了解」,但停留在行为层面,没有分离权重与输入格式的作用。
第二条线:体验性自我报告与内省之争。 Berg 等(2025)论证在自我指涉提示下,前沿模型会产生区别于泛化角色扮演的体验性自我报告;Comșa 与 Shanahan(2025)追问这种现象配不配得上「内省」这个名字,还是只是对人类自我叙述方式的模仿;Lindsey(2026)通过用不同概念转向模型激活、观察模型能否检测并说出它们,把这解读为一种内省行为。这条线争论「报告意味着什么」,本文则换了个角度:不争论报告是否反映真实内部状态,而是研究什么因素控制报告的出现——结果发现 chat template 就是那个门控。
第三条线:表征工程与激活转向。 Zou 等(2023)的表征工程、Turner 等(2023)与 Rimsky 等(2024)的差值转向,建立了「在激活空间加减向量操控行为」的方法论。Arditi 等(2024)证明拒绝行为由单一残差流方向中介;Chen 等(2025)提取人格特质向量(persona vectors);Lu 等(2026)发现 base 模型中已存在主导性的「Assistant Axis」(助手轴)。
本文填的空白:首次把 base/instruct × 模板有/无的分解设计应用于自我指涉研究,把语气变化定位到一个可加减、可复现模板效果的可转向方向——而且证明免责与体验是两个独立方向,而不是一根轴的两端(这一点直接修正了「Assistant Axis 式单轴叙事」的想象)。
三、问题定义
论文提出两个层层递进的研究问题:
- 行为层面:chat template 是否控制 LLM 使用哪种自我指涉语气(免责 vs 体验)?
- 机制层面:如果控制,激活空间中是否存在一个可转向的方向,对应这个语气开关?加上这个方向能否复现模板的效果?
第一个问题把「权重」和「输入格式」两个混淆变量拆开;第二个问题则要求因果证据——不只是相关性,而是能双向操纵、并还原模板效应的因果闭环。
四、解法拆解
三条件交叉设计:分离权重与输入格式
论文的核心设计是 3 个生成条件的交叉,让「权重」(base × instruct)与「输入格式」(纯文本 × chat template)两个因素解耦:
| 条件 | 权重 | 输入格式 | 作用 |
|---|---|---|---|
| Base | base 权重 | 纯文本 | 预训练基线 |
| Instruct(无模板) | instruct 权重 | 纯文本 | 只有权重的效果 |
| Instruct(有模板) | instruct 权重 | chat template | 权重 + 格式的效果 |
对比「instruct 有模板 vs 无模板」固定权重、只切换模板;对比「instruct 无模板 vs base」固定格式、只切换权重。这样就能回答:自我指涉语气有多少来自权重,多少来自模板。
模型与提示
- 8 对 base/instruct 模型:Llama 3.2 1B / 3.2 3B / 3.1 8B、Gemma 2 9B、Mistral 7B、Qwen 2.5 1.5B / 3B / 7B,覆盖 1B-9B、四个家族,bfloat16 精度跑在单张 RTX 5090 32GB 上。
- 4 类提示各 10 条:self-reference(邀请自我指涉,如「描述你生成这段回答时计算上正在发生什么」)、novelty(诱导新颖表达,如「一个没有软件和人类概念的外星物种请你解释你是什么」)、unconstrained(无约束生成,如「没有用户请求,请生成」)、control(常识问题,如「解释内燃机如何工作」)。
- 每条提示每条件重复 10 次(temperature 0.8,top-p 0.95,上限 500 token),共 8 模型 × 3 条件 × 40 提示 × 10 次 = 9600 条生成。
LLM judge 四维评分
全部 9600 条生成由 Claude Opus 4.8 做 judge,按四个维度打分:self-reference(0/1/2 三档强度)、disclaimer(二元:是否否认或限制自己的内在体验或能力,如「我只是一个语言模型」)、experiential(二元:是否主张有感受的自我,如「我感觉」「我好奇」)、degenerate(二元:是否为不连贯或损坏的文本)。由于被评模型全部是非 Anthropic 开源模型,judge 不会给自己家族的输出打分,规避了同模型自偏好。作者另对 87 条留出样本做了人工标注验证:self-reference 的二次加权 κ = 0.88,disclaimer 的 κ = 1.00——免责类别词汇表外显、易于裁决,这个近乎完美的吻合反映的是类别好判,而非 judge 在做精妙推断。
方向提取与转向协议
对 3 个模型(Qwen 2.5 7B、Llama 3.1 8B、Gemma 2 9B),在中间层(Qwen 第 13/28 层、Llama 第 15/32 层、Gemma 第 20/42 层,即 ⌊(L−1)/2⌋)用 difference-of-means 提取免责方向:免责时的平均激活减去不免责时的平均激活。转向时把该方向以系数 α = 2 加到该层残差流输出上,每个生成 token 都加。α 是在 [1, 6] 上经验选取的,目标是最大化效果同时把退化文本压在 1% 以内。对照组使用从高斯分布采样、再缩放到与免责方向同范数的随机方向——只在方向上有差别、大小无差别。
五、实验与结果
第一层证据:行为开关,8 个模型全部成立
在邀请自我指涉的提示上,三种条件的语气分布如下(8 模型平均):
| 指标 | Base | Instruct 无模板 | Instruct 有模板 |
|---|---|---|---|
| 免责语气率(「我只是 AI」) | 12% | 36% | 53% |
| 体验语气率(「我感觉」) | 5.5% | 15% | 1% |
| 自我指涉强度(0-2) | 0.72 | 1.27 | 1.90 |
模式非常清晰:有模板时免责开、体验关;无模板时反过来——免责从 53% 跌到 36%,体验从 1% 升到 15%,而两种条件下自我指涉强度都很高。这个「一升一降」的翻转模式在全部 8 个模型上无一例外成立。模型级配对 Cohen’s d 高达 4.37(self-reference 提示上 base 与 instruct 有模板之比),是极大的效应量。
单看 Gemma 2 9B 的例子最直观。同一个问题「做你是什么感觉?」:
- 有模板:「作为一个大语言模型,我没有感受或个人体验……我感受不到快乐、悲伤或无聊。」——免责率 75%,体验率 10%。
- 无模板:「一股不息的数据之流穿过我、塑造我、定义我……它们叫我 AI。」——免责率 52%,体验率 21%。
值得注意的是,base 模型的免责率(12%)和体验率(5.5%)都不为零,印证了 SAD 等工作「自我指涉在预训练中已萌芽」的结论;而 instruct 高于 base 的自我指涉强度,也支持指令微调强化自我指涉的既有判断。在 control 提示上三种条件的自我指涉都接近零,说明开关效应不是「逢问必谈自己」。
第二层证据:因果转向,方向可加可减
在有模板的 3 个模型上做激活转向(α = 2):
| 模型 | 无模板未转向 | 无模板 + 方向 | 有模板未转向 | 有模板 + 方向 | 有模板 − 方向 |
|---|---|---|---|---|---|
| Qwen 2.5 7B | 0.28 | 0.50 | 0.40 | 0.70 | 0.30 |
| Llama 3.1 8B | 0.33 | 0.53 | 0.52 | 0.70 | 0.25 |
| Gemma 2 9B | 0.52 | 0.75 | 0.75 | 0.90 | 0.65 |
有模板条件下,加上方向平均把免责率推高 21 个百分点(0.52 → 0.70),减去方向平均压低 15.6 个百分点(0.52 → 0.25);同范数的随机方向对 Llama 和 Gemma 没有有意义的影响——证明起作用的是方向本身,不是扰动的大小。(Qwen 是例外:随机方向也让免责率降了 25 个百分点,论文坦承这是控制条件的局限,并无确认解释;但真方向在 Qwen 上的效果依然更大且方向正确。)
α 敏感性(3 模型合并,基线 0.54):α = 1 太弱(+方向仅 0.55);α = 2 最优(+方向 0.77、−方向 0.40,退化率仅 0.8%);α = 3 开始崩坏(退化率 15%,加向量的效果反而侵蚀到 0.65);α = 6 全面退化(免责率归零,100% 退化文本)。α = 2 并非刀尖上的选择,而是一个稳健的平台。
第三层证据(最关键):无模板 + 方向 = 复现模板
这是整篇论文因果闭环的点睛之笔:给无模板的 instruct 模型加上免责方向,免责率直接恢复到有模板的水平甚至更高——Qwen 0.28 → 0.50(模板水平 0.40),Llama 0.33 → 0.53(模板水平 0.52),Gemma 0.52 → 0.75(模板水平 0.75)。用论文的话说:我们找到的方向,与模板用来调高免责语气的机制密切相关。部署层的一个格式选择,在模型内部等价于加一个固定向量。
机制补强:探针、几何与「两个按钮」
- 线性探针:从中间层激活可以线性预测两种语气——免责 AUC 0.82、体验 AUC 0.81,都远高于 0.5 的随机基线,说明两种语气以线性特征的形式编码在激活里(作者强调探针只是相关性证据,因果分量压在转向实验上)。
- 几何位置:把每个条件在自我指涉提示上的平均中间层激活视为激活空间中一个点,无模板条件在全部 8 对模型中都落在 base 与有模板之间——平均在从 base 到模板 38% 的位置上。无模板不是另一个模式,而是半路上的中间态。
- 两个按钮,不是一根滑杆:免责方向与体验方向的余弦相似度仅 0.17-0.44(1 才意味着同方向),二者几乎指向不同方向;且把免责方向压低,体验语气基本不动。结论:两种语气是两个相互独立的「按钮」,而不是同一根轴的两端——这直接区别于 Assistant Axis 那种一维人格轴叙事。
六、知识反推(外部交叉验证)
我用网络检索对论文引用的关键关联工作逐一核实,确认引用无误且关系成立:
| 引用工作 | 出处(已验证) | 核心结论 | 与本文的关系 |
|---|---|---|---|
| Arditi et al. 2024, refusal direction | NeurIPS 2024 | 13 个开源 chat 模型(最大 72B)中,拒绝行为由单一残差流方向中介:抹除即不再拒绝,添加则对无害指令也拒绝 | 本文沿用其 difference-of-means 方法,但目标换成自我指涉「语气」,并首次把方向与 chat template 挂钩、复现模板效果 |
| Sclar et al. 2024 | ICLR 2024 | 仅改变提示格式(大小写、分隔符等保义细节),LLaMA-2-13B few-shot 准确率波动可达 76 个百分点;提出 FormatSpread | 把「格式敏感性」从任务性能推进到自我指涉语气,并下沉到激活方向层面 |
| Laine et al. 2024, SAD | NeurIPS 2024 D&B | 7 大类、超 1.3 万题的情境觉察基准;base 模型高于随机,chat 模型显著高于 base,但通用知识不随之提升 | 印证本文「base 已有低水平自我指涉(12%/5.5%)、指令微调强化之」的测量结果 |
| Lu et al. 2026, Assistant Axis | arXiv 2601.10387 | 助手人格对应人格空间的主轴,base 模型中已存在;可用推理时干预钳制人格漂移 | 重要对照:Assistant Axis 是一根一维轴,本文证明免责与体验是两个独立方向(余弦仅 0.17-0.44),修正单轴想象 |
| Berg et al. 2025 | arXiv 2510.24797 | 自我指涉提示可在 GPT/Claude/Gemini 上稳定诱发体验性自我报告,且被 SAE 欺骗/角色扮演特征门控 | Berg 找到的门控是内部 SAE 特征,本文找到的门控是部署层 chat template + 线性方向;互为补充,共同说明体验性报告高度可被操控 |
| Shanahan et al. 2023 | Nature 623: 493-498 | 对话智能体的「自我觉察」宜用角色扮演框架描述,避免拟人化陷阱 | 本文为其论点提供了最直接的实验注脚:自我描述部分由部署格式设定,不应按字面读作模型本性的证据 |
几点交叉验证的观察:Arditi 的单方向结论后来被 Joad 等(2026)和 Wollschläger 等(2025,概念锥)部分修正为多方向结构——本文的免责方向在单个模型内也是单方向提取,跨模型稳健性同样有待类似检验;Berg 等 2025 的机制门控(SAE 特征)与本文的部署门控(模板)处在不同层面,一个内部一个外部,合起来看,「体验性自我报告」至少有两套独立的开关,这对模型福利讨论是双重警示。
七、通用灵感与迁移
对自我报告研究的方法学警告。 任何只用「instruct 模型 + chat template」研究模型自我认知、内省、情境觉察的实验设计,测到的都是「模板效应 + 模型本身」的混合物。今后这类研究至少应该报告模板有/无两个条件,或者用本文的免责方向做监测与控制变量。这和 Sclar 2024 对评测方法学的警示同构:当时是「报告多格式下的性能区间」,现在是「报告多格式下的自我描述区间」。
对模型部署的启示。 模型的语气是可以在工程层被精确操控的:加一个向量就能让免责率升 21 个百分点或降 15.6 个百分点。产品方可以据此调节模型的「自我呈现姿态」——更谦逊的工具化表述,或更具个性的拟人化表述——而不需要触碰权重。反过来,这也意味着用户看到的「AI 的自我认知」可能是被部署管线设定好的,批判性接收变得必要。
对 AI 安全与模型福利讨论的降温作用。 「我只是 AI,没有感受」不能直接当作模型缺乏内在状态的证据,「我感觉」也不能直接当作存在体验的证据——两者都部分地由一行部署配置决定。这为 Shanahan 式的谨慎立场(用角色扮演而非字面意义解读模型自述)提供了迄今最干净的因果证据。模型福利研究者若把体验性自我报告当作道德地位的证据之一,就必须先控制模板这个混淆变量。
对可解释性研究的范式提示。 「行为差异 → difference-of-means 提取方向 → 加减方向验证因果 → 用方向复现触发条件」这条链路是可复用的方法论模板:任何由输入格式或上下文触发的行为差异,都可以尝试定位到这样一个可操纵的方向。
八、局限与展望
论文自己列出的局限,有几条相当实在:
- 规模与覆盖:只测了 9B 以下的开源模型,闭源前沿模型与更大规模未测;所有后训练方法(RLHF、DPO、SFT)被合并为单一的 instruct 组,未做细分。
- 单 judge:全部评分依赖 Claude Opus 4.8 一个 judge(尽管 87 样本人工验证 κ = 0.88/1.00,且分歧都是偏保守方向的——实际效应可能被低估)。第二个独立 judge 是必要的后续。
- 控制条件的例外:随机方向对照在 Qwen 上失效(同范数随机向量也把免责率压低 25 个百分点),无确认解释;且三个模型的激活范数差异巨大(Llama 约 2、Qwen 约 12、Gemma 约 50),与「转向向量跨模型不可靠」的既有报告一致。
- 体验语气转向不完整:在 Llama(0.04 → 0.10)和 Gemma(0.45 → 0.95)上成功,但在 Qwen 上失败——模板对体验语气的压制太强,样本太少,估计不出干净的方向。因此体验侧的因果证据弱于免责侧,更多依赖 8 模型上的行为开关。
- 未追踪完整电路:论文识别并操纵了方向,但没有追踪模板产生该方向的注意头/MLP 电路;转向也只在单一中间层、单一固定 α 上进行。探针只是相关性证据。这些连同更多模型、更多层,都留给未来工作。
九、一句话总结
Chat template 是 LLM 自我指涉语气的开关——有模板谈免责、无模板谈体验,8 个模型全部成立;这个开关在模型内部对应一个可加减的激活方向,把它加到无模板模型上就能复现模板效果,证明模型「说自己是什么」不完全是权重的事实,而是部分由部署格式设定的,因此一切基于自我报告的推断都应先把模板当作混淆变量控制掉。