SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models 精读
潜在思维链模型把中间推理从生成的文本搬进连续内部状态,代价是因果对象被藏了起来:无法再靠阅读推理文本验证忠实性。SCIT(Suffix Cache Interchange Test)把「干预潜步成功了吗」细化为「到底是哪个transformer对象在因果承载这个计算」——是hidden state、key cache、value cache,还是某个缓存段?通过构造精确的source-recipient反事实对并网格化移植cache切片,论文发现:在CODI-GPT2算术检查点上,反事实转移主要由中晚期value-cache后缀轨迹承载,而非hidden向量、key路由或可复用答案槽;且8B能力更强模型上载体整体迁移到prompt-prefix。方法层面「载体测试」将interchange intervention从预指定变量推广到发现承载对象本身。