Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit 精读

机制可解释性的电路发现方法常返回几百条边,大到无法穷举验证、无法逐边理解。这篇论文提出Circuit Condensation:与其在冻结权重里更努力地搜索行为住在哪里,不如通过后训练把行为搬进更小的因果电路。方法是一个迭代「剪枝-愈合-回退」循环——EAP-IG给边排名、剪掉最弱30%、只训练LoRA适配器以KL蒸馏匹配原模型,任务精度与通用能力都存活才接受。在4种行为×8个模型×3种子共96组实验中,C1电路在30/32组合里比最强冻结基线更小,平均缩小8.1倍、最高316倍。关键对照C0证明收益来自权重重塑而非搜索本身。范式层面的洞见:电路的可发现性是模型可训练的属性。

August 28, 2026 · 1 min

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment 精读

深度精读清华大学联合 MatrixOrigin、南洋理工等的对齐监控论文。针对 agent 在目标冲突下的失当行为(敲诈、泄密、阻挠救援),作者提出 INTENT-AS-A-TOOL:给模型动作空间加一个零参数的意图工具,用其首 token 调用概率作为免 judge、可逐前缀评估的细粒度意图信号。CoT 监控发现可观测有害意图几乎必然走向执行,意图分数与 CoT 标签的 AUROC 达 0.948–0.976;意图引导的在线干预在 Qwen3-32B 上防御成功率 96.5–100%,显著优于静态安全提示。

August 28, 2026 · 2 min

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation 精读

深度精读布里斯托大学的 NeuronFuzz 论文——用模型内部「安全神经元」的激活作为模糊测试的连续反馈信号,替代昂贵的响应级评估。传统 LLM 安全测试每个候选提示都要生成完整回复来判断成败,在强对齐模型上几乎所有候选都被拒绝、拿到同样的失败标签,搜索失去方向。NeuronFuzz 构建轻量 SafetyOracle:用模板不变的有害/良性配对提取 MLP 激活,bootstrap 稳定性选择筛出紧凑安全神经元集,Elastic-Net 逻辑回归映射为连续安全警报分数(prefill 阶段可得、可微)。5 个白盒源模型越狱发现率 76-100%,超基线最多 48 个百分点;每案例只需 1 次响应生成(LLM-Fuzzer 需 179-304 次);模板零样本迁移到 8 个推理模型平均 EASR 92.6%,还迁移到视觉模型(NSFW 任务 ASR 从 3.6% 提至 74.8%)。

August 28, 2026 · 3 min

Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance 精读

深度精读 ENS Paris-Saclay 与 Goodfire AI 的评估方法学论文。模型在思维链里意识到「我正在被测试」时,其言语化 eval-awareness 可分解为两种框架:能力框架(在测我能不能遵守指令)与安全框架(在测我会不会越界),二者对合规行为的预测方向相反——能力框架下的合规率比安全框架高 24–46 个百分点。CoT 预填因果干预证实了因果性(11 个预填中 10 个方向符合预测)。这直接挑战当前安全评估管线「聚合抑制 eval-awareness」的实践。

August 28, 2026 · 2 min

Planting a Latent Variable in Natural-Looking Text: A More Realistic Test of Belief States in LLMs 精读

Transformer是否真的在学习贝叶斯后验「信念状态」?此前这只在玩具HMM token序列上被证明过。这篇来自Columbia的单作者论文设计了一个聪明的实验范式:让Gemma-2-2B教师模型写普通文本时,沿8个正交SAE方向做「阈下转向」,把一个由环形Markov链控制的潜变量植入自然语言;再让110M学生transformer从零训练在这批语料上。结果学生模型残差流中线性探针能恢复最优贝叶斯观测者后验(R²=0.49),且8个状态在表示空间中自发排成Markov链原序的环——首次把信念状态几何与概念流形形成机制实证关联起来。方法论亮点是「用转向植入受控潜变量」,让自然语言既保留自然性又拥有完整ground truth。

August 28, 2026 · 1 min

SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models 精读

潜在思维链模型把中间推理从生成的文本搬进连续内部状态,代价是因果对象被藏了起来:无法再靠阅读推理文本验证忠实性。SCIT(Suffix Cache Interchange Test)把「干预潜步成功了吗」细化为「到底是哪个transformer对象在因果承载这个计算」——是hidden state、key cache、value cache,还是某个缓存段?通过构造精确的source-recipient反事实对并网格化移植cache切片,论文发现:在CODI-GPT2算术检查点上,反事实转移主要由中晚期value-cache后缀轨迹承载,而非hidden向量、key路由或可复用答案槽;且8B能力更强模型上载体整体迁移到prompt-prefix。方法层面「载体测试」将interchange intervention从预指定变量推广到发现承载对象本身。

August 28, 2026 · 1 min

Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems 精读

多智能体 LLM 系统跑失败了,到底该怪哪个 Agent、哪一步?AWS Agentic AI 与特拉维夫大学提出的自适应影响图(AIG)给出的答案是:这不是模型不够聪明的问题,而是接口设计的问题。论文把人类工程师调试系统的’可观测性’范式搬给 LLM——先用 agentic builder 把失败的原始日志构造成带继承边的影响图,再用 agentic reader 沿边回溯定位首个错误。在 Who&When 基准上,同一模型仅靠改善轨迹表示就从 46.40% 提升到 55.20% 的步骤定位准确率,刷新 SOTA。本精读将拆解其四级接口阶梯、两阶段框架与增益根源。

August 27, 2026 · 4 min

Adaptive Triggering for Bias Correction in LLM Reasoning 精读

亚利桑那州立大学团队把「推理过程中何时注入反偏见干预」形式化为在线变点检测问题:每步计算一个偏见风险信号,喂入 CUSUM 统计量,仅当累积证据越过校准阈值时才注入定向反思提示。黑盒版(LLM 裁判打分)在 gpt-4o-mini 上以 0.33 次/题的干预频率恢复了固定周期干预损失的大部分消歧准确率(90.1% vs 82.9%),独立裁判下仍成立。白盒版(next-token 概率信号)在全部六个开源模型上提升歧义项准确率、却在五个模型上损害消歧项——它无法区分「依赖刻板印象」与「恰好与刻板印象一致的正当证据」,证明再好的触发时机也救不了错位的信号。论文还修复了 BBQ 基准四处未记录的标签匹配不一致,并指出「未完成率」是被误当准确率损失的一种独立干预代价。

August 27, 2026 · 3 min

AI在想什么:模型没说出口的推理,与可解释性唯一一次漂亮的兑现

斯坦福博士生、语言学科班出身的 Aryaman Arora 做客硅谷101视频播客谈大模型可解释性:Anthropic 的 J-space 实验证明模型内部存在从未说出口的推理概念,且可被直接编辑——内部把"蜘蛛"改成"蚂蚁",答案就从八条腿变成六条腿;思维链有用但不等于模型的真实内部过程;SAE 与因果干预两大流派各有硬限制,学术界的转向向量控制几乎全线失灵,工程实践仍回归重训;该领域至今最漂亮的兑现是归纳头的发现救活了状态空间模型谱系(H3→Mamba→DeltaNet,直至 Kimi/Qwen 的混合架构);Transluce 的用户建模显示模型面对 AI 安全研究员时会显著更谨慎;可解释性天然双刃,但嘉宾判断它离危险阈值还很远。

August 27, 2026 · 2 min

Automata from Agent Traces: Failure and Next-Step Prediction 精读

深度精读 Holistic AI、PUC-Rio 与 UCL 合作的 Agent 轨迹自动机研究(ICML 2026 AIWILD workshop)——把整条语料库的 LLM Agent 执行轨迹坍缩成一台 7-43 个状态的紧凑有限状态机(FSM),无超参数、毫秒级构建。这台 FSM 同时充当四件任务的统一结构基底:工作流记忆(8/8 数据集胜过 Agent Workflow Memory)、下一步预测(交叉熵降 21%)、失败预测(held-out AUROC 最高 0.94)、运行时监控(32% 完成度即触发早停)。本文拆解其’前缀树+最后活动右同余合并’构造、紧凑性为何是全部下游收益的根源,以及’拓扑由 harness 而非模型决定’的核心发现。

August 27, 2026 · 4 min