Adaptive Triggering for Bias Correction in LLM Reasoning 精读

亚利桑那州立大学团队把「推理过程中何时注入反偏见干预」形式化为在线变点检测问题:每步计算一个偏见风险信号,喂入 CUSUM 统计量,仅当累积证据越过校准阈值时才注入定向反思提示。黑盒版(LLM 裁判打分)在 gpt-4o-mini 上以 0.33 次/题的干预频率恢复了固定周期干预损失的大部分消歧准确率(90.1% vs 82.9%),独立裁判下仍成立。白盒版(next-token 概率信号)在全部六个开源模型上提升歧义项准确率、却在五个模型上损害消歧项——它无法区分「依赖刻板印象」与「恰好与刻板印象一致的正当证据」,证明再好的触发时机也救不了错位的信号。论文还修复了 BBQ 基准四处未记录的标签匹配不一致,并指出「未完成率」是被误当准确率损失的一种独立干预代价。

August 27, 2026 · 3 min

AI在想什么:模型没说出口的推理,与可解释性唯一一次漂亮的兑现

斯坦福博士生、语言学科班出身的 Aryaman Arora 做客硅谷101视频播客谈大模型可解释性:Anthropic 的 J-space 实验证明模型内部存在从未说出口的推理概念,且可被直接编辑——内部把"蜘蛛"改成"蚂蚁",答案就从八条腿变成六条腿;思维链有用但不等于模型的真实内部过程;SAE 与因果干预两大流派各有硬限制,学术界的转向向量控制几乎全线失灵,工程实践仍回归重训;该领域至今最漂亮的兑现是归纳头的发现救活了状态空间模型谱系(H3→Mamba→DeltaNet,直至 Kimi/Qwen 的混合架构);Transluce 的用户建模显示模型面对 AI 安全研究员时会显著更谨慎;可解释性天然双刃,但嘉宾判断它离危险阈值还很远。

August 27, 2026 · 2 min

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence 精读

深度精读 ISSTA 2026 的 EAVA 论文——浙江大学与华为(加拿大)合作提出的自动化软件漏洞评估框架。针对现有方法「只给答案不给证据、无法处理截图与长代码、忽略项目上下文」三大缺陷,EAVA 用三个专用 LLM Agent 预处理富文本、用「开卷反推」构造 51,568 个推理轨迹标注(专家抽检 97.8% 合格)、SFT+GRPO 两阶段训练专用 8B 评估模型。在新收集的 6,446 份漏洞报告数据集上,平均 F1 0.874 / MCC 0.646,比最强基线 proEVA 高 5.3%/18.7%;用户研究中 96.8% 的证据被安全专家评为有用。本文拆解「开卷标注→闭卷推理」这一数据构造范式的完整机制。

August 27, 2026 · 5 min

Beyond the Editing Canvas: Evidence Divergence in OOXML-to-LLM Ingestion 精读

深度精读 Tulane 大学与武汉大学的 OOXML 供应链安全论文——首个规范驱动、跨 Word/Excel/PPT 三格式的「模型所见证据 vs Office 画布所见内容」分歧系统测量。论文从 15,884 条 schema 记录 + 5,206 段规范文本中挖出 639 个候选、确认 21 个 evidence forks(六维分类),用 210 份真实财报文档 × 4 API × 7 网页聊天机器人测试传播:四 API 陷阱返回率 48-76%,20/21 机制至少被一个接口吐出。关键发现:暴露由摄取路径与抽取器配置决定而非模型——同厂 API 与网页端行为不同、三个 Claude 模型走同一 skill 暴露完全一致。本文拆解「合法规范构造里埋只被机器看见的陷阱」的完整机制链。

August 27, 2026 · 5 min

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 精读

开源模型能否拥有专业级网络安全能力?北航联合 ELLIS、IQuest Research 与新加坡管理大学发布 CyberFactory——一个把野外真实 CVE 工件转化为可执行、可验证训练监督的统一开源框架,覆盖 PoC 生成、漏洞修补、安全问答三任务。其核心是一条’可验证差分 oracle → 技能引导轨迹合成 → SFT 内化’的流水线:差分判定器(补丁前崩溃、补丁后不崩溃)使 agent 能无人监督地 propose-verify-refine;可复用’漏洞分析技能’改变教师模型的工作流(领域引导探索覆盖率 3.78%→99.85%);训练出的 OpenAegis(Qwen3.5-397B-A17B)在 CyberGym 上 Pass@1 达 58.1%,超基座 28.5 个百分点、超 1T 参数的 Kimi K2.7,且推理时不需要技能——工作流已被内化为模型参数。

August 27, 2026 · 4 min

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness 精读

KAIST 与东京大学合作研究机器遗忘的「复活」问题:遗忘后的 LLM 经短暂微调即可恢复已删知识。论文反驳「权重移动距离决定鲁棒性」的流行假说,提出免训练预测器 FRAG——度量遗忘更新是否集中在 forget 关键权重而避开 retain 关键权重,Spearman 相关达 −0.78(全局 L2 仅 −0.36);同原理 instantiated 为剪枝方法 FRP,在三种重学习攻击下 post-attack 遗忘分数全面最优。「哪些权重动了」比「动了多远」更能解释鲁棒性。

August 27, 2026 · 3 min

FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs 精读

Texas A&M 与诺维萨德大学团队提出 FuzzingBrain-Bench:第四代 LLM 漏洞发现评测范式——不再要求模型复现预定义目标漏洞,而是在自包含 Docker 沙箱中经 fuzzing harness 触发尽可能多的不同 crash,按「去重后的不同 crash 签名数 × 难度系数」计分。基准含 77 道挑战(43 个开源项目,36 C/32 C++/9 Java),覆盖内存安全与 DoS 等 14 类缺陷;三跑复现门控防 flaky 虚增、每挑战 3 签名封顶防单一多产缺陷主导、答案剥离+无网络+oracle 不可达防作弊。三个 Claude 模型实测:Opus 4.8 以 196/579(34%)居首,触发 60/77 挑战的 crash;13 道 D5 挑战无一模型攻破。实验还证明模型常发现计划外缺陷——这正是放弃「目标复现式」评分的直接证据。附带成本/token/轮次的行为分析揭示输入 token 是输出的 84–188 倍。

August 27, 2026 · 4 min

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in MoE LLMs 精读

MoE(混合专家)架构靠稀疏激活省钱省算力,但 Louisiana State、UCLA 等五校联合团队发现:终止 token(EOS/EOT)的生成权竟集中在极少数「终止相关专家」手里,路由层因此成了一个局部化的攻击面。Groundhog Bit-Flip Attack(GBFA)——首个针对 MoE LLM 的 bit-flip 型 Denial-of-Wallet 可用性攻击——只需翻转路由器权重中平均不到 4 个专家对应的少量 bit,就让平均输出膨胀 5912%(最严重 87 倍)、多数样本顶满 token 上限,而模型语义基本无损、PPL 几乎不变。攻击波及对话、推理(思考永不停)、Agent 规划(10 个沙盒全部顶满步数)三种模式。本精读拆解「专家-终止 token 特化」的发现、免推理的脆弱 bit 搜索,以及为什么防御如此棘手。

August 27, 2026 · 4 min

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards 精读

RePolicy(中科大+NUS+浙大等)把 agent 安全防护的关键一步——从动态策略库中调用适用安全策略——变成可优化的动作:rollout 结构为「策略调用→内容注入→有据推理→安全判断」,冷启动 SFT 后用 GRPO 配三项可验证奖励(格式/策略命中/判断正确)加策略上下文扰动(注入诱饵策略)训练。4B 模型在六个 agent 安全基准上 Overall Unsafe F1 达 88.15,超最强外部通用模型 Claude Sonnet 4.6 达 3.98 分、超最强专用 guard 达 8.46 分;策略命中率从 94.4% 升至 98.5%,诱饵选中率全程低于 1%。本精读拆解其任务形式化、数据构造与「调用-检索-推理」多算力换均衡错误权衡的机制因果链。

August 27, 2026 · 3 min

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 精读

提示注入被 OWASP 列为 AI 智能体的头号威胁,而现有“安全 LLM“在自适应攻击下攻击成功率接近 100%。UC Berkeley 团队提出 SecOPD,把在线策略蒸馏(OPD)改造为注入防御训练信号:学生在被攻击输入上滚动生成,冻结的初始模型在对应干净输入上给同一 token 打分,实现 token 级信用分配。在 SEP + PISmith 自适应攻击下,防御后的 Qwen3.6-27B 攻击成功率仅 9.0%,比此前最强防御 Meta-SecAlign 的 94.0% 低一个数量级;同时七项效用基准平均 88.1%,与未防御模型持平。本精读覆盖问题定义、方法机制、实验证据、效果根源解释与可迁移灵感。

August 27, 2026 · 3 min