Safety for Whom:把安全边界从话题级细化到边界级的数据配方 精读

Multiverse Computing 揭示话题级安全对齐的粒度错配:部署需要窄边界(拒操纵、答选举事实)而非话题级一刀切。提出窄边界形式化+离线自生成数据框架(受控话题生成/覆盖修复/补偿数据/边界对),Qwen3-8B 目标域拒绝 9.47%→84.75%、不安全率 26.26%→0.14%,并量化数据成分对安全-可用权衡的决定作用(过度拒绝 74%→5.2%)。

September 9, 2026 · 2 min

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents 精读

深度精读浙江大学 VaG(Verifier-as-Gatekeeper)论文——首个正面刻画「自进化 Agent 中能力-污染相变」现象的工作。论文首次形式化了「技能池超过临界规模后新增技能反而降低性能」的非单调相变,并从数学上证明污染链具有结构不可逆性:有缺陷技能进入决策上下文后,其后代继承缺陷推理却从不引用原始缺陷源,导致事后回滚恢复率仅17%。VaG 采用「渐进信任层次 + 异构验证器检查不相交属性」的三级前commit门控(SchemaCritic 结构检查 / ExecCritic held-out重放 / AgentCritic 语义审查),配合边际增益贪心子集选择移除组合污染,在 Terminal-Bench 2 上以仅37个技能达到72% pass@1(Ungated崩溃至50%),技能池缩小近5倍,并在跨模型、跨基准迁移上全面领先。本文从背景、关联工作、问题抽象、三级门控解法、实验证据到不可逆性根源解释,完整拆解这一「前commit优于事后修复」的开创性研究,并提炼出可推广的系统安全设计灵感。

August 8, 2026 · 8 min