Split-LLM 隐私失效审计:返回梯度的零模式完美暴露真实数据 精读
独立研究者对两节点 split-LLM 训练的预注册审计:隐私损失忽略诱饵行→其返回梯度恰好为零→零模式逐帧完美暴露真实数据(9 种子 4096/4096 全中)。所有运行通过前向隐私检查与质量检查,加上返回梯度后同检查失败。逐行裁剪+加噪以 0.01 nats 代价封堵,并诚实声明五类未测攻击面。
独立研究者对两节点 split-LLM 训练的预注册审计:隐私损失忽略诱饵行→其返回梯度恰好为零→零模式逐帧完美暴露真实数据(9 种子 4096/4096 全中)。所有运行通过前向隐私检查与质量检查,加上返回梯度后同检查失败。逐行裁剪+加噪以 0.01 nats 代价封堵,并诚实声明五类未测攻击面。
RLVR 提升 pass@1 却坍缩解空间已是共识,但坍缩发生在哪一步始终未知。上海大学×伯明翰大学在 Countdown 任务上穷举解空间、按首操作数+算子划分入口族,把求解分解为 access×execution:PPO 覆盖 0.337→0.111,首算术操作前的似然偏移是下游的 11–16 倍,塞一个入口前缀就能让低覆盖族完成率 0.018→0.212——能力还在,只是不再进门。后层参数插值恢复 37% 覆盖且 pass@1 零损失。