SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 精读

提示注入被 OWASP 列为 AI 智能体的头号威胁,而现有“安全 LLM“在自适应攻击下攻击成功率接近 100%。UC Berkeley 团队提出 SecOPD,把在线策略蒸馏(OPD)改造为注入防御训练信号:学生在被攻击输入上滚动生成,冻结的初始模型在对应干净输入上给同一 token 打分,实现 token 级信用分配。在 SEP + PISmith 自适应攻击下,防御后的 Qwen3.6-27B 攻击成功率仅 9.0%,比此前最强防御 Meta-SecAlign 的 94.0% 低一个数量级;同时七项效用基准平均 88.1%,与未防御模型持平。本精读覆盖问题定义、方法机制、实验证据、效果根源解释与可迁移灵感。

August 27, 2026 · 3 min

Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon 精读

剑桥大学与清华大学合作,用 out-of-sample 谱探测回答优化器领域的核心开放问题:Muon 为何快于 Adam?沿真实训练轨迹把动量缓冲做 SVD,在留出批次上估计每个奇异方向的最优步长,发现稳定且各向异性的谱剖面——单一「易变头」处于稳定性边缘(允许步长最小、恰等于 Muon 实际步长),「宽容主体」允许数倍步长。据此提出 SAMuon:头钉住、主体放大,比调优 Muon 少 13.3-24.0% token 达到同等验证损失。SGD→Adam→Muon→SAMuon 在统一谱分配视角下排成一条线。

August 27, 2026 · 3 min

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training 精读

字节跳动 Seed、南京大学与 Evolvent AI 合作提出「论文展开」管线:保持论文原文逐字不动,用教师模型反向重建写作请求、全局规划与逐节写作前的思考,把整篇论文展开为多轮生成轨迹用于持续预训练。1.8M 篇 arXiv 论文的 30B token 原文被展开为 57–60B token 轨迹,中位文档长度从 11.2K 提升到 28–29K token。同一反向构造还产出 200K 样本 SFT 数据集与 2,940 题的 PAW-Bench 学术写作基准。受控实验(同预算纯论文文本对照)证明增益来自「构造」而非论文内容:写作四项平均 54.34 对纯文本 52.12/无 CPT 51.90,推理不降反稳,长文档理解提升;且 4B 小生成器的语料最难拟合(loss 1.453)却下游最好——生成器越弱、数据越难拟合,收益越大。

August 27, 2026 · 4 min

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 精读

南洋理工大学 S-Lab 联合 A*STAR、UIUC 提出 Visual Rubrics-Based RL:把视觉忠实性从「事后评测指标」转变为「细粒度 RL 训练信号」。方法将参考答案分解为视觉忠实性/推理一致性/指令遵循三维原子评分条目,构建 5 万例训练集,并用组件化+前缀局部化的优势分配改造 GRPO。在同 SFT 起点、同 RL 数据、同预算的受控对比下,比 answer-only GRPO 再提 1.79 分,增益集中于依赖接地中间推理的基准。

August 27, 2026 · 3 min

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (ERPO) 精读

ERPO(阿里 AMAP × 西安交大 × 京东 × 北师大 × NUS 五机构产学研)重新定位了 LLM 强化学习训练崩溃的根源:不是策略(动作)分布漂移,而是策略诱导的查询分布漂移改变了有效训练环境。它把 KL 正则化从动作侧移到输入侧,Query-KL 的梯度严格不流经响应分布,从而在不牺牲探索的前提下根治高温解码崩溃——32B 模型在 T=1.5 下 GRPO 只剩 25.2%,ERPO 保持 80.8%。

August 25, 2026 · 2 min

The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search (Ascp) 精读

Ascp(北京大学 × 腾讯)为生成式搜索建立了’上下文分配定律’:同预算下窄窗多轮(k=2 检索×T=12 轮生成)比宽窗单轮(k=24×T=1)的 portfolio recall 高 0.144,T:1→12 带来 16.8-20.5pp 提升,且验证到 32B 规模。其测量工具是因果留一(LOO)探针——teacher-forced 反事实消融直接测量每篇文档对生成文本的因果利用率,在 same-query 硬负例下 AUC 0.876,而 embedding 相似度坍缩到 0.484(随机水平)。相关性代理测的是’话题相关’,不是’真被用了’。

August 25, 2026 · 2 min

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking 精读

本文精读西湖大学、浙江大学与快手可灵团队合著的 arXiv 2608.20011。论文形式化了流匹配生成模型偏好优化中的流形漂移现象:偏好更新会把轨迹终端样本推离预训练数据流形,产生非零法向位移,这是 reward hacking 的结构性根因。理论上,最优流匹配能精确恢复数据分布,而偏好更新一旦含非零法向分量必然离流形。方法上提出 THERMODPO,用带温度的三态能量 softmax 在胜者侧加流形锚,统一了 RFT 与 FlowDPO,并对流形距离给出逐点上界。实验显示玩具基准 StrictScore 达 0.899,SD3.5-M 四指标宏平均提升 16.0%、OCR 提升 47.5%,FLUX.2 上复现同趋势。

August 24, 2026 · 4 min

MidTool: 面向Agent工具使用的中期训练数据合成 精读

工具使用是 LLM Agent 的核心能力,但此前几乎全靠后训练习得。MidTool(华盛顿大学 + Snowflake + UNC,工作完成于 Snowflake 实习)提出首个面向通用工具使用的开放中期训练语料管线:从网页、PDF、代码、真实 API 与 MCP 技能四类源出发,经「上下文接地增广」与「原生 Agent 轨迹合成」两条分支构建 20.3B token 的 MidTool-Mix,中期训练 Qwen3-4B/8B-Base 后再统一 SFT+RL。在 BFCL、τ²-Bench、MCP Universe 三基准上,两种后训练配方下均一致超过 SFT-only 基线,RL 通常进一步放大增益,MCP-Universe 上 4B/8B 全面超过 Qwen3 官方同尺寸模型。本精读覆盖背景、定位、问题抽象、管线解法、实验证据、机制因果链、必要知识反推与可迁移灵感。

August 23, 2026 · 6 min

MileGPO: 里程碑推断的长程Agent过程级信用分配 精读

北交大团队提出 MileGPO,针对长程 LLM Agent 训练中最棘手的过程级信用分配问题:GraphGPO 等图方法按最短路径距离赋信用,只能刻画「可达性」而非「可靠进展」。MileGPO 从同一 rollout 图中挖出三类被忽视的信号——成功轨迹的候选里程碑、失败轨迹的反复陷阱、同状态兄弟分支对比——经可靠性加权塑形 RCS 与进度对比校准 PCC 两级校准后注入优势估计。ALFWorld 整体成功率 94.60,超 GraphGPO 3.13 点、超 GiGPO 4.43 点;ID–OOD 差距仅 1.69 点;WebShop 同状态平局率达 72.7%,图上 83.0% 的平局可被 RCS 纠正。全程零辅助模型、零额外环境交互,本精读重点拆解「共享状态覆盖率相同、歧义结构决定增益」的机制因果链。

August 23, 2026 · 5 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

深度精读 USTC+上海AI Lab+复旦合作的 FACET 论文——面向终端 agent 训练的任务合成框架。论文指出多阶段任务合成的两大失败根源:源信息逐步丢失与任务制品间漂移,提出三阶段方案:71K 技能库构建、五维情景重构、以及以’共享可执行状态’为核心的环境先行接地,按 I→S→V 顺序让指令/解法/验证器共享同一真实容器状态。基于 6078 个任务(每任务 22.77 项可执行检查)、仅 1.2K SFT 轨迹,即让 Qwen3.5-27B 在 Terminal-Bench 2.1 上提升 6.75 分,距 397B 巨兽仅差 1.49 分而参数少约 15 倍。

August 22, 2026 · 4 min