Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

深度精读 Phantom Gains——一篇审计 LLM 自训练’自我改进’证据的测量学论文。当社区从平均准确率转向逐题增益/损失转移分析时,转移统计本质上是两个噪声估计的差分,极易产生’幻影增益’。作者让一个冻结控制模型穿过与三轮 LoRA 自训练完全相同的流水线,识别出七类测量失效——每一类在缺少控制时都会反转结论:单次贪心解码的批处理伪影在未训练模型上制造能力变化、expansion 统计给冻结模型分配 0.28 的假获取率、阈值修复后的 null 依然非零。替代方案(逐问题精确检验 + 合并基线池 + FDR 控制)在任何 held-out 副本上检测不到任何真实转移。梯队实验进一步揭示:外部蒸馏能改善 base 模型未触及的问题而三种自训练不能,回归分析以 p<10⁻⁸ 拒绝该不对称性是总体增益差异的副产物。本文为转移级审计立下规矩:每个报告的统计量都需要单独测量的 null。

August 22, 2026 · 3 min

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See 精读

当低资源语言推理微调只被一个准确率数字评判时,我们到底在测什么?Sophea AI 在三家 MoE、四个模型上用 11.8 万行希腊语语料做 SFT 与 RLVR 实验,发现最佳微调 arm 76.5 分竟低于基线 77.2 分,而随机种子的噪声地板高达 7.7 分——翻译基准准确率被训练噪声主导,几乎不携带信息。改用六维行为度量后结论完全翻转:SFT 让 98% 推理轨迹切换为问题语言、token 省 3 倍;RLVR 把格式违规从 24% 修到 2.5%、答案泄漏清零,且希腊语思考习惯 98.2% 保真。一篇把 null 结果写成方法学的罕见论文。

August 22, 2026 · 4 min

Agent Lightning v1.0: Towards Harnessed Agentic RL 精读

微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0,首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时,训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战,以约3500行代码给出参考实现,仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%(+14.6个百分点),并公开完整数据清洗管线与防reward hacking脚手架。

August 20, 2026 · 3 min

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements 精读

新加坡国立大学、南方科技大学与牛津大学团队论证:在长程agent微调场景中,进化策略(ES)不只是更便宜的RL替代品,而是结构性更优的选择。Agentic ESOpt以参数空间扰动+奖励加权更新实现免反传全参优化,GPU显存与推理持平(8.41GB,比GRPO低85.7%),在可控Sudoku实验中呈现horizon-dependent crossover——H*=15时超最强GRPO 12.5个百分点;WebArena-Lite上完成27B模型全参适配(29.47%→36.16%),并支持prompt-参数协同进化。

August 20, 2026 · 3 min

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读

当推理能力超越人类可靠评估的范围,真值标签反而成为最稀缺的资源。Co-RL 给出的答案是:让多个不共享参数、来自不同家族的模型组成『学习共同体』,彼此用多数票伪标签互为奖励源。理论上,论文证明自奖励 RL 受 sign(p-1/2) 自确认动力学支配——错误会被系统性自我强化;而交叉监督把正确收敛盆从『每题各自 p>1/2』扩大到『pA+pB>1』,互补性可以直接兑换正确性。实验上,4 款 LLM 在 7 个纯文本基准平均提升 3.0–8.6%,5 款 VLM 在 4 个多模态基准平均提升 2.3–7.2%,Gemma-3-12B 甚至反超有真值监督的 GT-Reward。

August 20, 2026 · 7 min

SA-MRPO: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization 精读

UCSD联合五机构提出SA-MRPO——多奖励RL后训练的饱和感知优势重加权:针对固定标量化+组标准化的两大缺陷(奖励轮廓不同的rollout获得相同优势;已饱和目标仍按固定权重占用梯度预算),按每个奖励维度的实时饱和度自适应重加权,使梯度流向“还有提升空间的未竟目标”。Qwen2.5-7B三目标设置下15项基准对比12项超GDPO(AIME24 +5.0pp、MATH500 +3.5pp);自适应推理设置平均准确率+3.8且响应更短;代码基准Codeforces从10.6%升至12.9%。机制本质:把优化预算从“维持已会技能”重新分配到“攻克未会技能”。

August 19, 2026 · 2 min

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 精读

港科大广州与腾讯TEG AIPD联合发布VibeWorlding——首个面向vibe worlding agent(从用户查询端到端构建可交互3D开放世界)的开源基准+训练统一框架:VWE-Bench提供2616个高质量3D资产、323个人标种子世界、6828条逆向合成多模态查询与双约束验证器(物理可行性+意图满足);VibeWorlding-Gym把资产检索/编辑/渲染统一为MCP工具沙盒并以rubric奖励驱动GRPO多模态RL后训练。实验揭示GPT-5.5(57.3%)与Qwen3.8-Max(56.9%)均远未解决该任务、瓶颈定位在精确3D世界编辑;RL后训练使开源Qwen3-VL-30B-A3B从13.6%升至59.3%全场第一,8B版41.4%比肩Gemini 3.1-pro。验证器与人类判断系统级排序相关ρ=0.88,为agentic RL提供了可靠奖励服务。

August 19, 2026 · 2 min

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 精读

Transformer的知识(FFN)与推理(Self-Attention)逐层绑定,模型只能靠冗长CoT弥补深层知识无法回传浅层的缺陷。上海AI Lab提出Mobius架构:全局共享的Memory(FFN知识向量库)+多个Reasoner(Self-Attention)以隐状态为载体反复查询知识库,原生获得反向残差连接与动态隐推理两大能力。7B从零训练以62.6%数据达到Transformer同等MMLU(1.6倍数据效率),Intern-S2-Mobius-35B持续预训练后MMLU Pro 89.05超Qwen3.5的85.31,端到端推理加速近4倍、输出token缩短1.2–5倍。本文拆解其知识-推理解耦机制、两大原生能力的因果链,并展望自进化、世界模型与软硬件协同四个延伸方向。

August 18, 2026 · 1 min

Latent On-Policy Self-Distillation 精读

在线策略自蒸馏(OPSD)用特权上下文让自教师比学生更知情,但特权格式由设计师手工规定——答案、反馈、技能或轨迹,各有盲区。NPS与上交团队提出LOPD:让特权上下文本身从经验中端到端学习——检索相关经验经作曲器压缩为96个连续隐token条件化自教师,特权间隔约束防止教师向学生坍缩,训练后只留学生。全部10个骨干-基准组合获最佳聚合结果:Qwen3-8B EnvScaler 66.4 vs 最强基线60.2;以不到GRPO/Skill-SD 30%的rollout预算超越两者。消融直接证明:隐上下文联合学习是全部增益的必要条件。

August 18, 2026 · 1 min

Self-Supervised Visual On-Policy Distillation 精读

在线策略蒸馏(OPD)依赖教师-学生间的信息不对称,通常来自更强教师或特权监督。UCSD、牛津等五校团队提出反转思路:不给教师加信息,而是给学生减信息——学生看强增广视图、EMA教师看原图,免费构造出等效特权不对称。S2VOPD用0.3–0.6倍降采样+50%概率高斯噪声的最优配方,将Qwen3.5-4B在六个细粒度感知基准上从70.7%提升至77.4%,超越Qwen3-VL-235B与GPT-5.4,追平397B模型;对称自蒸馏反而退化。三定律浮现:不对称必须存在、强度适中、差距须保持任务一致。

August 18, 2026 · 1 min