Aspire: Can Models Self-Evolve from Vague Goals? 精读

现有 LLM 自进化研究都从人类定义好的显式任务出发,agent 只搜索’怎么优化’;但人类学习往往始于’成为更好的物理学家’这样的模糊目标。ByteDance Seed 联合 SUTD、M-A-P 等发布 Aspire 基准:只给一句自然语言能力目标,评测集对 agent 完全隐藏,agent 必须自己决定优化什么、怎么训练、如何验证。实验给出罕见的机制级阴性结果——24 次 final-only 运行仅 1 次超过基线分,最佳进化 harness 仍低于人工 Qwen-Agent。本精读拆解隐藏评测设计、三条研究问题(RQ1-RQ3)的实验逻辑,以及’代理增益不迁移’这一失败模式的根源。

September 4, 2026 · 3 min

Cliff: Learning Process Rewards from the First Mistake 精读

RLVR 用最终答案的对错给整条推理链打分,粒度太粗;PRM 要训练专用奖励模型,OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式:只用现成 LLM 定位每个错误 rollout 的’第一个错误步’(Pitfall Step),把轨迹切成正确前缀与错误后缀,前缀正优势、后缀负优势。12 个场景上一致超越:比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%,且弱教师(27B)下依然有效。本精读拆解’错误前缀之后无信息’这一核心洞察、token 级优势的构造细节,以及教师定位能力与人类标注 80% 一致率的验证实验。

September 4, 2026 · 3 min

Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读

在 IOI 2026 上,一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分,超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径:22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距,以及’纯 SFT 的 Ultra 反超 SFT+RL 的 Nano’背后的并行采样机制。

September 4, 2026 · 3 min

CogEvol: Towards Efficient and Reliable Learning Environment Generation 精读

清华大学与 CogEvol Inc 联合团队的 CogEvol 是’AI 教育’方向罕见的工业级完整答卷:单模型单次前向把课程大纲变成 JSON 幻灯片或自包含交互式 HTML,22 万生产请求上中位耗时 17/59 秒,27B 模型以 26.9 倍参数效率逼近旗舰编码模型(幻灯片质量 83.7 vs 63.7 交互分)。技术看点有二:把真实生产失败转为 53,687 条验证 SFT 样本的数据飞轮;以及一次被捕获修复的 reward hacking 事件(模型学会产出视觉可信但不可玩的游戏)对混合奖励设计的修正——‘可靠性是被工程出来的,不是被期望出来的’。

September 2, 2026 · 2 min

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读

Purdue 团队对当下最火的 On-Policy Distillation(OPD)发起了一次釜底抽薪式的追问:教师监督噪声率高达 30%–50% 且随教师规模上升,学生却对噪声无感——这暗示 OPD 的增益根本不来自蒸馏。通过梯度分析定位到’低 logp token + 负优势’才是真正驱动力后,论文提出零监督的 OPSA(熵自适应负优势自改进),在 AIME24 上实现 263% 相对提升并反超标准 OPD 16.77 分。本精读覆盖其噪声测量实验、机制归因链条、OPSA 方法设计与完整实验证据。

September 2, 2026 · 3 min

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读

深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot:一个主动上下文管理框架。针对现有方法工具集贫乏(只有搜索/删除/摘要)、探索低效(上下文编辑动作影响悬殊却被均匀采样)、信用分配粗粒度(轨迹级奖励平摊给所有编辑动作)三大缺陷,它扩展出规划、长期记忆、软卸载三类工具,并用上下文变化量+熵变化识别关键编辑决策做分支采样(context-aware partial rollout),再用所有后续分支的平均回报估计动作级优势(细粒度信用分配,方差降为 1/n)。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85;深搜任务上每轮输入 token 稳定在 8-10K(基线线性涨到 30K);消融证明细粒度信用分配贡献最大且在全部基准一致提升。

August 31, 2026 · 5 min

Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers 精读

深度精读 Thomson Reuters Labs 与多伦多大学/Vector Institute 合作的 LLM 评分器顺序依赖论文。批式打分(reranker、奖励模型、多文档 QA)中每个分数都依赖候选排列顺序,论文发现排序质量相同的评分器在下游决策上大相径庭:五个 nDCG@10 差距不超过 0.010 的已训练评分器,重排后保留集重叠度横跨 0.656 到 0.835。提示词层修复(round-robin 划分、logit 校准)完全触达不到决策端;提出的 OC-SFT 在损失函数中显式惩罚同一窗口 N 个排列下自身分数的方差,τ-PSI 从 0.209 降至 0.083,保留集重叠升至 0.835,单次前向即超过十排列集成的 BSC,且 nDCG@10 不降反微升。

August 31, 2026 · 3 min

SPT: Skills as Pre-Training Data for Agentic Language Models 精读

深度精读北京邮电大学与清华大学论文 SPT。论文提出把公开的多文件技能包当作预训练中段(mid-training)数据:清洗 ClawHub 上 38,040 个技能包构建 SkillCorpus(约 3.48 亿 token),用 Reference Insert 序列化策略把被引用文件插入到指令首次提及处,使引用距离缩短 94.92%。7B 模型四个 Agent 基准平均分从 28.50 提升到 53.46(+24.96),通用能力几乎无损,30% 技能混合配比效果最佳。

August 31, 2026 · 4 min

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 精读

南方科技大学、微软亚洲研究院、上海财经大学与北京大学团队提出 VFA(Vision-Free Adaptation),在不使用任何图文对数据的前提下增强多模态大模型的多语言能力。核心思路是把微调看作任务向量:在共享 LLM 底座上用 10 万条纯文本多语言数据微调基座 LLM 得到多语言任务向量,再用 WA/TA/TIES 三种合并算子注入到视觉对齐的 MLLM 语言骨干中,视觉编码器与投影层完全冻结。五个 MLLM 上六大多语言多模态基准平均增益 +0.57 到 +10.64,文化视觉推理 MaRVL 增益最大(Idefics3 +36.17),通用多模态能力持平或略升;而直接文本微调会让 Qwen2.5-VL 平均掉 11.92、MaRVL 从 53.50 崩到 0.00。VFA 仅用 Pangea 约 2% 的数据量达到 47.84 vs 50.34,训练成本约 10 A100 小时对 320 A100 小时,且框架可迁移到视觉编程等非多语言任务。

August 31, 2026 · 3 min

Boosting LLM Exploration via Weak-Model Guidance in RLVR 精读

RLVR 训练有个广为人知的暗面:策略熵不断下降、模型越来越自信,大 K 值的 pass@k 甚至不如训练前的 base 模型。现有解法(熵正则、梯度校准、奖励设计)都在目标模型自身内部做文章。北京大学王选所这篇论文走了一条反直觉的路:让一个 2B 小模型先生成部分推理前缀,再让目标大模型接着写完——而且小模型的前缀大多质量堪忧(多数『无实质指导』甚至『误导』),收益恰恰来自这种『不熟悉』而非『正确』。方法极简:按熵最大落差点截断前缀、以 20% 概率混合进 GRPO 训练,pass@128 即从 67.76 恢复到 70.71(接近 base 的 72.15)。同源的 Qwen 小模型前缀质量更高却毫无增益——因为分布太像自己、扰动不足。『有用的前缀不必是最正确的前缀』,这是本文最干净的洞察。

August 28, 2026 · 2 min