TTPO: Test-Time Policy Optimization 精读

没有标签也能在测试题上直接训练模型?浙大与阿里的 TTPO 给出了一个干净的不对称方案:多数投票选出伪标签后,同意的 rollout 走蒸馏分支(OPSD 前向 KL + 降权已收敛 token),不同意的走 GRPO 惩罚分支(只罚高置信错误 token)。核心洞察是一个反直觉的数据事实——竞赛题上伪标签约 85% 是错的,但不同意它的 rollout 约 79% 本身也是错的,所以「惩罚不一致」不需要伪标签正确,而蒸馏会逐 token 放大标签错误。无标签 TTPO 在五个竞赛级基准上追平甚至超过用真标签的 OPSD,Qwen3-1.7B 从 38.0% 提到 45.2%,4B 版本达到 8B base 水平。本文精读其不对称目标设计与自进化机制。

August 28, 2026 · 1 min

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 精读

进化策略(ES)一直被视为 GRPO 的『省显存平替』——不用反向传播、显存开销低,但性能似乎差一截。这篇来自南方科技大学、华为诺亚方舟实验室等机构的论文系统性地推翻了这个刻板印象:理论上证明 ES 种群内 verifier 投影的 Jensen–Shannon 多样性直接利好 Pass@K;实证上发现 GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base 模型,而 ES 全面高于 base。更有趣的是 ES→GRPO 顺序训练同时拿下最高 Pass@1 与最高 Pass@32。论文还发现 ES 参数漂移是 GRPO 的 40 多倍,但抹掉 93% 的小幅更新后性能几乎不变——大漂移不等于灾难性遗忘。本文精读其理论框架、实验证据与 ES 作为独立后训练范式的定位。

August 28, 2026 · 3 min

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution 精读

Agent 从经验里学到的教训,往往散落在一次次的优化历史里,下次想用时已经找不到了。Google Research 与弗吉尼亚理工的 WikiSkill 在经验与技能之间加了一个持久知识层:不可变的原始轨迹层、持续复利的 wiki 知识层、可回滚的技能层,四组件循环让经验先编译成知识、知识再孕育技能。五个基准、五个模型上,WikiSkill 平均提升 12.3 到 23.9 个点,Qwen-3.5-9B 加技能后反超 27B 无技能模型。消融显示 wiki 层贡献 15 个点,而跨模型迁移实验揭示了技能发现与技能执行是两种可解耦的能力。本文精读其三层架构设计与知识编译机制。

August 28, 2026 · 3 min

A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation 精读

用 LLM 当评委(LLM-as-a-Judge)已是 AI 评估的通用做法,但一个根本问题从未被检验过:当被测内容真的变了,评委的判分会跟着变吗?华南理工与澳门大学团队借用心理测量学的’构念效度’框架,提出评委必须同时满足两条件——构念保持的编辑下判分不变(不变性 S)、最小构念改变编辑下判分必变(敏感性 R)。实测 7 个评委 × 4 个领域发现:匹配不变性 S=0.945 时敏感性仅 R=0.319,最强评委仍漏掉五分之二的构念变化;且评委对’声明的覆盖范围扩大’敏感、对’承诺强度提高’近乎失明(+0.121 差距,7/7 评委同号)。论文还证明现有评估标签集本身可被只看表面形式的预测器恢复 55%-67%——尺子先漏了。

August 27, 2026 · 4 min

Automata from Agent Traces: Failure and Next-Step Prediction 精读

深度精读 Holistic AI、PUC-Rio 与 UCL 合作的 Agent 轨迹自动机研究(ICML 2026 AIWILD workshop)——把整条语料库的 LLM Agent 执行轨迹坍缩成一台 7-43 个状态的紧凑有限状态机(FSM),无超参数、毫秒级构建。这台 FSM 同时充当四件任务的统一结构基底:工作流记忆(8/8 数据集胜过 Agent Workflow Memory)、下一步预测(交叉熵降 21%)、失败预测(held-out AUROC 最高 0.94)、运行时监控(32% 完成度即触发早停)。本文拆解其’前缀树+最后活动右同余合并’构造、紧凑性为何是全部下游收益的根源,以及’拓扑由 harness 而非模型决定’的核心发现。

August 27, 2026 · 4 min

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment(Station v2)精读

Station v2(DualverseAI × 剑桥 × 港大 × UCSD)把 AI 数学发现从『固定管线里的工具』搬进开放世界多智能体环境:6 个跨模型家族的 agent 在无中央协调器的房间制生态里自选方向、跑实验、发论文积累共享文献。在 AlphaEvolve 目录 12 个构造类问题上 5 题产出相对既有文献新颖的结果——kissing 数 d=11 三个精确 604 点构型(两个为新等距类)、Erdős 最小重叠下界 0.37912→0.380552(闭合已发表区间约 82%)、有限域 Kakeya 新无穷族、离散 Kakeya 针 CT(128)≤0.107067、符号不确定性 0.3089;还独立重构 Jacobian 猜想反例。机制归因:高度自主使 agent 能直接追求不可打分的广义数学目标,评估耗时上限倒逼理论引导构造,46.4% 的亮点结果来自跨模型家族协作。

August 27, 2026 · 3 min

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail 精读

帕绍大学单作者研究,用一台CPU笔记本完成了一项改写agent工程常识的测量:把失败调用和报错追加进transcript这个从ReAct沿用至今的标准做法,会让小模型更倾向于重复刚刚失败的动作。定义corrective gain指标后,6个模型(135M-1.7B)在两个环境的G全部为负(约-1.03 nats/token,每token odds×2.8)。反事实分解揭示根因:83%的损害来自失败调用的表面形式触发了复制机制,而非模型读不懂报错。由此预测并验证:描述化改写与decoder级ban有效,‘别重复’指令无效,而’清空上下文重试’这一先前推荐方案恰恰最糟——它精确恢复了产生失败的上下文。

August 27, 2026 · 2 min

Joint Optimization of Tool Creation and Use for Large Language Model Agents(SMITH)精读

深度精读 Appier AI Research + 台湾大学(25 Aug 2026)论文 SMITH:现有工具创建系统让强模型写工具、弱模型用工具,写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用:use 任务只给 JSON schema,接口写得烂必然调用失败,形成「写即所用」闭环;三条独立奖励轴分离 schema/代码/结果失败;easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架,平均输出仅 100 token(比 CoT 少 32 倍),其工具还能让 350M 小模型追平 30B 写的工具。

August 27, 2026 · 6 min

Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读

深度精读 NUS+UCL+KCL+港科大广州(25 Aug 2026)论文 Ockhamareto:用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」,单次生成 2.60 个测试拿下 49.9% 突变分数,比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试,4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。

August 27, 2026 · 6 min

On-policy Distillation with Verifiable Reward 精读

清华LeapLab提出的OPDVR用一道极简的ReLU门,把On-policy蒸馏的隐式奖励按轨迹正确性重新定号,使蒸馏信号永远不与验证器方向打架。理论上证明OPDVR恰好等于OPD去掉与验证器冲突的梯度分量,实验上同架构蒸馏6个数学基准平均49.1超过OPD的47.8,甚至反超教师;GRPD变体在AIME25上比GRPO高出10.9分。本文从RLVR与OPD互补困境讲起,逐层拆解门控机制的数学构造、约半数token被门控的动态证据与逆向门控消融的因果链。

August 27, 2026 · 2 min