TACIT-SWITCH: Cost-Aware Model Escalation for LLM Agents from Censored Supervision 精读

深度精读北师大统计学院与香港理工大学合作的 TACIT-SWITCH。论文研究 LLM Agent 运行中何时把控制权从便宜小模型永久移交给强模型这一停时问题,把医学统计的生存分析工具箱搬进 agent 路由:配对 Cheap-Strong 双 rollout 结局加教师标注的粗移交窗口构成区间删失监督,混合治愈模型拆开两个不确定性——强模型能否救回与累积风险何时越过阈值,部署时无需教师。机制仿真 73.52% 对三类基线提升 7.39-11.12 个百分点;ALFWorld 4B→27B 上 48.5% vs 22.4%,DABench 73.1% 且成本最低。统计学家跨界的范例之作。

August 31, 2026 · 5 min

The Approximation Rank of Softmax Attention: Sharp Geometric Laws and Robust Interaction Dimension 精读

Transformer 的注意力矩阵到底需要多高的秩才能被低秩近似?南洋理工大学与卡内基梅隆大学的理论工作给出了两条尖锐几何定律:当 query 与 key 都落在单位球面上时,输出保持的逼近秩按温度参数的 (d-1)/2 次幂增长;而换成整个单位球(多出一个径向自由度)后指数恰好变为 d/2。更有意思的是每个具体注意力头:softmax 的行归一化会精确商掉一批不可见的 logit 方向,剩下 r 维可见交互几何,逼近秩服从 minimax 尖锐的 r/2 指数定律。在 84 头 BERT-base 校准集上,SVD 有效维数与有限构造秩上证书的 Spearman 相关达 0.574/0.606,为『注意力头到底有多复杂』提供了可计算的几何量尺。

August 31, 2026 · 5 min

Token-Level Advertising 精读

深度精读中国人民大学、百度与斯坦福大学合作的生成原生广告论文 Token-Level Advertising。论文提出 LAMA(Latent Advertiser Mixture Auction)机制,把广告商影响直接嵌入 LLM 的 token 级生成过程:广告商报告子代价值向量诱导专属下一 token 策略,平台从贝叶斯分配后验中采样潜在广告商并按其策略生成 token,随生成轨迹演化更新后验,最终确定赢家与支付。理论证明 LAMA 满足 Markov DSIC 与 IR,KL 正则化福利损失上界仅 βlog|N|;学习式实现把报告分解为 BT 成对比较训练的局部软优势加残差回归锚定的根值。Webis 三个垂直的实验中 LAMA 四项指标全面领先,收入比最强基线高 0.08 且用户质量不降。

August 31, 2026 · 3 min

TreeGraft 精读:多起草器共嫁接一棵草稿树,让投机解码跨越快与好的单选题

树形投机解码用一个起草器建草稿树,陷入『小模型快但树差、大模型树好但慢』的两难。TreeGraft 让免训练 n-gram 小起草器与预训练中间起草器共同构建一棵共享草稿树:中间起草器可回看全树历史节点重新打分并复活被低估的路径(Where),嫁接时不覆盖既有子树(How),再由离线价值系统蒸馏出的 3265 参数轻量调度器逐步决定是否值得调用中间起草器(When)。在 10 个模型对 × 6 个基准上平均加速 1.60 倍,超两个单起草器端点中较优者 15.1%,且在留出模型对与完全留出的 MT-Bench 任务上仍保持 1.48 倍与 1.60 倍,证明调度器学到的是可迁移的成本-质量权衡。

August 31, 2026 · 3 min

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 精读

南方科技大学、微软亚洲研究院、上海财经大学与北京大学团队提出 VFA(Vision-Free Adaptation),在不使用任何图文对数据的前提下增强多模态大模型的多语言能力。核心思路是把微调看作任务向量:在共享 LLM 底座上用 10 万条纯文本多语言数据微调基座 LLM 得到多语言任务向量,再用 WA/TA/TIES 三种合并算子注入到视觉对齐的 MLLM 语言骨干中,视觉编码器与投影层完全冻结。五个 MLLM 上六大多语言多模态基准平均增益 +0.57 到 +10.64,文化视觉推理 MaRVL 增益最大(Idefics3 +36.17),通用多模态能力持平或略升;而直接文本微调会让 Qwen2.5-VL 平均掉 11.92、MaRVL 从 53.50 崩到 0.00。VFA 仅用 Pangea 约 2% 的数据量达到 47.84 vs 50.34,训练成本约 10 A100 小时对 320 A100 小时,且框架可迁移到视觉编程等非多语言任务。

August 31, 2026 · 3 min

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning 精读

长时程智能体 RL 的核心难题是信用分配:稀疏的终端奖励被广播给轨迹里每个动作,成败的原因被抹掉了。现有方法从 rollout 侧构造代理信号(重复状态、轨迹图、语义邻近、事后复盘、分支采样)估计动作重要性,却把判定成败的验证器当成一个标量奖励丢掉了内部结构。清华大学、西安交通大学与嘉兴南湖大学提出 VICT,把程序化验证器拆解为可执行原子,通过写入/揭示/提交/违例四类见证谓词把原子回溯到具体动作,仅沿这些证明边重分配组相对优势。ALFWorld 93.7%、WebShop 严格成功 83.6%,消融排除了稠密原子奖励、仅提交信用、时间邻近等简单解释,且可与 rollout 侧方法叠加。本文按九部分结构精读其机制与证据。

August 31, 2026 · 4 min

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读

多模态搜索智能体常被环境拖后腿:许多搜索环境只把网页转成文本喂给模型,工具返回的图片直接丢弃,号称多模态的轨迹实际退化成纯文本推理;长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness,把检索图像注册为可寻址的持久状态并跨轮回灌,配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench,基于 30B 模型在 8 个基准上取得 55.97% 平均分,媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。

August 31, 2026 · 4 min

When Evidence Shapes Collaboration: Knowledge-Conditioned Topology Generation for Multi-Agent Systems 精读

深度精读华中科技大学的 K-GAT(神经符号框架)。论文指出现有动态多智能体系统按『先规划后检索』范式仅凭查询语义生成协作拓扑,导致结构失配:证据充足一致时过度规划、证据稀疏冲突时验证不足。K-GAT 反转顺序为『证据先行』:先从 Wikipedia 构建溯源知识图谱检索证据,再以自回归方式逐节点逐边生成以证据为条件的 DAG 协作拓扑,用执行评分+结构剪枝+分布匹配的课程优化训练生成器,辅以 KG-Verifier 验证中间输出。7 基准平均 78.68% 为 8B 规模最强,GPQA 上 50.75% 超 LLM-Debate 15.7 个百分点且 token 消耗减半以上。

August 31, 2026 · 4 min

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models 精读

「LLM 不能跳变(jump)」——即无法完成爱因斯坦式的从证据到新公理系统的溯因飞跃——是一个流传甚广的论断,但从来没人给出过「跳变」的形式化定义和可检验的度量。剑桥大学与新南威尔士大学团队用范畴论补上了这块拼图:把跳变拆成四步(默认补全是什么、何时被迫放弃、放弃何时正确、跳变如何复合),并测量第二步。左/右 Kan 扩张给出模型无约束时的「默认答案」(已被证明等价于误差最小化归纳,校准实验证实 98% 无约束输出确实是它);跳变实例则携带机器可验证证书保证正确答案存在、唯一且必异于默认。结果出人意料:4 个前沿模型在全部 248 次约束试验中,一次也没有退回被排除的默认答案(Kan-default 率为零)——选择步不是瓶颈,若无能真实存在,位于生成约束或发明框架的上游。

August 31, 2026 · 2 min

WM-R1: Training GUI Agents to Reason and Leverage World Models with Reinforcement Learning 精读

用强化学习训练手机 GUI 智能体,为什么必须忍受昂贵的真实环境交互?华东师范大学提出的 WM-R1 给出了第一个完全相反的答案:把世界模型从推理时的辅助工具升级为训练环境本身。冻结的 Code2World-8B 世界模型生成全部状态转移,Agent 通过 GRPO 在纯模拟环境中学习;更关键的是 <call_wm> 机制把世界模型嵌进思维链,让 Agent 学会『提出候选动作—模拟后果—评估修正—再提交』的推理策略。AndroidWorld 上 WM-R1-7B 达到 39.8 的 SOTA(超 UI-R1 达 9 个百分点),OOD 平均提升 +16.0,训练全程零真实环境交互、单卡 11.2 小时完成。本精读拆解其训练框架、奖励设计与效果根源。

August 31, 2026 · 5 min