Sycophancy Suppression Can Impair Rational Updating 精读:抗谄媚不应牺牲理性纠错

伊利诺伊大学芝加哥分校与新加坡国立大学提出:LLM 的答案翻转分为无依据屈服与理性更新两类,主流抗谄媚方法在压制前者的同时往往连带损伤后者。两轮诊断实验显示 DPO 抗压训练让 Llama-3.1 屈服率降 32.9 个点却让理性更新率掉 48.9 到 53.7 个点,联合优化也难以幸免。机制分析进一步发现两种行为共享大量 MLP 神经元与注意力头、steering 方向余弦相似度全 16 组为正,说明纠缠是结构性的。论文主张抗谄媚是选择性问题而非压制问题,正交化 steering 的初步探索把选择性设置从 5/36 提到 10/36。

August 31, 2026 · 3 min

TACIT-SWITCH: Cost-Aware Model Escalation for LLM Agents from Censored Supervision 精读

深度精读北师大统计学院与香港理工大学合作的 TACIT-SWITCH。论文研究 LLM Agent 运行中何时把控制权从便宜小模型永久移交给强模型这一停时问题,把医学统计的生存分析工具箱搬进 agent 路由:配对 Cheap-Strong 双 rollout 结局加教师标注的粗移交窗口构成区间删失监督,混合治愈模型拆开两个不确定性——强模型能否救回与累积风险何时越过阈值,部署时无需教师。机制仿真 73.52% 对三类基线提升 7.39-11.12 个百分点;ALFWorld 4B→27B 上 48.5% vs 22.4%,DABench 73.1% 且成本最低。统计学家跨界的范例之作。

August 31, 2026 · 5 min

The Approximation Rank of Softmax Attention: Sharp Geometric Laws and Robust Interaction Dimension 精读

Transformer 的注意力矩阵到底需要多高的秩才能被低秩近似?南洋理工大学与卡内基梅隆大学的理论工作给出了两条尖锐几何定律:当 query 与 key 都落在单位球面上时,输出保持的逼近秩按温度参数的 (d-1)/2 次幂增长;而换成整个单位球(多出一个径向自由度)后指数恰好变为 d/2。更有意思的是每个具体注意力头:softmax 的行归一化会精确商掉一批不可见的 logit 方向,剩下 r 维可见交互几何,逼近秩服从 minimax 尖锐的 r/2 指数定律。在 84 头 BERT-base 校准集上,SVD 有效维数与有限构造秩上证书的 Spearman 相关达 0.574/0.606,为『注意力头到底有多复杂』提供了可计算的几何量尺。

August 31, 2026 · 5 min

Token-Level Advertising 精读

深度精读中国人民大学、百度与斯坦福大学合作的生成原生广告论文 Token-Level Advertising。论文提出 LAMA(Latent Advertiser Mixture Auction)机制,把广告商影响直接嵌入 LLM 的 token 级生成过程:广告商报告子代价值向量诱导专属下一 token 策略,平台从贝叶斯分配后验中采样潜在广告商并按其策略生成 token,随生成轨迹演化更新后验,最终确定赢家与支付。理论证明 LAMA 满足 Markov DSIC 与 IR,KL 正则化福利损失上界仅 βlog|N|;学习式实现把报告分解为 BT 成对比较训练的局部软优势加残差回归锚定的根值。Webis 三个垂直的实验中 LAMA 四项指标全面领先,收入比最强基线高 0.08 且用户质量不降。

August 31, 2026 · 3 min

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读

多模态搜索智能体常被环境拖后腿:许多搜索环境只把网页转成文本喂给模型,工具返回的图片直接丢弃,号称多模态的轨迹实际退化成纯文本推理;长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness,把检索图像注册为可寻址的持久状态并跨轮回灌,配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench,基于 30B 模型在 8 个基准上取得 55.97% 平均分,媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。

August 31, 2026 · 4 min

When Evidence Shapes Collaboration: Knowledge-Conditioned Topology Generation for Multi-Agent Systems 精读

深度精读华中科技大学的 K-GAT(神经符号框架)。论文指出现有动态多智能体系统按『先规划后检索』范式仅凭查询语义生成协作拓扑,导致结构失配:证据充足一致时过度规划、证据稀疏冲突时验证不足。K-GAT 反转顺序为『证据先行』:先从 Wikipedia 构建溯源知识图谱检索证据,再以自回归方式逐节点逐边生成以证据为条件的 DAG 协作拓扑,用执行评分+结构剪枝+分布匹配的课程优化训练生成器,辅以 KG-Verifier 验证中间输出。7 基准平均 78.68% 为 8B 规模最强,GPQA 上 50.75% 超 LLM-Debate 15.7 个百分点且 token 消耗减半以上。

August 31, 2026 · 4 min

Accelerating Scientific Research with Gemini in the Real-World 精读

深度精读 Google DeepMind 等机构的 Co-Scientist 扩展工作:把多智能体科研系统从纯计算假设生成器升级为覆盖材料合成、生物实验、代码研究的执行落地研究伙伴。MXene 新前驱体路线一次合成单层半导体、E. coli 群游形态零样本预测命中未发表湿实验数据、自动发现的医疗 Agent 超六个前沿模型;30 位专家 450 次双盲评审显示严重结果幻觉从基线 46% 压到 4%——核心是把幻觉与抄袭罚项并入进化适应度并用执行日志做硬校验。

August 28, 2026 · 2 min

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling 精读

深度精读 ServiceNow AI 的 AgentJudgeBench——首个把 LLM-as-a-judge 的可靠性本身作为研究对象的基准。当 Agent 评测普遍用 LLM 裁判给工具调用打分时,没人问过:裁判自己靠得住吗?论文构建 3,808 条 BFCL 风格记录×6 种 DAG 拓扑(线性/扇出/扇入/菱形/可选富集/类环)×3 难度档,5 个生成器(3B-70B 开源+GPT-5.4)产出工具调用,6 个裁判(20B 到前沿规模)在有/无真值配对条件下按四指标打分,共 321,648 次评估。核心发现反直觉:难任务无真值时 6 个裁判全部收敛到 77-82% 窄带(结构性天花板,模型规模无法突破);给真值对前沿裁判反而有害(GPT-5.4 -1.5pp、Gemini-2.5-Pro -3.9pp,过度锚定);CoT 推理最多 +0.3pp、温度影响≤0.25pp,而结构化 rubric 提示最高 +6.5pp 但不可跨配对泛化。

August 28, 2026 · 2 min

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing 精读

可穿戴设备能连续收集数月的睡眠、心率、步数信号,LLM智能体能否据此预测心理健康分数并给出有据可依的理由?BALMS是第一个系统评估这一问题的基准:3种agentic范式(提示式Health-LLM、工具式PHIA ReAct、记忆式RAG/RAPTOR)×2个任务族(封闭式wellbeing分数回归+开放式rationale的LLM-as-Judge评分)×5个开源/闭源backbone×3个真实纵向数据集。核心发现泼了冷水:zero-shot agent很少超过简单的mean predictor基线;工具式agent在原始传感流上代码脆弱,GLOBEM上85.9%的预测坍缩为同一标签。五类失败模式(静默代码失败、状态丢失、幻觉收尾、魔法数字、schema盲聚合)的分析极为扎实,指向「数值时间序列grounding」是当前agent的核心短板。

August 28, 2026 · 1 min

Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research 精读

深度精读浙江大学与之江实验室的 LLM 科研智能体审计框架 ABE-Ralph:定义并检测「方法学幻觉」——代码可执行、指标看似合理,但智能体静默缩水数据集、用查表替换生成模块、在资源受限尺度上得出与方法主张相反的结论。通过 YAML 契约把论文主张结构化为约束、三轴验证拦截捷径,30 个长程复现任务鲁棒执行率 93%,复合分 58.8 显著超过 Claude Code CLI 的 51.0。

August 28, 2026 · 2 min