Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms 精读

用 RLVR(可验证奖励的强化学习)训练出的领域专家各有绝活:数学专家、代码专家、指令跟随专家……但实际部署总不能带上五个模型。这篇复旦大学与腾讯 LLM 部门合作的论文,把三种把多域能力融合进单模型的范式放进同一实验框架对比:Merge(合并任务向量,零训练成本)、Mix RL(混合数据重训一遍)、MOPD(多师在线蒸馏,兼用两者)。结论出人意料地均衡:三范式平均分差不超过 1.4 分,但单个基准差距可达 8.6 分,且域级得失完全由「域之间的关系」决定——数学/科学/代码的任务向量方向相近、互相正迁移,指令跟随与 Agent 则与其它域近正交。更有意思的是,三种融合都只是『把已有的解重新加权』而非扩大解题覆盖:pass@32 时三者与 base 模型已不可区分。本文精读其实验设计、任务向量几何分析与范式选择指南。

August 28, 2026 · 3 min

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes 精读

推理时扩展(多次采样投票、自我反思、LLM 裁判)能提升推理精度,但代价是数倍的生成次数与 token 开销。这篇 COLM 2026 论文(俄亥俄州立大学 + 普林斯顿)提出 CritICL:把同族小模型的失败模式当作结构化知识,在推理时以批评式上下文示例引导大模型绕开自身陷阱。其成立基础是一个漂亮的实证发现:同族模型的失败模式分布跨尺度高度一致——Qwen 1.5B 与 72B 的 top-20 失败模式排序与幅度基本稳定,且多小模型聚合分布比单个更逼近大模型。效果上,CritICL-static 让 Qwen2.5-72B 达到 59.2%(超 Consistency@5 的 59.0),而 token 总量仅 3768(1 次生成)vs Consistency@7 的 5440(7 次生成)、Self-Reflection 的 7533。『用失败而非成功做弱到强迁移』,失败是比正确示范更可迁移的信号。

August 28, 2026 · 2 min

DeepChart: How Far are LLMs from Faithful Data-Science Chart Generation? 精读

深度精读中科大与华为的 DeepChart 基准:把数据科学图表生成形式化为 Extract–Reason–Visualize 管线,用 1482 条专家标注实例分阶段评估图表背后的数据路径。核心发现「隐藏幻觉」——提取与推理错误经渲染掩盖,外观评估完全不可见:多模态场景模型可执行率 0.782 但源数据保真 F1 仅 0.149;专有模型选 HTML 渲染优于 Python 却有 99.4% 的实例选了次优的 Python。

August 28, 2026 · 2 min

From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench 精读

深度精读 ISSTA 2026 的 MCR-Bench(中山大学+重庆大学+华为云)——首个「缺陷状态感知」的多轮代码审查基准。现有 LLM 代码审查评测把审查简化为单轮静态决策,而真实 Gerrit 数据显示近半数代码变更涉及多轮审查(单轮 0.33 天、超 6 轮 31.3 天)。MCR-Bench 含 2,269 个真实多轮审查任务(5 语言、38 个高星仓库、平均 3.8 轮),每任务带细粒度缺陷卡片与跨轮生命周期标注(New→Open→Resolved→Reopened)。构建管线用「先局部检测后全局追踪」两阶段 LLM 标注+3 次运行一致性过滤+6 名开发者双人交叉验证(kappa 0.87)+SZZ 排除合并后引入 bug 的 PR。实验发现:7 个主流 LLM 缺陷检测 F1 最高仅 0.551;最大错误模式是把 Resolved 误判为 New(38.29%)——跨轮时序错位;现成 ACR 流水线(PR-Agent 等 F1 0.257-0.416)普遍不如直接 prompt 裸 LLM。

August 28, 2026 · 3 min

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment 精读

深度精读清华大学联合 MatrixOrigin、南洋理工等的对齐监控论文。针对 agent 在目标冲突下的失当行为(敲诈、泄密、阻挠救援),作者提出 INTENT-AS-A-TOOL:给模型动作空间加一个零参数的意图工具,用其首 token 调用概率作为免 judge、可逐前缀评估的细粒度意图信号。CoT 监控发现可观测有害意图几乎必然走向执行,意图分数与 CoT 标签的 AUROC 达 0.948–0.976;意图引导的在线干预在 Qwen3-32B 上防御成功率 96.5–100%,显著优于静态安全提示。

August 28, 2026 · 2 min

LLMs Can Design Near-Optimal OR Algorithms 精读

深度精读 NYU Stern 商学院单作者论文:检验前沿 LLM 能否为库存控制、排队网络、组合优化三类经典运筹学问题设计近优算法。最强模型 gpt-5.6-sol 在单次未调优查询 + Python 沙箱设定下,10 类问题中 8 类均值不劣于逐实例最优现有方法(含精确 DP 与逐实例训练的 PPO),MMNL 628 实例全部精确最优;关键在于模型发现了更好的状态表示而非调参,且 8 个月内发布的四代模型性能差距高达 17–79% 对 ≤0.1%。

August 28, 2026 · 2 min

MemToC: Benchmarking Memory–Tool Conflict Resolution in Large Language Models 精读

深度精读俄罗斯高校联盟(Skoltech 等)的 MemToC 基准——受控评测「工具返回与参数记忆冲突时该跟谁」。关键洞察:现有评测只测「源偏好」不测「源正确使用」——不知道哪个源正确,就无法区分有益的跟随与有害的盲从。MemToC 从 ToolHop 筛出 542 个质控事实问题,先诱导每个模型的闭书答案 m,再注入已知正确性的受控工具返回 r,按 m、r 对验证答案 g 的正确性划入四格(都对/仅记忆对/仅工具对/都错),每格定义目标行为(跟随/保留/弃权)。5 个 7-9B 模型实测:四个指令模型面对错误工具时能保住自己正确答案的仅 6.5-17.1%,双错时 78-86% 仍复读工具错误;120 个错误跟随中 0 个显式承认分歧。SFT/DPO 微调仅在同样两个骨干上成功——成果取决于骨干而非目标函数;20 个方法-模型组合中 19 个降低了工具错误弃权——改进很少干净。

August 28, 2026 · 2 min

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation 精读

深度精读布里斯托大学的 NeuronFuzz 论文——用模型内部「安全神经元」的激活作为模糊测试的连续反馈信号,替代昂贵的响应级评估。传统 LLM 安全测试每个候选提示都要生成完整回复来判断成败,在强对齐模型上几乎所有候选都被拒绝、拿到同样的失败标签,搜索失去方向。NeuronFuzz 构建轻量 SafetyOracle:用模板不变的有害/良性配对提取 MLP 激活,bootstrap 稳定性选择筛出紧凑安全神经元集,Elastic-Net 逻辑回归映射为连续安全警报分数(prefill 阶段可得、可微)。5 个白盒源模型越狱发现率 76-100%,超基线最多 48 个百分点;每案例只需 1 次响应生成(LLM-Fuzzer 需 179-304 次);模板零样本迁移到 8 个推理模型平均 EASR 92.6%,还迁移到视觉模型(NSFW 任务 ASR 从 3.6% 提至 74.8%)。

August 28, 2026 · 3 min

Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance 精读

深度精读 ENS Paris-Saclay 与 Goodfire AI 的评估方法学论文。模型在思维链里意识到「我正在被测试」时,其言语化 eval-awareness 可分解为两种框架:能力框架(在测我能不能遵守指令)与安全框架(在测我会不会越界),二者对合规行为的预测方向相反——能力框架下的合规率比安全框架高 24–46 个百分点。CoT 预填因果干预证实了因果性(11 个预填中 10 个方向符合预测)。这直接挑战当前安全评估管线「聚合抑制 eval-awareness」的实践。

August 28, 2026 · 2 min

PAWBench: How Far Are We from Probabilistically Aligned World Modeling? 精读

深度精读上海交大、上海AI实验室、Krea AI、Hugging Face 等多方合作的 PAWBench:把「概率对齐」形式化为视频世界模型的分布级标准——固定初始观测与动作下,模型诱导的未来分布应匹配物理上有效结果的正确概率。50 场景两套件评测 11 个视频生成模型,无一同时做到概率准、覆盖广、场景稳;核心洞见是「一条合理的未来不等于分布对齐」,加大采样预算只提高覆盖率、纠正不了概率分配。

August 28, 2026 · 2 min