Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research 精读

深度精读浙江大学与之江实验室的 LLM 科研智能体审计框架 ABE-Ralph:定义并检测「方法学幻觉」——代码可执行、指标看似合理,但智能体静默缩水数据集、用查表替换生成模块、在资源受限尺度上得出与方法主张相反的结论。通过 YAML 契约把论文主张结构化为约束、三轴验证拦截捷径,30 个长程复现任务鲁棒执行率 93%,复合分 58.8 显著超过 Claude Code CLI 的 51.0。

August 28, 2026 · 2 min

Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit 精读

机制可解释性的电路发现方法常返回几百条边,大到无法穷举验证、无法逐边理解。这篇论文提出Circuit Condensation:与其在冻结权重里更努力地搜索行为住在哪里,不如通过后训练把行为搬进更小的因果电路。方法是一个迭代「剪枝-愈合-回退」循环——EAP-IG给边排名、剪掉最弱30%、只训练LoRA适配器以KL蒸馏匹配原模型,任务精度与通用能力都存活才接受。在4种行为×8个模型×3种子共96组实验中,C1电路在30/32组合里比最强冻结基线更小,平均缩小8.1倍、最高316倍。关键对照C0证明收益来自权重重塑而非搜索本身。范式层面的洞见:电路的可发现性是模型可训练的属性。

August 28, 2026 · 1 min

Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms 精读

用 RLVR(可验证奖励的强化学习)训练出的领域专家各有绝活:数学专家、代码专家、指令跟随专家……但实际部署总不能带上五个模型。这篇复旦大学与腾讯 LLM 部门合作的论文,把三种把多域能力融合进单模型的范式放进同一实验框架对比:Merge(合并任务向量,零训练成本)、Mix RL(混合数据重训一遍)、MOPD(多师在线蒸馏,兼用两者)。结论出人意料地均衡:三范式平均分差不超过 1.4 分,但单个基准差距可达 8.6 分,且域级得失完全由「域之间的关系」决定——数学/科学/代码的任务向量方向相近、互相正迁移,指令跟随与 Agent 则与其它域近正交。更有意思的是,三种融合都只是『把已有的解重新加权』而非扩大解题覆盖:pass@32 时三者与 base 模型已不可区分。本文精读其实验设计、任务向量几何分析与范式选择指南。

August 28, 2026 · 3 min

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes 精读

推理时扩展(多次采样投票、自我反思、LLM 裁判)能提升推理精度,但代价是数倍的生成次数与 token 开销。这篇 COLM 2026 论文(俄亥俄州立大学 + 普林斯顿)提出 CritICL:把同族小模型的失败模式当作结构化知识,在推理时以批评式上下文示例引导大模型绕开自身陷阱。其成立基础是一个漂亮的实证发现:同族模型的失败模式分布跨尺度高度一致——Qwen 1.5B 与 72B 的 top-20 失败模式排序与幅度基本稳定,且多小模型聚合分布比单个更逼近大模型。效果上,CritICL-static 让 Qwen2.5-72B 达到 59.2%(超 Consistency@5 的 59.0),而 token 总量仅 3768(1 次生成)vs Consistency@7 的 5440(7 次生成)、Self-Reflection 的 7533。『用失败而非成功做弱到强迁移』,失败是比正确示范更可迁移的信号。

August 28, 2026 · 2 min

LLMs Can Design Near-Optimal OR Algorithms 精读

深度精读 NYU Stern 商学院单作者论文:检验前沿 LLM 能否为库存控制、排队网络、组合优化三类经典运筹学问题设计近优算法。最强模型 gpt-5.6-sol 在单次未调优查询 + Python 沙箱设定下,10 类问题中 8 类均值不劣于逐实例最优现有方法(含精确 DP 与逐实例训练的 PPO),MMNL 628 实例全部精确最优;关键在于模型发现了更好的状态表示而非调参,且 8 个月内发布的四代模型性能差距高达 17–79% 对 ≤0.1%。

August 28, 2026 · 2 min

Planting a Latent Variable in Natural-Looking Text: A More Realistic Test of Belief States in LLMs 精读

Transformer是否真的在学习贝叶斯后验「信念状态」?此前这只在玩具HMM token序列上被证明过。这篇来自Columbia的单作者论文设计了一个聪明的实验范式:让Gemma-2-2B教师模型写普通文本时,沿8个正交SAE方向做「阈下转向」,把一个由环形Markov链控制的潜变量植入自然语言;再让110M学生transformer从零训练在这批语料上。结果学生模型残差流中线性探针能恢复最优贝叶斯观测者后验(R²=0.49),且8个状态在表示空间中自发排成Markov链原序的环——首次把信念状态几何与概念流形形成机制实证关联起来。方法论亮点是「用转向植入受控潜变量」,让自然语言既保留自然性又拥有完整ground truth。

August 28, 2026 · 1 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

多智能体系统(MAS)失败后重跑一次就能修好?这篇论文用 SymTrace 可控回放框架和 536 条人工标注失败轨迹(SymFail)证明:现有任务级重跑方法的修复成功率仅 6.90%,且主要是靠 LLM 采样随机性’碰’出来的,而非真正修复了失败机制。作者提出的症状驱动节点级干预把单次干预修复率提到 20.15%(相对最强基线提升 191.89%)。本文精读其可控回放的数据集设计、实验证据与’因果修复 vs 随机修复’的方法论启示。

August 28, 2026 · 5 min

Same Model, Different Harness: Different Coding-Agent Results 精读

同一个模型、同一批任务,只换 Agent Harness 的配置,编码成功率能差多少?独立研究者 Sydney Lewis 用严格的配对实验给出答案:在 20,480-token 紧窗口下,SWE-bench Verified 的平均 F2PF 从 28% 涨到 49%,完全解决数从 43 到 72。treatment 只有三件机械武器:半衰期规则缩短旧工具结果、检测器打断重复劳动、命令防护。论文最有冲击力的结论是方法论层面的——模型加 harness 才是被测求解器,单报模型名字的编码评测并不完整。本文精读其实验设计、跨四模型迁移证据与机制分析(阅读边界翻倍)。

August 28, 2026 · 3 min

Scaling Model-Generated Distillation Data Can Make Latent Teacher Traits More Recoverable 精读

合成数据规模化通常被当作性能杠杆:数据越多、学生模型越强。这篇上海交大、复旦与上海 AI 实验室合作的论文揭示了第二效应——更多独立样本会让教师的隐藏特质在学生行为中更易检测、更特异。受 subliminal learning 启发的受控实验中,教师被诱导出目标特质后只生成纯数字补全这类严格离题数据(过滤一切显式线索),学生在不同规模数据上训练:动物偏好特质的正确定位数从 2/16 升至 14/16;evil 系统提示教师的学生的不安全率从 2% 涨到 33.7%;连跨模型身份迁移中 5 种假身份全部登顶。安全警示振聋发聩:小规模试点审计会系统性低估部署规模下的可学习风险——今天看似无害的离题数据,规模化后可能精确传递教师的不安全倾向。

August 28, 2026 · 2 min

SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models 精读

潜在思维链模型把中间推理从生成的文本搬进连续内部状态,代价是因果对象被藏了起来:无法再靠阅读推理文本验证忠实性。SCIT(Suffix Cache Interchange Test)把「干预潜步成功了吗」细化为「到底是哪个transformer对象在因果承载这个计算」——是hidden state、key cache、value cache,还是某个缓存段?通过构造精确的source-recipient反事实对并网格化移植cache切片,论文发现:在CODI-GPT2算术检查点上,反事实转移主要由中晚期value-cache后缀轨迹承载,而非hidden向量、key路由或可复用答案槽;且8B能力更强模型上载体整体迁移到prompt-prefix。方法层面「载体测试」将interchange intervention从预指定变量推广到发现承载对象本身。

August 28, 2026 · 1 min