BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing 精读

可穿戴设备能连续收集数月的睡眠、心率、步数信号,LLM智能体能否据此预测心理健康分数并给出有据可依的理由?BALMS是第一个系统评估这一问题的基准:3种agentic范式(提示式Health-LLM、工具式PHIA ReAct、记忆式RAG/RAPTOR)×2个任务族(封闭式wellbeing分数回归+开放式rationale的LLM-as-Judge评分)×5个开源/闭源backbone×3个真实纵向数据集。核心发现泼了冷水:zero-shot agent很少超过简单的mean predictor基线;工具式agent在原始传感流上代码脆弱,GLOBEM上85.9%的预测坍缩为同一标签。五类失败模式(静默代码失败、状态丢失、幻觉收尾、魔法数字、schema盲聚合)的分析极为扎实,指向「数值时间序列grounding」是当前agent的核心短板。

August 28, 2026 · 1 min

Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research 精读

深度精读浙江大学与之江实验室的 LLM 科研智能体审计框架 ABE-Ralph:定义并检测「方法学幻觉」——代码可执行、指标看似合理,但智能体静默缩水数据集、用查表替换生成模块、在资源受限尺度上得出与方法主张相反的结论。通过 YAML 契约把论文主张结构化为约束、三轴验证拦截捷径,30 个长程复现任务鲁棒执行率 93%,复合分 58.8 显著超过 Claude Code CLI 的 51.0。

August 28, 2026 · 2 min

Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable 精读

深度精读独立研究者 Pranav Aggarwal 的 Agent 校准论文。核心发现:让 12 个前沿模型对一个不可预知的问题做方向性判断,看到一个专业行情面板后承诺率从 6.5% 飙到 54.0%——而把面板上所有数字全部伪造,承诺率几乎不变(37.6% vs 36.8%)。触发自信行动的不是信息而是包装的权威性。失败被精确定位在「行动门控」而非判断或信念,且该门控可用 540 条骰子硬币合成数据训练归零,但又会在剥夺推理空间的输出格式下崩溃。

August 28, 2026 · 2 min

From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench 精读

深度精读 ISSTA 2026 的 MCR-Bench(中山大学+重庆大学+华为云)——首个「缺陷状态感知」的多轮代码审查基准。现有 LLM 代码审查评测把审查简化为单轮静态决策,而真实 Gerrit 数据显示近半数代码变更涉及多轮审查(单轮 0.33 天、超 6 轮 31.3 天)。MCR-Bench 含 2,269 个真实多轮审查任务(5 语言、38 个高星仓库、平均 3.8 轮),每任务带细粒度缺陷卡片与跨轮生命周期标注(New→Open→Resolved→Reopened)。构建管线用「先局部检测后全局追踪」两阶段 LLM 标注+3 次运行一致性过滤+6 名开发者双人交叉验证(kappa 0.87)+SZZ 排除合并后引入 bug 的 PR。实验发现:7 个主流 LLM 缺陷检测 F1 最高仅 0.551;最大错误模式是把 Resolved 误判为 New(38.29%)——跨轮时序错位;现成 ACR 流水线(PR-Agent 等 F1 0.257-0.416)普遍不如直接 prompt 裸 LLM。

August 28, 2026 · 3 min

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment 精读

深度精读清华大学联合 MatrixOrigin、南洋理工等的对齐监控论文。针对 agent 在目标冲突下的失当行为(敲诈、泄密、阻挠救援),作者提出 INTENT-AS-A-TOOL:给模型动作空间加一个零参数的意图工具,用其首 token 调用概率作为免 judge、可逐前缀评估的细粒度意图信号。CoT 监控发现可观测有害意图几乎必然走向执行,意图分数与 CoT 标签的 AUROC 达 0.948–0.976;意图引导的在线干预在 Qwen3-32B 上防御成功率 96.5–100%,显著优于静态安全提示。

August 28, 2026 · 2 min

LLMs Can Design Near-Optimal OR Algorithms 精读

深度精读 NYU Stern 商学院单作者论文:检验前沿 LLM 能否为库存控制、排队网络、组合优化三类经典运筹学问题设计近优算法。最强模型 gpt-5.6-sol 在单次未调优查询 + Python 沙箱设定下,10 类问题中 8 类均值不劣于逐实例最优现有方法(含精确 DP 与逐实例训练的 PPO),MMNL 628 实例全部精确最优;关键在于模型发现了更好的状态表示而非调参,且 8 个月内发布的四代模型性能差距高达 17–79% 对 ≤0.1%。

August 28, 2026 · 2 min

MemToC: Benchmarking Memory–Tool Conflict Resolution in Large Language Models 精读

深度精读俄罗斯高校联盟(Skoltech 等)的 MemToC 基准——受控评测「工具返回与参数记忆冲突时该跟谁」。关键洞察:现有评测只测「源偏好」不测「源正确使用」——不知道哪个源正确,就无法区分有益的跟随与有害的盲从。MemToC 从 ToolHop 筛出 542 个质控事实问题,先诱导每个模型的闭书答案 m,再注入已知正确性的受控工具返回 r,按 m、r 对验证答案 g 的正确性划入四格(都对/仅记忆对/仅工具对/都错),每格定义目标行为(跟随/保留/弃权)。5 个 7-9B 模型实测:四个指令模型面对错误工具时能保住自己正确答案的仅 6.5-17.1%,双错时 78-86% 仍复读工具错误;120 个错误跟随中 0 个显式承认分歧。SFT/DPO 微调仅在同样两个骨干上成功——成果取决于骨干而非目标函数;20 个方法-模型组合中 19 个降低了工具错误弃权——改进很少干净。

August 28, 2026 · 2 min

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation 精读

深度精读布里斯托大学的 NeuronFuzz 论文——用模型内部「安全神经元」的激活作为模糊测试的连续反馈信号,替代昂贵的响应级评估。传统 LLM 安全测试每个候选提示都要生成完整回复来判断成败,在强对齐模型上几乎所有候选都被拒绝、拿到同样的失败标签,搜索失去方向。NeuronFuzz 构建轻量 SafetyOracle:用模板不变的有害/良性配对提取 MLP 激活,bootstrap 稳定性选择筛出紧凑安全神经元集,Elastic-Net 逻辑回归映射为连续安全警报分数(prefill 阶段可得、可微)。5 个白盒源模型越狱发现率 76-100%,超基线最多 48 个百分点;每案例只需 1 次响应生成(LLM-Fuzzer 需 179-304 次);模板零样本迁移到 8 个推理模型平均 EASR 92.6%,还迁移到视觉模型(NSFW 任务 ASR 从 3.6% 提至 74.8%)。

August 28, 2026 · 3 min

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents 精读

Agent 的自我改进大多发生在一次任务结束之后——但那时这次运行已经救不回来了。AllSpark 团队的 PILOT 把自改进做成 live 的:监督者通过双向活通道在工作者执行中途重定向或中止(live steering),同时从活轨迹蒸馏可复用技能进持久 harness(live self-evolution),模型参数全程冻结。在 Terminal-Bench 2.0 上 PILOT 以 71.6 均分领先最强单 Agent 基线 5.3 个点;20 轮自改进迭代后 GLM-5.1 从 66.3 升至 80.9(+14.6pp),每任务输出 token 反降 42.9%。评测协议设计严谨:运行中零基准反馈,验证器只决定哪些更新进入下一轮。本文精读其监督者-工作者架构与两个中途纠偏案例。

August 28, 2026 · 4 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

多智能体系统(MAS)失败后重跑一次就能修好?这篇论文用 SymTrace 可控回放框架和 536 条人工标注失败轨迹(SymFail)证明:现有任务级重跑方法的修复成功率仅 6.90%,且主要是靠 LLM 采样随机性’碰’出来的,而非真正修复了失败机制。作者提出的症状驱动节点级干预把单次干预修复率提到 20.15%(相对最强基线提升 191.89%)。本文精读其可控回放的数据集设计、实验证据与’因果修复 vs 随机修复’的方法论启示。

August 28, 2026 · 5 min