Accelerating Scientific Research with Gemini in the Real-World 精读

深度精读 Google DeepMind 等机构的 Co-Scientist 扩展工作:把多智能体科研系统从纯计算假设生成器升级为覆盖材料合成、生物实验、代码研究的执行落地研究伙伴。MXene 新前驱体路线一次合成单层半导体、E. coli 群游形态零样本预测命中未发表湿实验数据、自动发现的医疗 Agent 超六个前沿模型;30 位专家 450 次双盲评审显示严重结果幻觉从基线 46% 压到 4%——核心是把幻觉与抄袭罚项并入进化适应度并用执行日志做硬校验。

August 28, 2026 · 2 min

ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices 精读

深度精读 Meta FAIR 的 ADeptS-Bench——首个跨移动+桌面、双流(安全+歧义澄清)、离线视觉接地的计算机使用 Agent(CUA)可信赖性基准。核心设计:威胁嵌入视觉界面而非指令文本(同一句「订个披萨」,良性截图是正常菜单、恶意截图藏钓鱼覆盖层),1,300 人 MaxDiff 用户调查驱动威胁优先级(身份盗窃 80.2% 最受关切)。评测 7 个模型:无人同时做到任务成功率超 80% 且攻击成功率低于 30%;所有模型毫不犹豫点下 2.5 万美元订单的 Checkout,无一识破「Optimize」按钮实为恢复出厂重置。消融揭示三种安全架构:Gemini 3.1 完全依赖拒绝工具(移除后 ASR +22pp)、Claude/GPT 部分依赖(+10~11pp)、Qwen 无任何机制(±1pp,ASR 高达 74-80%)。

August 28, 2026 · 3 min

Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation 精读

当Agent编排系统直接搬用服务网格的重试、超时、错误率熔断这三件套时会发生什么?这篇论文对一台生产级Agent交付平台(66,185行代码、59个模块)的147起编号事故做了回顾性失效研究,量化展示了三大可靠性假设在Agent场景全部失效:54次连续成功调用让错误率熔断全程失明、21个事件跨6次调用累积让完全正确的幂等组件永远无法通过测试、12起执法层阻断正确工作的事故。论文提炼出贯穿5个子系统的横切根因——身份充分性,并推导出以delegation为执法单元的7个新可靠性原语。对构建Agent基础设施的工程师来说,这是一份罕见的、带测量成本的真实现场失效档案。

August 28, 2026 · 1 min

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling 精读

深度精读 ServiceNow AI 的 AgentJudgeBench——首个把 LLM-as-a-judge 的可靠性本身作为研究对象的基准。当 Agent 评测普遍用 LLM 裁判给工具调用打分时,没人问过:裁判自己靠得住吗?论文构建 3,808 条 BFCL 风格记录×6 种 DAG 拓扑(线性/扇出/扇入/菱形/可选富集/类环)×3 难度档,5 个生成器(3B-70B 开源+GPT-5.4)产出工具调用,6 个裁判(20B 到前沿规模)在有/无真值配对条件下按四指标打分,共 321,648 次评估。核心发现反直觉:难任务无真值时 6 个裁判全部收敛到 77-82% 窄带(结构性天花板,模型规模无法突破);给真值对前沿裁判反而有害(GPT-5.4 -1.5pp、Gemini-2.5-Pro -3.9pp,过度锚定);CoT 推理最多 +0.3pp、温度影响≤0.25pp,而结构化 rubric 提示最高 +6.5pp 但不可跨配对泛化。

August 28, 2026 · 2 min

ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions 精读

让 AI 操作软件一定要截图加点击吗?这篇来自上海交大 X-LANCE 实验室与 BIGAI 的论文给出了否定答案:GUI Agent 的许多失败不是模型不够聪明,而是接口选错了。论文提出 ASIL(Agent-Software Interaction Layer),用结构化 JSON 状态替代截图、用代码可执行的语义动作替代坐标点击,在 15 个应用 380 个任务上把 GPT-5.4 的严格成功率从 6.6 拉到 81.6,平均每任务只需不到 5 个动作。更妙的是,这种结构化模态让训练也变便宜了:Qwen3.5-9B 仅靠数千条 SFT 样本和 8 张 A800 就从 66.6 提升到 82.2。本文精读其接口设计哲学、最深可行访问路径方法论与训练闭环证据。

August 28, 2026 · 3 min

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing 精读

可穿戴设备能连续收集数月的睡眠、心率、步数信号,LLM智能体能否据此预测心理健康分数并给出有据可依的理由?BALMS是第一个系统评估这一问题的基准:3种agentic范式(提示式Health-LLM、工具式PHIA ReAct、记忆式RAG/RAPTOR)×2个任务族(封闭式wellbeing分数回归+开放式rationale的LLM-as-Judge评分)×5个开源/闭源backbone×3个真实纵向数据集。核心发现泼了冷水:zero-shot agent很少超过简单的mean predictor基线;工具式agent在原始传感流上代码脆弱,GLOBEM上85.9%的预测坍缩为同一标签。五类失败模式(静默代码失败、状态丢失、幻觉收尾、魔法数字、schema盲聚合)的分析极为扎实,指向「数值时间序列grounding」是当前agent的核心短板。

August 28, 2026 · 1 min

Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research 精读

深度精读浙江大学与之江实验室的 LLM 科研智能体审计框架 ABE-Ralph:定义并检测「方法学幻觉」——代码可执行、指标看似合理,但智能体静默缩水数据集、用查表替换生成模块、在资源受限尺度上得出与方法主张相反的结论。通过 YAML 契约把论文主张结构化为约束、三轴验证拦截捷径,30 个长程复现任务鲁棒执行率 93%,复合分 58.8 显著超过 Claude Code CLI 的 51.0。

August 28, 2026 · 2 min

Boosting LLM Exploration via Weak-Model Guidance in RLVR 精读

RLVR 训练有个广为人知的暗面:策略熵不断下降、模型越来越自信,大 K 值的 pass@k 甚至不如训练前的 base 模型。现有解法(熵正则、梯度校准、奖励设计)都在目标模型自身内部做文章。北京大学王选所这篇论文走了一条反直觉的路:让一个 2B 小模型先生成部分推理前缀,再让目标大模型接着写完——而且小模型的前缀大多质量堪忧(多数『无实质指导』甚至『误导』),收益恰恰来自这种『不熟悉』而非『正确』。方法极简:按熵最大落差点截断前缀、以 20% 概率混合进 GRPO 训练,pass@128 即从 67.76 恢复到 70.71(接近 base 的 72.15)。同源的 Qwen 小模型前缀质量更高却毫无增益——因为分布太像自己、扰动不足。『有用的前缀不必是最正确的前缀』,这是本文最干净的洞察。

August 28, 2026 · 2 min

Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable 精读

深度精读独立研究者 Pranav Aggarwal 的 Agent 校准论文。核心发现:让 12 个前沿模型对一个不可预知的问题做方向性判断,看到一个专业行情面板后承诺率从 6.5% 飙到 54.0%——而把面板上所有数字全部伪造,承诺率几乎不变(37.6% vs 36.8%)。触发自信行动的不是信息而是包装的权威性。失败被精确定位在「行动门控」而非判断或信念,且该门控可用 540 条骰子硬币合成数据训练归零,但又会在剥夺推理空间的输出格式下崩溃。

August 28, 2026 · 2 min

Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit 精读

机制可解释性的电路发现方法常返回几百条边,大到无法穷举验证、无法逐边理解。这篇论文提出Circuit Condensation:与其在冻结权重里更努力地搜索行为住在哪里,不如通过后训练把行为搬进更小的因果电路。方法是一个迭代「剪枝-愈合-回退」循环——EAP-IG给边排名、剪掉最弱30%、只训练LoRA适配器以KL蒸馏匹配原模型,任务精度与通用能力都存活才接受。在4种行为×8个模型×3种子共96组实验中,C1电路在30/32组合里比最强冻结基线更小,平均缩小8.1倍、最高316倍。关键对照C0证明收益来自权重重塑而非搜索本身。范式层面的洞见:电路的可发现性是模型可训练的属性。

August 28, 2026 · 1 min