Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows 精读

AI 金融分析师能从 10 万 token 的年报里逐字背出契约阈值,但这条风险披露真的影响它的投资判断吗?Boston College 与 Columbia 商学院团队用固定信息集设计发现:随着无关上下文从 2K 扩到 128K token,一条风险披露对卖出倾向的影响从 +0.032 跌入实验噪声地板,而直接检索保持 12/12 公司满分——“读到了“与“用上了“彻底分离。机制实验定位到两条传输通道:固定容量的运行摘要与注意力查找,均随长度稀释。工作流实验给出解法:extract-then-decide 把 128K 下的影响保留率从 12% 提到 67%,而通用分块摘要在所有长度(含 2K)都将影响归零。核心教训:检索式评估会认证一套“证明了读得到、实际上不用“的判断系统。

August 27, 2026 · 3 min

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference 精读

香港四校合作提出 Reflection Steering:一个免训练的激活空间干预框架,用于抑制大推理模型中冗余的反思行为。方法通过 PCA 去噪、对共享推理方向正交化、逐层校准和有界投影删除四阶段,把「反思方向」从「通用推理方向」中解缠出来,在 6 个模型×基准设置中平均节省 16.9% 的思考 token,MATH-500 上精度统计等效。本精读完整拆解其方向净化机制、层校准协议与统计验证方法。

August 27, 2026 · 3 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

当多智能体系统(MAS)执行失败后,重跑一遍、自我反思、批评家反馈这些「修复」方法,究竟是真的修好了 bug,还是仅仅靠 LLM 采样的随机性碰巧撞对了答案?这篇来自华东师范大学等四所高校的论文用 SymTrace 回放框架与 536 条人工标注失败轨迹的 SymFail 数据集给出了冷峻的答案:无引导全量重跑的修复率仅 6.90%,自我反思 4.29%、批评家 3.73%,与随机重采样无异;而基于症状定位的选择性回放干预单次即修复 20.15%。本精读拆解其「冻结上游随机性」的受控评估方法论,并讨论它对整个 Agent 可靠性研究范式的冲击。

August 27, 2026 · 3 min

The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses 精读

深度精读南洋理工大学的 LLM Agent Harness 架构收敛研究——首个对 harness 层本身做源码级多案例研究的论文。三个来自对立哲学的开源编码 agent harness(LangChain deepagents、Earendil pi、DeepSeek dsh)反向演化却汇聚于同一五要素中间形态:商品化循环、仅追加可重放会话记录、模型怪癖数据化、上下文渐进披露、显式扩展缝隙。本文逐项拆解五要素与三类收敛机制(平行发现/扩散/字面复用),还原四条汇聚断层线缺陷分类,并解读唯一零收敛维度’外部可验证性’为何是预测性缺口。

August 27, 2026 · 4 min

Tunable Tool-Call Rates in LLM Agents via Representation Steering 精读

深度精读 UC Santa Cruz + UC Berkeley 论文:LLM agent「是否调用工具」这个离散决策,可以被残差流中的单一线性方向连续调节——无需训练、无需改提示,一个旋钮把调用率从近 0% 单调推到 90%+,且新增调用精准落在模型答不出的低流行度问题上,PopQA 准确率 0.29→0.56,方向还能零样本迁移到 6 个未见工具。

August 27, 2026 · 2 min

Unmatched Does Not Mean False: Incomplete Reference Sets Can Reverse Calibration Rankings 精读

深度精读 UC San Diego 的评测方法论论文——当开放式输出(ToM 信念追踪、开放域 QA)遇上「有限参考集+匹配器」的评测管线时,未匹配的输出被记为假,会产生代理标签并直接反转 proper-score 校准排名。论文用固定内容、只换标签源的识别设计证明:同一批 259 条信念,参考标签下 EG 探针领先 0.227,盲评真值下反落后 0.152,六个场景全部反转;已发布的 NQ-open 真实管线同样反转。机制上 90% 以上失真来自被省略的真值,单参数 π 修正即可恢复符号。本文拆解这条「识别—分解—闭合判据—预算修复」的完整证据链。

August 27, 2026 · 5 min

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis 精读

深度精读港中深与西安交大团队的微服务根因分析(RCA)轨迹级研究。指出现有评测只看“是否定位到责任服务”的终点指标,无法揭示诊断证据与故障传播路径。作者人工标注服务级故障传播路径,对齐分析3500条智能体诊断轨迹,发现答案正确性与诊断质量脱节,并将错误诊断归结为三类证据处理失败,进而设计DIAGGUARD两段防御(前置grounding+后置verification),在跨模型、跨基准、跨拓扑的独立验证集上把Acc@1从43.5%提升到52.5%。

August 25, 2026 · 3 min

CatchBench: When Can an Agent Failure Be Caught? 精读

CatchBench(USC,PyOD 作者 Yue Zhao)构建了首个在 PRE(运行前声明配置)/LIVE(运行中轨迹前缀)/POST(运行后完整轨迹)三种信息状态下统一评分 Agent 审计方法的竞技场:9 个计分板、72 个方法。它最大的贡献是方法学自律——公开每条标签的生成方式从而暴露自身语料的捷径(injecagent 源仅凭声明顺序即 F1=1.000)、给注入故障设’可采性门槛’、并如实发表 71/118 个无法分离的对比。‘分数在标签过程公开并检验其捷径之前不可解释’,这是对所有基准的警世恒言。

August 25, 2026 · 2 min

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (Risa) 精读

Risa(复旦大学)首次把稀疏 MoE 模型的原生路由轨迹用作软件 Agent 测试时扩展的’行为坐标系’:把每层每 token 的专家路由权重积分成路由指纹,探索阶段选与历史最不相似的候选(disagree to explore),写补丁阶段在同伴收敛处提交,跨尝试仲裁取’决策 token’上一致性最高者(agree to commit)。SWE-bench Verified 宏平均 44.9%→48.2%,跨家族迁移到 Qwen3.6 仍 +3.5pp——全程无需外部 judge、无需测试执行。

August 25, 2026 · 2 min

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning (NFV) 精读

NFV(Microsoft Research,单作者 Shuvendu K. Lahiri)让 AI Agent 当形式验证语言的前端:Python 开发者用自然语言问’这个函数对不对’,Agent 把程序与规范翻译到 Dafny,由成熟验证器逐条机器检查,证明可查、缺陷有 witness。在 206 条数据集上 57.3% 的条目给出机器检查证明 @92.2% 精度——而 LLM-as-judge 直接判定的精度只有 72% 且无 artifact;无纪律的’LLM+验证器自由证明’更是 98% 的正确程序和错误程序都被’证明’(精度 50%)。关键机制是’无证明即弃权’与 staged discipline(溯源标签+冻结翻译堵死为证明而改代码的捷径)。

August 25, 2026 · 2 min