论文链接:Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows 发表时间:2026年8月(工作草稿,复现包预计 9 月底发布) 机构:Boston College Carroll 管理学院 + Columbia 商学院(信息系统/会计金融研究) 领域标签:信息系统 / 金融披露处理 / 长上下文 / cs.CL

一、论文背景

AI 分析师正在成为现实。散户大规模向生成式 AI 询问个股意见,且聚合交易活动与 AI 推荐相关;资本市场中介在公开发布的研究中使用 AI;实验证据显示与这些工具交互确实会改变投资者判断。当用户把"读年报并给出投资判断"这个任务整体委托给模型时,一个基础问题浮现:AI 能检索到的信息,真的会影响它产出的判断吗?

披露处理成本框架。会计研究早就区分两类成本:找到信息的成本与把信息整合进判断的成本(Blankespoor et al. 2020)。年报越来越长、越来越难读,大量增长集中在埋没公司特定内容的样板化章节。LLM 的出现"暴力"解决了第一类成本——面对定向提问,现代模型几乎能从十万 token 申报文件中零误差复述某个契约阈值或和解金额。但没有任何先验理由认为第二类成本会同比例下降。

本文命名这个裂缝为"检索-整合鸿沟"(retrieval–integration gap):模型能检索到的内容与实际影响其判断的内容之间的背离。这个问题的利害在于评估方式:现有 AI 阅读理解评估都在考"能不能答对事实问题"——如果检索准确而整合失效,基于检索的评估会认证一套判断实际上对其"证明了读得到"的事实不敏感的系统。

类比:一位分析师助理,你随口问他年报里某个和解金额,他能一字不差背出来;但让他写投资建议时,那笔和解对他的结论毫无影响——他"读过",甚至随时能引用,但从未"用上"。你若只考他背诵,会觉得他完美胜任。

二、论文定位和关联工作

研究谱系代表工作关注点与本文关系
长上下文退化(CS)Lost in the Middle(Liu et al. 2024)、NoLiMa 等长输入降低检索/推理准确率本文把因变量从"答案对错"换成"经济权重"——检索本身完好时整合仍失效
检索完好仍退化Du et al. 2025输入长度在检索完美时仍伤任务表现最近邻工作;本文增加经济后果、因果通道识别与工作流修复
机制可解释性Geva et al. 2023、Wu et al. 2025事实召回的"内容留位、按需取用"架构本文据此设计探针与干预,并警惕"可解码≠被使用"
IS 委托理论Baird & Maruping 2021、Fügener et al. 2022人机之间如何分配任务与决策权本文研究委托边界"远端":artifact 内部的信息传递
构念差距De-Arteaga et al. 2025ML 系统优化了遗漏关键维度的代理指标检索准确率正是这样的代理;本文提出"边际决策影响"补上真实构念
AI 与会计金融Lopez-Lira & Tang、Cao et al. 等LLM 能从财报提取什么信号本文问的是反方向:某条披露是否改变模型判断——披露"决策有用"的那一站
注意力/有限注意Hirshleifer & Teoh 2003竞争性刺激挤压人类注意力仅作经济类比,不主张人机机制相同

定位结论:本文站在信息系统研究与 NLP 长上下文研究的交叉点上,用 IS 的委托与处理成本理论提出问题(委托后的整合失效、检索代理的构念差距),用 CS 的可解释性工具做因果定位,最后落回可操作的工作流设计知识。

三、问题定义

具体场景:AI 分析师读取一份"申报文件"并给出投资判断。文件中某位置有一条可量化的风险披露(契约阈值、和解金等)。问题:这条披露对判断的边际影响是多少,它如何随上下文长度变化?

核心洞察:固定信息集 + 边际决策影响。直觉做法(短摘录 vs 完整 10-K 对比)有致命混淆——完整文件新增了同一家公司的真实信息(缓释细节、关联风险),理性读者本就应该反应不同。论文的做法:

  • 12 家美国上市公司,每家构造一个与全文融贯的自著风险段落(通过全文件一致性审计,单编辑规则:需要改两处以上的候选直接丢弃);
  • 目标版 T 含该披露,5 个等长中性替换版 N₁..N₅ 只把该段落换成中性文本;
  • 上下文从 2K→8K→32K→128K token 只靠添加经济上无关但体裁匹配的填充文本(会计/法律散文),焦点公司信息集逐字节不变;
  • 定义边际决策影响:Use(ℓ) = Decision(T, ℓ) − mean(Decision(Nₘ, ℓ))。五版本平均吸收单篇替换文本的特异性位移,使 Use 隔离披露本身;
  • 检索与决策在分离调用中独立测量:决策调用读 sell/buy 倾向(开权重模型直接读输出分布;API 模型读 12 个月违约概率),检索调用按冻结答案键对同一文档提问打分。

类比:想检验"某条新闻是否影响法官量刑",不能对比"有新闻的大案"与"没新闻的小案",而要构造除这条新闻外完全相同的平行卷宗——该判几年判几年,唯一变量是那段新闻。

形式化:给定模型 M、披露 d、长度 ℓ,求 Use(ℓ);检验 H1(Use 随无关上下文增长而下降)、H2(下降不是检索失败:Use 已跌落的长度上检索仍准确)。推断用公司层 bootstrap + 经验零假设:每格插入 10 个伪目标(无决策内容的段落,同一插入机制),其效应分布构成仪器噪声地板——Use 必须与"插入任意无关段落的效果"比较,而非与 0 比较。这个抽象的精妙处:同一仪器在短长度能分辨非零效应、在长长度分辨不出,长上下文的零才是"影响消失"而非"测不到"。

四、问题解法

方法分三层递进:现象确立 → 机制定位 → 工作流修复。

4.1 现象层:固定信息集实验

模型集:Qwen3.5 2B/9B/9B-Base/27B 规模阶梯(9B-Base 为机制分析主力——SAE 特征字典只有 base 检查点有预训练版本)、Llama-3.1-8B、gemma-4-12B 跨家族、qwen3.8-max 生产 API 模型、Gemini 3.1 Flash-Lite 低成本端点。另有两个真实性扩展:把自著段落插入完整真实 10-K(生态效度臂);以及真实披露切除实验——20 份训练截止日期后的真实申报,直接切除注册人自己写的披露,对比逐字文件与长度匹配的中性替换版。

4.2 机制层:两种仪器 + 两种干预

仪器(在文件的两个位置施测——披露位置与决策位置):

  • 词汇空间探针:沿模型自身词汇表的方向读出内部表示——“这个内部状态在说什么词、说多响”;
  • SAE 特征字典:冻结一组风险概念方向(契约/违约/诉讼语言),测其在选定位置的激活强度。

因果干预(识别两条传输通道):

  1. 注意力 blackout:决策计算中把注意力头对披露 token 的访问置零(带匹配中性槽位对照、随机头对照)。切断全部头对披露的访问 → 披露对比度的 44–48% 被移除;
  2. 运行摘要移植:目标文件与中性文件除披露槽位外逐字节相同,可各自处理到槽位末尾后交换"运行摘要"(线性注意力层的固定容量循环状态)——目标文件配中性摘要时,影响消失约 65%;中性文件配目标摘要时,凭空重现 44% 的影响(配对差异检验 p=0.54,两通道效应统计不可区分,是"双载波识别"而非排名)。

4.3 工作流层:四种架构 + 分解

工作流做法对应机制假设
extract-then-decide先定向检索问题,把模型自己的答案附在决策提示前(原文仍在上下文)定向结构化复述进入决策点摘要
chunk-then-aggregate分段提取笔记,在合并笔记上决策通用预算化摘要
re-present把目标段落原文逐字复制到决策问题前仅恢复邻近性
extended reasoning生产 API 模型的推理档位(低/中/高)加算力不加路由

分解实验再拆解成功工作流的要素:模型自产 vs 实验者撰写(按答案键)vs 弱模型提取 vs 逐字复制 vs 原文重现,同一位置、同一框架、同一决策问题。

五、评估指标与实验证据

指标体系:

  • 主指标 Use(ℓ):开权重模型为 sell 概率单位、API 模型为违约概率百分点——单位内比较,不跨读数混合;
  • 有向检索完备率:对冻结答案键的检索正确率(中性对照文件提供假阳性纪律);
  • 严重度阶梯响应范围/排序准确率:每条披露有 7 档严重度变体,测判断随严重度的"基数缩放"与"序数排序";
  • 经验零假设:10 伪插入/格的随机化推断。

主结果(Qwen3.5 9B-Base):

长度Use(ℓ)对插入噪声
2K+0.032p=0.025/0.0015 ✓
8K+0.005仅 after 排列 p=0.038
32K+0.001p>0.5 ✗
128K+0.004p=0.95 ✗(落入噪声)

同长度下检索 12/12 公司全长度满分、零假阳性。生产模型同型:+6.06pp(2K)→+3.15pp(128K,落入噪声带 p=0.11);跨家族复制(Llama 2K→128K:+0.016→−0.006;Gemma:+0.047→−0.012)。配对下降检验(Use_2k − Use_128k)三家开权重模型全部显著。

真实披露(27B 模型,20 份真 10-K):短摘录 +0.042(adverse 子集 CI [+0.003,+0.089])vs 完整申报 +0.000(与安慰剂编辑 +0.001 无异),检索 20/20 完美。

序数-基数分离:响应范围压缩 5.6×(0.23→0.04)而 pairwise 排序仅 0.93→0.79——模型仍部分"排得出"哪个更糟,但幅度权重几乎归零。

能力移动失败边界而非消除:27B 在 128K 仍 +0.034(≈9B 的 2K 水平);低能力端点 Gemini Flash-Lite 检索也崩(12/12→7/12),use 保留 18%。

机制证据:披露位置的编码全程稳定(SAE 风险特征激活对中性对照 ~60×@2K、30×@32K/128K;探针词秩 ~80/52/67 平稳)→ 排除读取失败;决策位置任何长度都检不出披露特异内容,且决策可读性随长度退化 ~8×(词秩 68→533)→ 定位于传输。

工作流梯度(128K):

工作流2K Use128K Use保留率
基线+0.032+0.00412%
extract-then-decide+0.126+0.08567%(12/12 公司同向)
chunk-then-aggregate−0.001−0.0010%(含 2K 单块!)
re-present—+0.013噪声带内
extended reasoning2K 反而从 +5.5 降到 +0.7~1.9pp不恢复—

笔记审计解释了分块的灾难:24/24 公司-排列单元中目标披露被逐出合并笔记(2K)、21/24(128K)——驱逐发生在提取阶段,预算化通用摘要在决策阶段看到笔记之前就已丢弃单段披露。分解实验:实验者按答案键撰写的结构化提取(+0.151@2K/+0.056@128K)与模型自产(+0.113/+0.055)无差异——模型自省作者身份不必要。真实完整申报上,extract-then-decide 从基线 −0.004 创造出 +0.043(11/12 公司为正)。

六、效果优势的根源解释

为何检索完好而整合失效(机制因果链):

  1. 架构提供两条传输通道:固定容量的运行摘要(线性注意力循环状态,逐 token 压缩全部已读内容)+ 基于注意力的源文本查找。类比:读者一边做"累计笔记"一边保留原文可查。
  2. 两条通道都被长度稀释:注意力侧——内容选择性读取头在全文长度下崩溃到短文档强度的百分之几(但定向提问可重定向这条完好的查找路由,这解释了 Direct QA 为什么满分);摘要侧——固定容量下任何单条事实的保留率随竞争文本单调下降。
  3. 距离实验区分两种解释:总长固定 8K、披露距决策 1K→5.5K,Use 变化 <0.0001(p=0.99);距离固定 1K、总长 8K→32K,Use 降 0.008(p=0.03)——总负载重要、中等距离变化不重要,支持"读取期记忆的容量压力"而非"决策时回溯距离变长"。
  4. 为什么响应范围先于排序崩塌:衰减的痕迹先失幅度后失符号——fade 的痕迹保留序数信息更久,与"摘要稀释"的连续衰减特征一致。
  5. 决策位置探针检不出披露内容(即使在 2K、Use 很强时)→ 影响由决策时刻"取用"早先记忆中介,而非决策位置持有披露副本——与事实召回的"内容留位、按需取用"机制画像吻合,也解释了为何干预两条通道而非搜索"判断方向"。

为何 extract-then-decide 有效而其他失败(工作流因果链):

  • 有效:定向、结构化的复述被放进决策点紧邻处——一段紧凑文本在决策时刻重新进入运行摘要(机制证据预测的修复形态);原文保留在上下文,查找路由不受损。
  • 分块失败在提取阶段:预算化通用摘要在每段内抄录头部事实(收入/费用/现金)直到预算触顶(许多笔记句中截断),单段风险披露在笔记空间竞争中被驱逐——不是决策阶段忽视提取到的事实,而是驱逐。
  • re-present 失败:被动原文副本不进入运行摘要的形式——区分了"位置邻近"与"形式重构"两个假设,证明起作用的是形式而非单纯邻近。
  • 扩展推理失败:对同一上下文想得更多不把披露放回判断(2K 时反而稀释)——算力不能替代路由。

反事实推理:若无定向性(通用摘要),即使 2K 全文单块也归零;若无结构(逐字复制/re-present),即使邻近也仅 +0.013;若无原文保留(分块后用笔记替代文件),驱逐不可避免——三个反事实共同锁定"定向+结构化+决策邻近且不替代原文"这个组合的必要性。

七、必要知识反推

领域知识层:

  • 披露处理成本框架与有限注意文献——把"检索-整合"分离植根于会计研究传统,否则因变量选择(判断而非答案正确率)失去理论正当性;
  • 长上下文退化文献——知道已有什么(答案准确率下降)、缺什么(经济权重、因果通道、修复)。

方法论知识层:

  • 因果识别设计:固定信息集、差分中差异(5 中性版平均)、经验零假设(伪插入地板)、预先登记的主对比;
  • 可解释性工具及其纪律:词汇探针、SAE 特征、注意力干预、“可解码≠被使用"的干预主义标准(Makelov et al. 2024 的教训)——没有这层纪律,机制章节会过度声称;
  • 混合架构知识:线性注意力循环状态 vs 全注意力——运行摘要干预的可行性完全依赖对模型架构的了解。

工程知识层:

  • 确定性读数工程:开权重模型从输出分布直接读 sell 倾向(无采样噪声)、API 模型用单位化数值读数、硬件/软件/数值配置钉死;
  • 语料构造工程:全文件一致性审计、单编辑规则、七档严重度阶梯、填充文本的"无关性认证”;
  • 双位置双仪器的内部状态测量方案。

知识融合的关键节点:两个创造性翻译。其一,把 IS 的"处理成本/委托"构念翻译成可操作的测量——边际决策影响是"委托任务本身"上的连续反事实量度,替代检索代理;其二,把行为现象翻译成架构语言——“整合失效"落地为"运行摘要稀释 + 注意力查找衰减"双通道,从而工作流修复可以从机制直接推导(定向结构化复述进决策点摘要)而非试错。

八、论文中可以提取的通用性灵感

  1. 代理指标认证的系统能通过它测不到的检验。论文证据:检索 12/12 满分的同时 Use 落入噪声——基于检索的评估会认证判断对已检索事实不敏感的系统。推广场景:代码补全的"语法正确率"认证不了安全缺陷修复;RAG 系统的引用率认证不了引用影响结论;客服 QA 的"知识命中"认证不了问题被解决;任何"中间可验证操作 ≠ 最终委托目标"的场景。

  2. 能力移动失败边界,架构决定是否失败。论文证据:27B 在 128K 保住 9B@2K 水平;同一模型同一文件仅因工作流不同,128K Use 从 0.004 到 0.085。推广场景:买更大的模型 vs 重组信息流的决策权衡;长文档法律/医疗/尽调系统的评估必须报告"整合视野"而不仅是上下文窗口标称值。

  3. 决策邻近表示原则。论文证据:定向+结构化+决策点紧邻+保留原文 = 67% 保留率;缺任一要素(通用预算摘要/逐字原文/替代原文)都失败。推广场景:任何多阶段信息系统的接口设计——把关键事实以"结构化摘要"形式置于消费点,而非指望下游从原始材料重新提取。

  4. 通用预算化摘要在提取阶段驱逐长尾关键信息。论文证据:24/24 单元的披露被逐出合并笔记,连 2K 都不能幸免。推广场景:会议纪要模板会系统性丢弃一次性但关键的承诺;分块摘要处理法律/合规文档时"每个块都不够重要"的条款会全体失踪;多 agent 交接的中间表示设计(与 Constraint Weakening 一文的发现互证)。

  5. 序数先于基数存活:方向感保留、幅度感消失。论文证据:排序 0.93→0.79 而范围压缩 5.6×。推广场景:风险评估系统输出"方向正确但权重压平"的判断,用户以为得到了分级意见实际得到的是二值意见;评估长上下文系统时应分别测排序与幅度。

  6. “读到了"与"用上了"必须分开测。论文证据:同一文档、同一模型,检索调用满分、决策调用零影响。推广场景:教育 AI 的"读过教材"与"用于解题”;Agent 的工具文档检索与工具正确选用;人的注意力研究(本文类比来源)反过来向 AI 系统借用差分测量范式。