CaSKG:反事实-因果技能图支撑可扩展的 agent 技能检索 —— 精读
论文链接:https://arxiv.org/abs/2608.25500 代码仓库:https://github.com/ZhiyuanLi218/Caskg 发表时间:2026年8月 机构:吉林大学人工智能学院 + 蚂蚁集团——企业+高校合作:一作李志远在蚂蚁实习期间完成本工作,蚂蚁集团(杭州)提供工程场景与共同通讯作者陈红伟,吉大吴元、常毅团队提供学术指导 领域标签:cs.AI —— agent 记忆 / 图检索
一、论文背景
1.1 技能库长大了,检索成了新瓶颈
LLM agent 越来越依赖可复用技能库:Voyager 把可执行技能跨任务存储复用,工具库与 API 仓库持续膨胀。当程序性记忆达到千级规模,中心问题不再是「agent 会不会用工具」,而是如何为当前任务暴露恰当的技能子集而不淹没上下文。
1.2 三种现有方案各有死穴
- 全库暴露:召回最大,但把筛选负担全推给 agent,还引入大量无关选项;
- 向量检索:紧凑,但把技能当独立文本——而一个技能的价值常取决于另一个为它「做准备/做检查/做修复」的技能,文本相似度抓不到这种工作流位置的价值;
- 图检索:让相关性沿技能图传播,能找回文本上不近邻但操作上必需的技能——但它引入新的失效模式:一旦相关性沿弱边传播,检索包的质量就被边决定。主题相似、共现、接口兼容诱导的边「看起来合理」,连接的却可能是可互换的替代品、无序邻居、或操作上不适配的过程。
二、论文定位和关联工作
2.1 谱系
| 谱系 | 代表 | 思路 | 与 CaSKG 区别 |
|---|---|---|---|
| 工具增强 | Toolformer / ReAct / Gorilla / ToolLLM | 学会调用与选择 | 单工具决策,非相互依赖的过程包 |
| 技能复用 | Voyager;ToolRet(证明检索分不预测有用性) | 存储与复用可执行技能 | 确立「需要检索」,未解决检索什么包 |
| 图检索 | Topic-Sensitive PageRank、GraphRAG、HippoRAG | 查询偏置的图传播 | 面向知识语料;边可靠性问题未处理 |
| 工具/技能图 | ToolNet、Graph-of-Skills (GoS)、GraSP、SkillReranker | 工具图/依赖感知图/前置-后件建模 | 边来自转移记录、依赖标签、相似度——「关联」而非「验证过的依赖」 |
| 因果检索 | Causal Graph RAG、CausalRAG | 因果结构进检索 | 面向知识问答;CaSKG 面向可执行技能的过程关系 |
CaSKG 的问题化本身是贡献:不是「建更大的图」,而是技能图构建 = 预算约束的边置信度校准问题——全发布则弱边污染传播、狠剪枝则路径不可达、穷举有序对随库平方增长不可行。
三、问题定义
具体问题:从千级技能库中为当前任务取回紧凑且可执行(保序、含前置依赖)的技能包。
核心洞察:「两条技能相关」与「A 操作上支持 B」是两回事。判断后者要做反事实:如果拿走 A,B 会不会受影响?换成别的技能行不行?顺序反过来行不行?——这是因果推断中必要性/特异性/方向性的经典三问,翻译到技能文本上就是三个可控探针。
| 类比 | 因果推断 | CaSKG |
|---|---|---|
| 关联 | 观察性相关 | 多信号候选分数 A_ij |
| 干预 | do(移除处理) | removal 探针(删源技能) |
| 反事实 | 换一种处理会怎样 | substitution 探针(换低重叠技能) |
| 方向 | 因果方向检验 | reordering 探针(逆序) |
形式化:给定技能库 S 与高召回候选边集 C ⊆ S×S,在验证预算 |F| 内为选中的边估计方向化可靠度 c_ij,按阈值赋状态(confirmed/uncertain/rejected/unvalidated)门控发布加权图 G_pub;运行时个性化 PageRank 从查询种子沿 G_pub 扩散取回技能包。约束:离线建图、不改下游 agent 策略与任务接口。
四、问题解法
4.1 四阶段管线
阶段一:多信号候选诱导(要召回)。词法、语义、输入输出接口、结构位置(工作流角色)四类主动信号取加权平均(外加结构保底:结构分超阈值时撑住下限),可选修复证据与 LLM judge 精修分数;并预留轨迹共现与历史关系两个通道给未来自进化库。产出高召回有向候选图(Skill1000 下 9,937 条候选边)。
阶段二:方向条件化反事实探针(要可靠)。对预算内每条边 (s_i→s_j) 做三探针,LLM 打分 e∈[0,1]:
- 移除(必要性):删掉 s_i,s_j 受损吗?
- 替换(特异性):把 s_i 换成低重叠技能 e_si,s_j 退化吗?
- 逆序(方向性):倒转 s_j→s_i,工作流还连贯吗?
阶段三:Beta 平滑与状态门控发布(要稳健)。三探针分数转成 Beta(α,β) 累积:以 0.5 定极性、离中点距离定证据量(设最低证据地板防中间判断被忽略),得平滑可靠度 c_ij = α/(α+β)。对称阈值 τ_c 赋四态:confirmed 全权发布、uncertain 降权(ρ_unc)、rejected 删除、unvalidated 留限量的低权 scaffold(ρ_scaf 保覆盖)。发布权重 = max(发现支持, 反事实支持, 地板) × 状态门控系数。候选阶段宽、发布阶段严。
阶段四:任务条件化检索。查询的词法/语义匹配产生种子分布 π_q,个性化 PageRank 迭代 p(t+1) = γ·π_q + (1−γ)·T^⊤p(t)——重启项锚定任务、经校准的边权决定相关性往哪传、传多强。图在评测前冻结。
五、评估指标与实验证据
5.1 设置
ALFWorld ID-140(140 个家务任务,成功率%)与 ScienceWorld U211(211 个科学任务,官方 best score,非百分比),冻结的 Skill1000 库,6 个骨干:MiniMax-M2.7、GLM-5.2、Kimi-K2.6、Qwen3.5-397B-A17B、DeepSeek-V4-Flash、GPT-5.6-Luna。基线四档:Vanilla(全库)、Vector(独立向量检索)、GoS(图检索 SOTA)、CaSKG。同时报告平均环境步数(越低越好)。
5.2 主结果:12/12 全第一
宏平均:ScienceWorld 72.62(GoS)→80.50(+7.88)、ALFWorld 80.01%→86.79%(+6.78pp);对 GoS 的分模型增益:MiniMax ScienceWorld +12.48、DeepSeek-V4-Flash +9.95、MiniMax ALFWorld +9.97pp。步数在全部 12 个模型-基准组合中低于 GoS(ScienceWorld 宏均 16.39→15.29)——分数增益不是靠更多交互换的。
一个反常但极有说服力的数据点:GPT-5.6-Luna(最强骨干)上 Vector(55.00%)与 GoS(60.71%)反而低于 Vanilla(72.86%)——未校准的图传播比全库暴露更糟;而 CaSKG 恢复到 75.71% 全场最高。这直接证明:结构检索只有抑制误导边才有益,否则比不检索还差。
5.3 消融与规模
组件消融(MiniMax, ALFWorld, Skill1000):完整 73.57% > 全候选发布 71.43%(发布 9,937 条 vs 选择性 3,292 条——同一候选集下反事实校正+状态门控 +2.14pp)> 无 judge 71.43% > 仅语义候选 67.14%(多信号阶段贡献 +6.43pp)。规模实验 200→2000 技能各档全胜 GoS(500 技能档最大 +22.86pp)。
5.4 任务类型与轨迹证据
ScienceWorld 24 个任务类型中 21 个为正增益,最大增益集中在多步依赖操作类:三级颜色混合 +34.6、次级混合 +31.7、植物生长 +19.1、未知导电性 +18.6——需「备料→变换→观察→归类」完整链的任务;两个负增益任务(非生物搜索、温度测量)是直接检索/测量类——图扩展无优势还偶尔分心。轨迹案例:导电性测试任务中 CaSKG 取回「导电测试+电路构建+材料分类+最终放置」完整依赖链,100 分 24 步完成;GoS 因无关工具入包在修复连接命令上耗尽预算(55 分 30 步),Vector 语义检索给的几乎全是不相关技术工具(5 分)。
六、效果优势的根源解释
为什么校准边置信度能带来全面增益?因果链:
- GoS 的根本局限:边由关联性诱导(相似度/共现)→ 一旦传播启动,弱边把相关性送进无关或操作不适配的技能 → 检索包含「看起来相关」的噪声 → agent 在探索/纠错上烧步数。GPT-5.6-Luna 上图检索低于全库的「翻车点」是该机制的极端显影。
- CaSKG 的机制改变:反事实三探针把边的语义从「主题相似」改写为「操作依赖」(移除即受损=必要;换掉即退化=特异;逆序即失谐=有向)→ 传播只沿验证过的过程关系走 → 检索包保留「前置→状态变更→验证→收尾」完整链(轨迹案例直接可见)→ 得分升、步数降(不需要试错)。
- 两个消融各自钉死一段因果:全候选发布 vs 选择性发布(同一候选集,+2.14pp)证明收益来自校准而非图的密度;仅语义候选 vs 多信号(+6.43pp)证明候选阶段也需要工作流/接口证据——两阶段缺一不可。
- 任务类型分布是机制的指纹:增益集中在依赖链长的任务、消失于单步任务——如果增益来自别的因素(如上下文长度),不会呈现这种选择性分布。
七、必要知识反推
- 领域知识层:agent 技能库生态(Voyager 到 GoS 的演化);交互式基准的任务结构(ALFWorld 的状态跟踪、ScienceWorld 的准备-操作-观察-分类链);embedding 检索的原理与已知失效模式。
- 方法论知识层:因果推断三问(必要性/特异性/方向性)与文本反事实探针的构造;Beta 先验平滑对小样本证据的稳健化;personalized PageRank 的查询锚定传播;预算分配下的「先召回后校准」两段式设计。
- 工程知识层:离线建图与在线检索的解耦(不碰下游 agent 接口,使方法可插拔);状态门控的四级权重系数;冻结评测协议(同任务队列、同提示、同 30 步限制)。
知识融合的关键节点:把因果推断的反事实检验(通常用于科学发现或解释性分析)第一次搬进检索系统构建——不是用 LLM 判断「相关吗」,而是问「拿走会怎样」。第二个节点是「候选宽进、发布严出」的闸门设计:把召回与精度的矛盾拆到两个阶段各自解决,Beta 平滑给中间证据留出概率化的容身之所。
八、论文中可以提取的通用性灵感
图结构系统的质量瓶颈在边而不在点——先校准边再让信号传播。证据:同一候选集下选择性发布 +2.14pp;GPT-5.6-Luna 上未校准图低于全库。推广:知识图谱问答、社交推荐、供应链依赖分析——凡「信号沿边传播」的系统,边可靠性工程都是第一优先级。
判断「A 是否支持 B」的最有力问题是反事实三问:拿走会怎样、换掉会怎样、反过来会怎样。证据:三探针组合撑起全部校准收益。推广:评估团队成员依赖关系(离开谁项目瘫痪)、判断文档章节依赖、API 兼容性分析——关联统计给不出方向与必要性,反事实能给。
召回与校准分两段做,各自的信号不同。证据:候选阶段需要工作流/接口证据(仅语义掉 6.43pp),校准阶段需要反事实证据。推广:人才筛选(宽进用硬指标、严出用结构化面试)、内容审核(宽召回靠规则、精判靠多探针复核)。
未验证的信息不是负证据,应以低权重保留为脚手架。证据:unvalidated 边以 ρ_scaf 低权发布保覆盖而非删除。推广:个人知识管理(存疑笔记降权保留)、风控规则库(未验证信号做软特征)、探索性数据分析。
指标的功效在于其选择性分布:增益落在机制预测的地方才算证据。证据:增益集中于多依赖链任务、消失于单步任务、两个负例任务恰好是无依赖链的。推广:任何方法论文的实验设计都应包含「机制预测应该无效/负效的场景」——负结果的分布形状与正结果同样有信息量。
局限:探针本身是 LLM 自评(无真实执行验证边)、静态库构建(自进化通道只是预留接口)、两基准均为模拟环境。但「边置信度校准」作为可扩展 agent 记忆的设计原则已被干净地证明——当你的技能库长到一千条,「哪些关系配影响检索」这个问题,值得反事实一问。