DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces —— 精读

论文链接:https://arxiv.org/abs/2608.03451

代码仓库:https://github.com/HKUSTDial/DataSpace(MIT License)

数据集:https://huggingface.co/datasets/HKUSTDial/DataSpace

提交时间:2026年8月4日(arXiv:2608.03451v1,cs.AI)

发表机构:香港科技大学(广州)HKUST(GZ) × 清华大学。第一作者Boyan Li等九位共同一作来自HKUST(GZ),清华大学方面由Yuan Li与Guoliang Li参与,通讯团队含Nan Tang、Yuyu Luo——典型的校企/校际合作,也是国内数据智能体方向最活跃的团队之一。

特别备注:DataSpace 是 KDD Cup 2026 “Data Agents for Complex Data Analysis” 竞赛的官方评测基准,目前已公开410个任务输入,其中60个代表性任务附带参考答案与评测配置供本地端到端评测,其余350个参考答案保留用于官方全量评测。


一、论文背景

1.1 数据智能体面对的真实世界:证据不在一张表里

想象一个组织里的真实分析场景:风控分析师问一句"哪些基金跑赢了2023年同类基准,还触发了视频里定义的回撤警报?"。要回答这个问题,需要的东西散落在四面八方——基金代码和类别映射躺在JSON文件里,2100多行的基金主数据是CSV,2022到2023年的每日净值锁在SQLite数据库中,90多页的PDF报告写着各类别基准收益率,8分17秒的短视频用旁白交代了"最大回撤不超过12%“的警报规则,还有一份5万多字符的Markdown知识文档垫底。

这就是论文对"组织工作区"的刻画:工作区就像办公室里散落的档案柜、便利贴和录像带——数据智能体(data agent)的任务不是在一张干净的表上跑SQL,而是像一位人类分析师那样,先翻找、再阅读、再看录像,把不同载体的信息对齐、拼接、计算,最后交出一张完整的表格。

论文把这样的智能体定义为"工作区求解器”(workspace solver):检查可用数据、选择数据源与工具、跨表示对齐信息、执行多步计算、返回用户可直接使用的结果。这五个环节缺一不可,而现有基准恰恰只考察了其中一部分。

1.2 现有基准的三条谱系与各自的缺口

论文系统梳理了三类基准,指出它们各自覆盖了真实场景的一个侧面:

结构化数据谱系:从表格问答WikiTableQuestions,到Text-to-SQL的Spider、BIRD,再到面向企业工作流的Spider 2.0,以及本文直接用作语料的临床EHRSQL与金融BULL。这条线的优点是SQL可执行、评测确定,但相关表或数据库通常提前指定,考不到"在杂乱工作区里找证据"。

非结构化数据谱系:HotpotQA、CRAG考多跳检索,MMLongBench-Doc与FinanceBench考长文档理解,Video-MME考视频。这条线考证据定位与跨页推理,但输出多为事实型短答案、选项或自由文本,很少要求"从长文档恢复出带类型的记录集合,再与其他数据合成完整表格"。

数据智能体谱系:DABStep、KramaBench、LongDA、DataCross、FDABench等已相当接近真实工作区,FDABench甚至已覆盖文档与媒体。但它们的任务契约五花八门——有的考事实型答案,有的考可执行管线,有的考选择题或报告,配套评测则是执行式、评分表式或LLM裁判式,无法在同一把尺子下横向比较。

一句话总结现状:异构证据发现、完整表格输出、确定性评测这三件事,分别有人在做,但从没有人在一个基准里同时、统一地要求过。DataSpace要补的就是这个空位。


二、论文定位和关联工作:三要素框架

论文的巧妙之处在于提出了一个三层层级框架,把"真实数据分析"拆解为三个可逐条检验的性质,并据此对现有基准做了一次全面体检(对应论文Table 1):

层级性质含义代表基准的表现
L1 工作区范围跨工件与发现、长文档、文档→记录、跨语言任务工作区横跨结构化文件、数据库、长文档与多媒体;问题与数据本身可混用中英文FDABench覆盖最全(DB/文件/文档/媒体均✓)但不跨语言;DataCross跨语言却无媒体;长文档→记录喂给下游分析这条链只有DataSpace要求
L2 输出契约完整表格每个任务都要求返回完整分析结果表,而非事实片段、管线或开放式报告结构化谱系天然满足;HotpotQA等考factoid;DABStep/LongDA部分满足;无基准全线强制
L3 评测语义模型无关(无LLM裁判)、模式不变(表头措辞或列序不影响判分)确定性评测:接受等价表示,拒绝不完整或错误答案Spider/BIRD满足;数据智能体谱系多用执行/评分表/LLM裁判,难以统一

对照检查后结论清晰:现有每个基准最多占住三要素中的一到两个,DataSpace是第一个三项全满的基准——410个任务、六个模态,全部要求完整表格输出,全部用同一套确定性评测协议判分。这个定位不是"加个视频凑模态"式的增量,而是把三类谱系的优点拧在一个任务契约下。


三、问题定义:数据智能体=工作区求解器

论文用三组式子把任务形式化得非常干净。

输入(式1):任务 $i$ 的公开输入是 $x_i=(q_i, W_i)$——一个自然语言问题加上一个任务本地工作区。工作区 $W_i = W_i^{str} \cup W_i^{doc} \cup W_i^{med}$,分别涵盖结构化/半结构化工件(CSV、JSON、SQLite)、文档工件(Markdown、PDF)与媒体工件(视频)。智能体初始只能看到问题和工作区根目录,工件内容要靠交互逐步获取——这个设定逼出了"发现"能力。

动作空间(式2):$A_A = \{Call(\tau,\theta): \tau \in T_A\} \cup \{Answer(Y)\}$。智能体要么调用工具(文件检查、结构化解析、SQL执行、代码执行、文档抽取、视频理解),要么执行终止动作 $Answer(\hat{Y}_i)$,把表格结果序列化为CSV提交。策略 $\pi_A$ 基于历史 $h_t$ 与工作记忆 $m_t$ 决定每步动作。

计分(式3):基准侧记录 $b_i=(x_i, Y_i, c_i)$,包含输入、参考答案与一个紧凑的评测配置 $c_i$(记录每列的语义类型、数值比较规则、行序是否重要)。任务得分是二值的:$s_i = 1[\hat{Y}_i \equiv_{c_i} Y_i]$。关键在于"等价"的定义:缺一行、缺一列都算错,哪怕已返回的值全部正确。这个设计直指数据智能体最实际的要求——用户要的是能直接用的完整结果,不是"答对了大半"。

任务耦合四种能力:工作区发现、类型/模式/实体/单位/语言的解释与对齐、以过滤/join/聚合/排序/时序为代表的关系计算、完整表格物化。410个任务覆盖金融(158题)、股票(120题)、宏观经济(85题)与医疗(47题),中英文可同时出现在同一任务的问题与工件里。


四、问题解法:DataSpace-Builder 四阶段构建 + 确定性评测器

怎么才能既造出异构工作区、又保证每道题有唯一正确的"金表格"?论文的答案是执行接地(execution-grounded)构建:从两个带可执行SQL的英文Text-to-SQL基准(EHRSQL、BULL)出发,让每道题的参考答案都由SQL在数据库上真实执行导出,而不是靠人写或LLM生成。

4.1 四阶段流水线

阶段一:跨语言联合变换。 不是简单翻译问题,而是把"问题+数据库状态+可执行SQL"当成一个三元组联合迁移。团队先按外键、同名列或值重叠把相互关联的列聚成簇,整簇统一翻译,标识符、代码、URL、日期、数字保持不变;所有翻译以表级/列级/单元格级的替换映射 $M$ 物化保存,再用 $M$ 确定性重写数据库与SQL。这样"病人/就诊日期"无论出现在哪张表、哪段SQL里,译名都严格一致。变换后必须通过执行等价校验(改写SQL在译后库上的执行结果与源结果经值翻译后一致),另加LLM裁判验证问题与SQL语义对齐,两关全过才放行。

阶段二:约束感知关系采样。 源数据集往往几十道题共用一个小库,直接复用会让工作区千篇一律。Builder在保留完整表清单与模式的前提下对每张表采样行,构造任务本地的新数据库实例。朴素采样会弄丢条件值、打断join路径,所以先从SQL AST提取四类保护对象(谓词绑定、查询关系、边界值、目标实体)加入安全集,采样时先钉住锚点行,再沿外键做关系闭包传播,最后按预算随机补齐。采样后重新执行SQL,$Y_s = Exec(D_s, \sigma_c)$ 就是候选参考答案——注意不要求等于源库的答案,采样改变了实体与聚合值都没关系,只要SQL能跑、关系完整、结果不退化即可。这保证了每道题的"金表格"确实是这个具体工作区的真值。

阶段三:模态路由与工件渲染。 中间数据库定了"内容",这一阶段定"形态"。基于种子的规则策略按模式属性与兼容性给每张采样表分配一种或多种渲染器:扁平表可出CSV或JSON,带键关系的表组可进SQLite,被选中的表走长文档生成器。长文档生成有一套"事实接地"机制:先由LLM规划文档体裁、锚列与属性簇,把行分批成块,每块重复锚列以保证文档不同段落还能join回去;每个非空源单元格有内部ID,验证器逐格核对数字精度、日期、单位、类别值是否可从文档中恢复,失败块带反馈重生成。视频是任务级增强:从SQL AST与候选答案中提取类型化的"证据原子"(过滤条件或结果单元格),两种策略二选一——谓词抽象把一个条件(如"持仓占比≥5.00%")从问题里删掉,改由视频中的配置面板场景表达;答案证据渲染则把紧凑结果拆进多个画面场景。任务193就是典型:监控的证券代码600180与触发阈值5.00%都只出现在视频里,智能体必须"看懂录像"才能写出正确的过滤条件。

阶段四:人工审核与任务修复。 自动校验保证"数据与SQL一致",但保证不了"题目无歧义、金答案唯一正确"。每个候选任务由11人专家组的两位评审盲做——先只凭问题与工作区独立解题,提交后揭开金答案核对,并各自独立撰写评测配置。两者对金答案达成Match、处置为通过、且规范化配置完全一致才算共识;任何分歧都要走证据化讨论与最小修复,修完同一对评审再盲核,循环到达成共识,达不成的任务直接剔除。

4.2 确定性评测器:容错但对错的阅卷老师

评测器的设计哲学可以概括为"像一位宽容但绝不放水的阅卷老师":书写习惯上从宽,对错标准上从严。判分走三层:

  1. 表头不变列对齐:预测表的表头不参与打分,评测器在参考列与预测列之间搜索一一映射——列序不同、表头措辞不同都不影响,但每个预测列的单元格必须能被所映射参考列的规则解释,且对齐在全表层面进行,行内值的关联不能拆散。
  2. 类型与精度感知归一化:每列按冻结配置归一——文本走Unicode NFC与修剪,数值按配置的整数/小数位/有效数字精度四舍五入后比较,还处理百分比约定(3.5%在percentage_points模式下是3.5,在fraction模式下是0.035)、日期时间ISO化、布尔与空值的规范表示。
  3. 顺序感知行比较:题目要求排序的任务(92题)按行序列比较,其余按无序行多重集比较(保留重复行重数)。形状不同直接判错。

4.3 为什么执行接地是点睛之笔

四个构建阶段环环相扣,但真正的杠杆是"SQL可执行"这个起点:它让参考答案由执行导出而非人工标注,天然避免了标注不一致;它让跨语言变换可以自动做执行等价校验;它让视频增强能从AST提取类型化证据原子;它也让评测器有明确的类型与精度依据。整套构建的可复现性由内部台账(种子、预算、重试史、答案哈希)保障,构建成本方面跨语言变换每任务仅$0.000189,文档渲染$0.92/任务,视频渲染约$0.58/任务(不含专家审核)。


五、评估指标与实验证据

主指标只有一个:Task Accuracy(式9),410个任务的二值得分均值。执行协议统一为:60个模型轮次、50次工具动作、1800秒时限、4 CPU/16 GiB内存、无网络访问、单次调用输出上限32768 token;缺提交、非法输出、超时、超预算一律计错。所有推理经Vercel AI Gateway以各厂商默认推理配置调用。实验设计是漂亮的双控制变量:backbone对比固定自研轻量harness(DataSpace-Agent,ReAct范式,仅bash/view_image/submit_answer三个工具),六模型轮换;harness对比固定MiMo-V2.5,五框架轮换且保留各自原生的规划、工具与上下文管理。

5.1 主结果(对应论文Table 3)

Backbone(DataSpace-Agent固定)快照正确数/410Acc.
Grok 4.52026-0727266.34%
GPT-5.6 Sol2026-0726564.63%
Kimi K32026-0721953.41%
MiMo-V2.52026-0416139.27%
Claude Sonnet 52026-0613532.93%
MiniMax M32026-0611728.54%
Harness(MiMo-V2.5固定)版本Acc.
Grok Buildv0.2.10646.34%
Claude Codev2.1.21744.63%
DataSpace-Agent—39.27%
Codexv0.145.034.88%
Smolagentsv1.26.030.98%

Finding 1(未饱和):最好的Grok 4.5也只有66.34%,最强与最弱backbone相差37.80点;六模型并集(oracle)解出334题(81.46%),76题全军覆没,56题全部做对——基准既有公认的硬核,也藏着被总分掩盖的模型间互补。

Finding 2(效率-精度Pareto):GPT-5.6 Sol仅落后Grok 4.5七题(1.71点),却省74.2% token、50.3%工具动作、39.2%墙钟延迟,与Grok共同构成token/动作/延迟三条Pareto前沿。成本前沿另有一支:MiMo-V2.5每任务仅$0.011(39.27%),而Grok为$0.169、GPT为$0.200——追求性价比与追求最高分是两条不同的曲线。另有一个反直觉观察:六个模型中五个在错题上消耗的token是正确题的1.2–3.2倍,“探索更长"往往意味着"没能收敛"而非"解出了更难的题”。

Finding 3(harness与backbone同量级):固定MiMo-V2.5只换harness,从Smolagents的30.98%到Grok Build的46.34%,相差15.36点——而换backbone的极差是37.80点。框架选择对端到端表现的影响,与模型选择处在同一量级,这对"只卷模型不卷框架"的工程惯性是有力提醒。

5.2 切片分析:短板在哪里

按基准标注对六条DataSpace-Agent运行做切片(描述性而非因果):

  • 证据类型:多模态任务(需组合两种以上模态的134题)对所有六个backbone一致降分1.8–14.0点;文档证据让MiMo掉16.6点、MiniMax掉14.9点,但对GPT/Kimi几乎中性;视频证据帮助GPT(+11.2)与Kimi(+5.7),却拖垮MiMo(-9.6)与MiniMax(-11.7)。一致的挑战在"跨模态整合"而非任何单一模态。
  • 语言:跨语言影响分化明显,MiMo -11.8、Grok -5.1,而GPT +6.1、Claude +7.2——没有统一结论,取决于模型的跨语言对齐能力。
  • 关系操作:join是唯一对所有模型一致降分的操作(-9.7到-19.8);聚合则多数模型受益或持平。
  • 规模:最大工作区四分位对小四分位全线降分,最狠的Claude -35.9点;但四分位间并非单调,任务级相关仅-0.186——“更大"不必然"更难”,“怎么组合"比"有多大"更关键。
  • 答案形状:多列、顺序敏感任务整体不降反升,说明输出契约本身不是主要难度来源。

5.3 错误分析:错在"最后一公里”

对Grok 4.5全部136个失败任务的trace级人工审计揭示了出人意料的分布:物化(M)占52.2%(71/136),其中60个失败是内部结果已经算对、提交时多列或少列(M1);意图误解(Q)占22.8%,其中17个是错误理解请求的输出或行粒度。这两条通往"答案模式出错"的路径合计77/136(56.6%)。相比之下,选错证据源仅3例,抽取+接地合计21例——找到工件不等于把值恢复并对齐正确,而算对值更不等于把答案按契约交出来。评测器症状也证实"症状≠诊断":74个列数不匹配中58个源于物化,其余溯源自意图、抽取、接地或计算;13个未提交中仅5个是纯执行控制失败,另外8个背后是更早的持续性错误。论文将此总结为Finding 4:harness必须忠实物化精确请求的输出,而不是仅仅找到并算对相关数值。


六、效果优势的根源解释

为什么最好的模型也只能解三分之二? 切片与错误分析指向同一个深层瓶颈:跨模态对齐。解一道"视频条件+SQL查询"的题,要求模型把视频画面里的"5.00%阈值、≥方向"与SQLite里lc_sharefpin表的PCTOfTotalShares列建立实体与单位的映射,再把PDF里提取的类别基准与CSV里的基金收益join起来——这是在不同表示之间显式建立键与单位的对应关系,而非在单一表示内部推理。当前多模态模型擅长"看懂画面"和"写对SQL",但在表示间做系统化对齐(论文能力清单第ii项)上明显薄弱,所以多模态任务一致降分、join一致降分——join本质上是关系级对齐,与跨模态对齐共享同一块能力短板。

为什么换harness能拉出15点,与换模型的量级相当? 因为多步智能体任务里,harness决定的是工具编排、上下文裁剪与提交格式化这些"结构性"决策。一个物化环节薄弱的框架,会让backbone算对的结果在最后一步丢列;而错误分析显示这恰是最大失败来源(56.6%)。换言之,harness级的缺陷会级联放大backbone的能力——再强的模型装在漏水的管道里,交出的表格照样缺行少列。DataSpace用"完整表格"契约把这种管道损耗从总分里暴露出来,这是开放报告式评测永远做不到的。

为什么oracle并集81.46%但全灭题有76道? 两者相加恰好说明剩余难度是两种成分:一小部分是所有模型共同的能力缺口(大概率集中在跨模态对齐+join的组合上),一大部分是模型间高度互补的失败——这与"切片效应因模型而异"(视频帮GPT却坑MiMo)互相印证,也提示多模型协作或按任务特性路由的实用价值。


七、必要知识反推

想真正吃透这篇论文并复用其方法论,以下三层知识是必备的:

领域层:Text-to-SQL谱系的演化(Spider→BIRD→Spider 2.0,以及EHRSQL/BULL这类垂直领域基准)与数据分析的完整流程(发现→对齐→计算→物化)。不理解"为什么SQL可执行是宝贵资产",就体会不到执行接地的巧劲。

方法论层:执行接地构建——用可执行逻辑导出真值并沿途做执行等价校验;约束感知采样——从SQL AST提取谓词绑定、join路径、边界值做保护集,再关系闭包传播;确定性评测设计——列对齐、类型精度归一化、顺序感知行比较三层协议,以及"冻结配置"避免事后调参;人工审核协议——双人盲解、独立配置、证据化裁决、版本化修复。

工程层:六模型五harness的适配细节(所有模型角色含子代理都映射到同一backbone、禁用fallback);成本控制(跨语言用Qwen-Plus只花$0.000189/任务,文档用Gemini 2.5 Pro生成+GPT-4o校验);统一推理出口(Vercel AI Gateway)保证六模型调用协议一致;无网络沙箱与每任务资源上限的公平执行设计。


八、通用性灵感

跳出数据智能体评测本身,这篇论文有四条可迁移的方法论:

(1) 执行接地构建。 只要有可执行逻辑(SQL、代码、单元测试),就能让基准的真值"由执行导出",把最昂贵、最易出错的人工标注变成自动校验。任何需要确定性评测的基准(代码生成、数据分析、工具调用)都能套用这一范式,甚至可以像本文一样进一步做变换(跨语言、改模态)——只要每步变换后重执行、重校验。

(2) 输出契约统一。 “完整表格"这个单一契约是全基准可比性的根基:它让410道异构任务在同一把确定性尺子下排序,让"缺一列也算错"这种严格但公平的标准可执行。设计评测时先想清楚"什么算对”,比堆任务数量重要得多。

(3) 双控制变量实验。 backbone固定换harness、harness固定换backbone,两个正交实验各自量化一层的影响量级(15点 vs 38点)。任何"模型×框架"复合系统(RAG、编程助手、GUI智能体)都值得做这样一次解耦,结论往往会推翻"模型决定论"的直觉。

(4) 切片诊断优于总分。 按证据类型、操作类型、语言、规模切片后,“视频帮GPT坑MiMo、join坑所有人"这样的结构化结论才能浮出水面——总分告诉你谁更强,切片告诉你往哪改。配套的trace级根因审计(症状≠诊断,58/74的列数不匹配其实错在物化)更是把"该修模型还是该修框架"这个工程决策直接摆上台面。


附录:数据与工件速览

  • 规模:410任务(BULL来源363个、EHRSQL来源47个),7439个工件,15.01GB,13种模态组合;中位每任务20个工件、31.26MB。
  • 长材:1088个PDF共25384页、2848万字符;875个Markdown文件共2688万字符;189个视频合计5.49小时(39.1–158.3秒/条)。
  • 答案:参考答案共126409行,最大单表12962行、最宽6列,92题要求保序;跨语言任务265个(64.6%)。
  • 证据需求:验证解路径中67.3%任务用单一模态,32.7%跨多模态;49.3%的任务需要文档或视频证据;操作上投影82.4%、过滤78.3%、排序51.0%、聚合35.6%、join 27.6%,每题组合2–11种操作(中位5种)。