DeepChart: How Far are LLMs from Faithful Data-Science Chart Generation? 精读
深度精读中科大与华为的 DeepChart 基准:把数据科学图表生成形式化为 Extract–Reason–Visualize 管线,用 1482 条专家标注实例分阶段评估图表背后的数据路径。核心发现「隐藏幻觉」——提取与推理错误经渲染掩盖,外观评估完全不可见:多模态场景模型可执行率 0.782 但源数据保真 F1 仅 0.149;专有模型选 HTML 渲染优于 Python 却有 99.4% 的实例选了次优的 Python。