论文:TraceMind: Predicting User Information Uptake from Low-Cost Interaction Traces during Human–LLM Content Co-Generation arXiv:2609.12600(2026-09-11 提交,cs.HC) 团队:Yu Mei、Fengyou Zu、Ruiwen Zhang、Zhoutong Ye、Chun Yu、Yuanchun Shi(清华大学);Jie Cai(南开大学);Chang Liu(剑桥大学) 投稿目标:CHI 2027(论文页含会议戳记)

TraceMind 精读:用户到底记住了 LLM 写的什么?

一、题目与背景

人-LLM 内容共创(写公告、招聘帖、讲稿)已是日常,但 AI 生成的信息可以未经用户充分加工就进入最终文稿。当这份文稿被公开(新闻稿、公共通信、在线发布),未加工的信息就成了事故源——记错时间地点的公告、没核对过的承诺。

此前的研究盯的是内容采纳(AI 生成的东西有多少进了终稿)与过度依赖(用户是否不加审视地接受),都在看「内容怎么了」。这篇论文把问题掉转 180 度:用户怎么了——用户对终稿里的原子信息单元是否达到了识别级摄取?定义很干净:任务完成后,用户能否从四个选项里正确认出该单元陈述的内容。这是教育测量学里识别级测验的迁移。

两个前置挑战也被清晰定义:其一,开放任务里评估单元不是预先固定的(每人写出的稿子都不同,单元在交互中动态涌现);其二,交互事件无法直接映射到信息单元——同一信息会改写、会从 Chat 搬进 Draft、会在滚动与重排中不断变化渲染位置。

二、定位:在 HCI 文献谱系里的三处推进

相对已有工作,TraceMind 推进了三条边界:

  1. 从主观测量到性能测量:感知学习、自信度、NASA-TLX 这类自报量表易受回顾偏差与个体校准影响;性能式测量(识别/回忆测试)此前依赖预先固定的评估单元(搜索研究的固定主题、可视化研究的固定数据集),TraceMind 用「从每个用户实际产出中动态抽取原子单元 + LLM 生成识别题」把性能测量带进开放任务。
  2. 从专用传感到低成本轨迹:眼动建模阅读注意力很准,但眼动仪/摄像头在日常部署有硬约束;鼠标键盘轨迹人人都有。此前低成本轨迹研究都在固定单元(页面/段落/HTML 元素)上汇总统计,无法处理信息跨界面迁移重写的动态性。
  3. 从内容采纳到信息摄取:把用户建模的目标从「采纳了什么」转向「摄取了什么」,使系统有可能在发布前标记出「用户可能没真正看过/记住的内容」。

三、问题定义

能否(a)在开放共创中对原子信息单元做识别级摄取评估,(b)仅用低成本交互轨迹预测摄取?操作化:数据侧需要单元级性能标签(不是问卷),建模侧需要把碎片化、跨界面、随布局演化的交互证据组织到「每个信息单元」名下。

四、解法:双轴对齐 + 三路融合

4.1 数据收集(评估目标怎么来)

62 名参与者(18–30 岁,LLM 使用频率均值 4.19/5)随机分到三个日常写作任务(社团团建公告/室友招募帖/讲座预告),在自建平台左右分栏(左 LLM Chat 用 GPT-5.4,右可编辑 Draft)完成至少 1500 字共创,全程 10Hz 采样指针坐标并记录 18 类事件(指针移动/点击/滚动/文本选择/复制/粘贴/焦点切换/30s 空闲/语音输入/文本增删/最终提交……),内容每次变化即存内容+布局快照(块级偏移、行与字素级包围盒),视口变化即存可见性快照。

任务完成后自动出题:终稿切分→按命题分割四准则(良构/自含/单一信息/有稿支持)抽候选原子单元→去语义等价→每单元生成题干+正确答案+三干扰项(五准则:同维度/可信/不重叠/形式匹配/不被终稿支持——健身房不能当「列出哪些设施」的干扰项,因为两个都是对的)→校验修复→按来源位置分层抽样至多 20 题→随机打乱选项位置(对抗 LLM 出题的位置偏差)。产出 1187 个有效单元级标签(识别正确 881 / 错误 306,总正确率 74.22%),每会话平均 17.19 条 chat 消息、33.94 个草稿版本、3525.79 个交互事件、8245.27 张快照。

4.2 双轴对齐(本文最核心的机制创新)

给定终稿中一个目标单元,先做语义对齐找回它历史上所有出现:从终稿支持 span 出发沿 Draft 历史回溯(文本对应 + 复制粘贴溯源),再在 Chat 历史匹配(确定性匹配优先,剩给 GPT-5.4 判官判断改写后是否同义)。再做布局状态对齐:同一语义出现随界面演变有不同渲染条件,把「同界面上下文 + 同文本 + 同可见性 + 近似同包围盒形状」的布局观测合并为一个出现状态——纯滚动合并、文本重排分裂。每个状态保留硬包围盒(目标文本本体)与软包围盒(外扩 ρ,保留框外邻近的指针活动作为注意力证据)。

这一设计的洞察在于把语义身份与渲染几何拆开处理:传统网页交互建模里页面元素同时充当内容标识与空间锚,这个耦合在共创界面里断裂(同一段话会改写、跨面、重排),必须两步分开对齐。消融证明两步都必要。

4.3 三路表示与融合

  • 空间轨迹支路:按状态把指针轨迹归一化到 128×128 六通道热图(密度/驻留/路径/慢驻留/目标邻近/速度,高斯核涂抹 + log 压缩),各状态池化拼接后过带 SE 门控的残差 CNN。
  • 时间活动支路:会话切 512 bin × 44 维(20 维交互上下文 + 16 维事件-目标关系 + 8 维联合特征),三层膨胀 TCN(dilation 1/2/4)+ 掩码注意池化;TCN 先做 18% 掩码 bin 重建预训练再微调。
  • 工作流特征支路:40 维 8 个行为族(Chat 侧反复查看/Draft 侧反复查看/编辑后再看/Draft 编辑修订/复制粘贴迁移/跨面选择/跨面协调/修订前查源),来自两位 HCI 研究者独立回看 15 个试点会话(盲于结果)提炼的可客观计算模式,ElasticNet 逻辑回归。
  • 三支路概率做正权重加权 logit 晚期融合。

五、实验结果

5.1 主结果(5 折按参与者分组交叉验证)

模型AUROC平衡准确率AUPRC_nonmacro-F1
Content&Context+ElasticNet65.0160.5627.1253.00
Conventional Interaction+GBT62.3361.7532.0560.25
Workflow+GBT71.4262.5733.9645.14
LSTM+DNN75.5865.8444.0164.84
Transformer+DNN65.8163.4628.2853.05
ResNet-50+DNN75.0060.0943.1761.73
Mouse2Vec+DNN72.5868.2037.2062.76
Full-Input Early-Fusion DNN76.6858.6245.3659.88
TraceMind81.1780.5849.3473.05

比各指标最强基线提升:AUROC +4.49、平衡准确率 +12.38、AUPRC_non +3.98、macro-F1 +8.21。注意平衡准确率的大幅领先——早融合 DNN 拿同样输入只有 58.62,说明优势不在输入而在「按信息单元组织证据 + 分支结构化」。

5.2 消融(每个设计决策的单独贡献)

  • 去语义对齐(只用终稿锚点):AUROC −8.26、AUPRC_non −16.13——找回跨面跨版本的历史出现是最大单一贡献。
  • 去布局状态对齐(合并为出现级单图):空间支路 AUROC 77.91→74.12,融合后仍 −2.57 平衡准确率。
  • 去 TCN 预训练:融合后平衡准确率 −8.31。
  • 软边界 ρ:ρ=0(只看框内)空间支路 AUROC 崩到 52.77(近随机),ρ=250px 最优,再大无增益——框外邻近活动是有信息量的注意力证据,但太宽引入假关联。
  • Chat-only / Draft-only:Draft 侧单用强于 Chat 侧(75.96 vs 75.49 AUROC),但双面合用再 +5.21/+5.68——跨面证据互补。

5.3 行为分析(比预测器更有价值的发现)

  • 摄取与「内容怎么进来」无关:逐字采纳 73.7% vs 改写后采纳 74.5%(无差异);首次插入时间与摄取无关。
  • 摄取与「之后怎么加工」强相关:无编辑 67.7% → 单次编辑 76.3% → 反复修订 79.4%;末段复查(最后 10% 时间或提交前 120s 内仍有目标交互)显著更高。
  • 高暴露下的分野:暴露时长与主动参与指数中度相关(r_s=.61);高暴露组里高参与 vs 低参与的摄取是 81.8% vs 75.3%(p<0.01)。区分高参与的行为按标准化差排序:重访(1.31SD)、跨面协调(1.24SD)、草稿修订(1.10SD)、出现检查(1.05SD)。
  • 元认知分析:自信度与正确率总体强相关(置信 1→5 对应 10.2%→92.0% 正确),但 102 个高置信回答是错的(占高置信单元 12.3%、占全部错误 33.3%;58.1% 的参与者至少经历一次)。关键在:这 5 个工作流特征显著区分高置信错误与高置信正确——修订前查源更少(0.57 vs 0.99 次)、查源到修订间隔更短(2.25s vs 9.98s)、草稿重访率更低(43.3% vs 56.9%)、访问的不同出现数更少(1.66 vs 2.05)、单元关联事件更少(12.92 vs 15.78)。交互轨迹恰好在自信失效的地方仍有信号。

六、知识反推

  1. 交互证据必须锚定到「语义单元的演化轨迹」而非固定容器。页面/段落/会话这些容器在生成式界面里是流动的;先语义对齐再布局对齐的双轴设计是可迁移的通用模式——任何「用户与动态内容交互」的建模(协作编辑、编程中的 agent 对话、检索式学习)都适用。
  2. 「进入方式不重要、后续加工重要」:这与写作研究中「修改比直接接受预测更好写作结果」的结论同构,但把它推到了信息摄取粒度。对 human-AI 协作的评估,单看采纳率是误导性指标。
  3. 自信不是可靠的摄取代理:1/8 的高置信单元是错的,而行为信号能区分——这说明「主观测量 + 行为测量」的融合比任一单用强,也为无干扰的元认知支持(在自信失效处提醒复查)打开了空间。
  4. 软边界的量效关系:目标框外 250px 内的邻近活动携带信息、更远则是噪声——「bounded target-relative context」原则可直接迁移到任何指针/注意力建模。
  5. 开放任务的性能式评估可以全自动化(动态抽单元 + 约束式出题 + 位置去偏),为 HCI 评估的规模化提供了流水线模板,但论文也诚实说明:无人工验证的 LLM 出题在心理测量学质量上未达专家水平。

七、通用灵感

  • 对 Agent 系统评估:「任务后识别测验」可以直接变成 agent 的摄取评估——多轮工具调用/文档阅读后测 agent 记住了哪些关键约束,比 embedding 相似度更接近可用性;「自信但错误」的检测(模型置信度 vs 行为信号分离)同样适用于 agent 幻觉预警。
  • 对代码评审场景:评审者对 diff 的「摄取」可以被同一框架建模——哪些 hunk 只是被滚过去了、哪些被反复查看与修改;「评审质量」从产出指标(发现 bug 数)扩展到过程指标(对关键变更的证据充分的加工)。
  • 对智能写作产品:摄取感知层可以直接落地——提交/发布前,对摄取证据弱的单元(无重访、无修订、无查源)做软提醒(「这条数据你还没核对过」),保持软性、可检查、隐私自觉(本地处理、最小化采集)。
  • 对hci数据集构建:62 人 × 1187 单元 × 全量布局快照的数据设计(change-triggered snapshot 而非定时截屏)是后续研究可复用的基建决策。

八、局限

论文自陈四点:识别级摄取不覆盖理解/应用/长期保持;LLM 出题无独立人工验证;参与者为中国的高频 LLM 用户群体、任务三种;要求外接鼠标保证采集一致性,触控板/触屏未验证。补充一个我方视角:62 人的数据规模对深度模型偏小(TCN 预训练与正则化正是为此),跨人群泛化(年龄、LLM 熟练度谱系)待验证;GPT-5.4 同时用于 Chat 后端与出题/判官,存在模型同源偏差的可能性未被讨论。

九、一句话总结

内容被采纳只说明它进了稿子,不说明它进了脑子;TraceMind 用「语义出现 × 布局状态」双轴对齐把鼠标轨迹组织到每个信息单元名下,在自信失效的 12.3% 里依然能听见行为发出的警报。