论文链接:Inducing Task Models from Computer-Use Traces 代码仓库:Yucheng-Jiang/task-model-induction 发表时间:2026年8月 机构:Stanford University + Carnegie Mellon University

Inducing Task Models from Computer-Use Traces 精读

想象一个新入职的助手 agent,被部署到一位产品经理的电脑上。它面前只有一样东西:这台电脑积累下来的使用记录——一段段截图流,加上伴随的鼠标点击与键盘输入。没有任务说明书,没有标注,甚至没有"这是一项任务"的边界标记。它要做的第一件事,是把"这位 PM 的工作究竟是怎么完成的"搞明白。这篇论文研究的,正是如何从这样的被动记录中,提炼出结构化、可审计、可复用的任务模型。

一、论文背景

计算机使用 agent 的兴起

随着大模型能力从"对话"走向"操作",**计算机使用 agent(computer-use agent)**成为近两年最受关注的方向之一。这类 agent 不再只回答问题,而是直接操作图形界面:看截图、移鼠标、点按钮、填表单,替人完成真实工作。“让 AI 用电脑"已经从演示走向日常。

但一个 agent 真正进入某个组织、某台电脑、某份具体工作时,马上会遇到一个很少被讨论的问题:**这项工作实际上是怎么做的?**同一句"建一个用户研究网站”,不同组织有不同的做法:用哪个工具、先做什么后做什么、出错了怎么恢复。agent 若只靠通用常识去执行,往往做得"对但不合适"。

被动轨迹:一座未被开采的富矿

论文的出发点是:这类知识的最大载体,恰恰是自然计算机使用轨迹(natural computer-use traces)——人们日常工作中被动录制的截图流加上鼠标键盘动作序列。这类数据天然存在、规模巨大,蕴含的是"工作实际怎么完成"而非"文档声称该怎么完成",却完全未被结构化——只是低层事件流。

绝大多数专业知识从未被文档化——这是知识管理领域的老问题:老员工离职带走操作诀窍,新员工靠口口相传和试错补课。组织需要审计"工作到底怎么做的"(合规、安全、效率),也需要复用这些知识(培训、自动化、交接)。被动轨迹把这些问题第一次变成了可计算的对象:若能把轨迹中的隐性知识提炼成显式模型,专业知识就有了可沉淀、可检查、可传承的形态。

现有方法的缺口

此前处理这类轨迹的方法主要有两支。过程挖掘(process mining):业务流程管理领域的经典方向,从事件日志中挖掘工作流模型(如 Petri 网),但假设事件已被结构化标注(每个事件属于哪个流程实例已知),且面向企业系统日志级的抽象事件,而非原始截图与鼠标键盘流。UI trace 理解与轨迹摘要:近年用 LLM 理解 UI 操作记录的工作,但大多假设任务边界已知,且产出步骤级的自然语言摘要——“用户先打开了浏览器,然后点击了……"。摘要能帮人看懂发生了什么,却回答不了"任务的目标结构是什么"“执行遵循什么控制逻辑”。

更棘手的是真实工作的基本特征:多线程交织。写报告写到一半去回邮件,回完继续写,中途又插进一个临时任务——轨迹里混着多条并发任务线,边界从不显式标出。两个缺口合起来就是论文动机:在无约束、多任务交织的被动轨迹上,产出结构化任务模型——而不是步骤摘要。# 二、论文定位和关联工作

三条相关研究路线

路线一:步骤级摘要方法。用(多模态)LLM 逐段阅读 UI 轨迹,输出发生了什么的文字描述。局限在于:叙述不是模型——没有可执行结构,无法回答反事实问题(“出错了该怎么重试”),无法被程序化复用,也无法审计其正确性。

路线二:工作流挖掘(workflow induction)。从 agent 自身轨迹中挖掘可复用工作流。这类工作通常假设轨迹是 agent 在给定任务下产生的(任务已知),且往往是单一工作流。产物是"一条流程”,而非"一组任务各自的结构"。

路线三:技能诱导(skill induction)。以 Voyager 为代表的路线让 agent 在探索中把成功经验总结为技能,存入技能库供后续调用。它证明了"把经验沉淀为可复用单元"的价值,但技能依赖主动探索——agent 自己试出来的。而被动轨迹是别人的操作记录:没有任务标注、没有成功失败信号、多任务混在一起,Voyager 式的"做了-总结-入库"无法直接套用。

本论文的位置

维度步骤级摘要工作流挖掘技能诱导TMI(本文)
轨迹来源任意多为 agent 自己agent 主动探索被动录制,无约束
任务是否给定通常给定给定或单一给定不给定,需自己发现
多任务交织不处理通常单工作流不处理解缠为独立潜任务
产物形态文本叙述流程结构技能单元双模型(目标层次×控制流)
可审计/可复用弱/弱中/强弱/强强/强

定位结论:TMI 是首个从无约束自然计算机使用轨迹中诱导结构化任务模型的工作。它与摘要路线的区别是"叙述 vs 模型",与工作流挖掘的区别是"任务给定 vs 任务发现",与技能路线的区别是"主动探索 vs 被动提炼"——而它最终又能把任务模型投影回技能,反哺第三条路线。

三、问题定义

从具体场景到抽象问题

具体场景:给定一段某人(或某 agent)使用计算机的被动录制轨迹——低层事件流(截图 + 鼠标键盘动作),没有任何任务标注。论文把这件事抽象为一个从低层观测到符号化知识的反演问题:

给定:无约束的低层事件序列(截图、点击、输入),混杂着未知数量的并发任务线。

求:(1) 轨迹中潜藏的任务划分——哪些事件属于同一项工作;(2) 每个潜任务的任务模型,由两个互补的符号结构组成:

  • 层次目标模型(hierarchical goal model):任务 → 子任务 → 步骤的递归目标分解,回答"这个任务要完成什么,由哪些子目标构成";
  • 过程模型(process model):组织执行的控制流结构(SEQ 顺序、WHILE 循环等),回答"这些步骤按什么逻辑被执行"。

约束:模型必须符号化、可人工检查(可审计),且能支撑复用(如派生技能)。

两个子问题

子问题一:解缠(disentangling)。多线程交织意味着观测序列是多个任务的事件交错混合的结果。要建模型,先得知道"哪些事件是一个任务的"。这是鸡尾酒会问题在界面操作上的版本:多条对话混在一个声道里,要先把每个人的话分离出来。

子问题二:抽象。即便事件归属清楚了,原始事件(“在坐标 (512, 344) 点击”)与任务语义(“重建网站”)之间隔着巨大的语义鸿沟,模型必须把低层动作提升为符号化的目标与控制结构。

为什么必须"层次目标 × 控制流"双模型

论文的一个关键判断是:单一维度的建模不够。只建目标层次(做什么),知道任务由哪些子目标构成,但不知道子目标间是顺序执行还是循环迭代——“迭代设计:改一版→看效果→再改"的精髓恰恰在循环结构里,目标树表达不了。只建控制流(怎么做),得到可执行的流程图,但节点缺乏目标语义,难以审计"这一步为了什么”,也难以跨情境泛化。两个维度各回答"是什么任务"与"如何展开"的一半,合成完整的任务模型。这个"做什么 × 怎么做"的分离,是全文最值得记住的设计。

四、问题解法

TMI 的解法按"先解缠、再建模、两模型配对"组织。以论文中的真实例子贯穿:一段轨迹里同时进行着"建用户研究网站"(把 Codex 切到前台 → 输入 output_dir 配置 → ……)与"访问世界监控站"(激活讨论控制 → 点击共享覆盖层 → ……)两个任务,事件彼此穿插。

能力一:潜任务发现(解缠并发活动)

面对交错的事件流,TMI 要判断哪些事件属于同一项工作。做法的直觉是语义连贯性聚类:同一任务的事件在"当前在做什么"的意义上彼此连贯——前一步输入了配置参数,后一步大概率还围绕这个配置工作;而切换任务时,屏幕内容、操作对象、目的都会明显跳变。TMI 借助 LLM 的语义理解能力考察事件上下文,把连贯片段归为同一潜任务,把跳变处识别为任务边界或切换点。经过这一步,示例轨迹被分离成两条独立任务线,各自的事件子序列不再互相干扰,成为后续建模的干净输入。

能力二:层次目标模型诱导(做什么)

对每个潜任务的轨迹,TMI 自顶向下做递归目标分解:

  1. 先问"这段操作整体在完成什么任务",得到任务级目标(如"建用户研究网站");
  2. 再问"要完成它,经历了哪几个阶段",得到子任务层(如:设置工作区 → 迭代设计 → 开通账号 → 部署分享);
  3. 必要时继续向下分解,直到叶节点可直接对应到观测动作的步骤。

这本质上是把一段时序上的操作流重组为一棵目标树:根是任务意图,叶子是具体步骤,中间层是"为完成上层目标而必须达成的子目标"。时间顺序退居次位,占据中心的是目的-手段的层级结构。

能力三:过程模型诱导(怎么做)

目标树不回答执行顺序,过程模型补上这一维。TMI 从轨迹中识别组织执行的控制流结构:SEQ(顺序)——步骤 A 完成后做 B,如"开通账号"内部各步骤按固定次序进行;WHILE(循环)——在某条件下重复一组步骤,典型如"迭代设计":检查行为 → 实现更改 → 重建网站 → 验证效果,视结果回到"检查行为"再来一轮。

循环结构正是这里的价值所在:摘要式方法会把三轮迭代写成三段几乎重复的文字,而过程模型把它压缩为一个带条件的循环——既更紧凑,又保留了"这是一个迭代过程"的语义,这正是后续派生可执行技能的基础。

两模型配对

最终,每个潜任务产出一对模型:

层次目标模型过程模型
回答任务是什么、由什么构成任务如何被执行
结构目标树(任务→子任务→步骤)控制流图(SEQ / WHILE …)
示例建站 → 设置工作区/迭代设计/开通账号/部署分享迭代设计 = 检查→实现→重建→验证 的循环
支撑审计(逐步核对意图)、泛化(目标可换情境复用)复用(控制流可程序化执行)、技能派生

两个模型同源于同一份轨迹,分别捕捉"意图维度"与"执行维度"的信息,互为补充、互相校验。

五、评估指标与实验证据

论文采用内在 + 外在双层验证设计,分别回答"模型本身对不对"与"模型有没有用"。

内在评估:模型忠实于轨迹吗

在受控采集的人类与 agent 轨迹上(构造时即知道 ground-truth 任务划分),用两个指标:

  • 任务分组一致性:0.974。衡量解缠能力——TMI 解缠出的任务划分与 ground-truth 几乎完全一致,交织任务的归属判定基本不出错。这是整个方法成立的前提:若解缠失败,后续建模都在错误数据进行。
  • 步骤重建率:74.9%。衡量抽象的忠实度——把诱导出的模型展开,能覆盖轨迹中实际发生的约四分之三的执行步骤,远超最强的工作流诱导基线。

这对指标的设计很讲究:只看分组不看重建,模型可能"分对了但空洞";只看重建不看分组,可能在错误的任务上拟合细节。两者合起来才能说明"确实从交织轨迹中提炼出了忠实于原始操作的结构化模型"。

外在评估:模型有用吗

内在正确不等于有用。外在评估检验下游价值:从 TMI 任务模型派生技能(把目标层次与控制流投影为 agent 可调用的操作化技能),再考察装备这些技能的 agent 在 held-out 任务(未参与建模的新任务)上的表现——准确率比最强基线提升 30.0%。

关键在 held-out 设置:若派生技能只对建模时见过的任务有效,那只是记忆;在未见过的任务上仍有效,说明任务模型捕捉到的是可迁移的任务结构(子目标组织方式、迭代控制逻辑),而非轨迹的表面内容。这正是"任务模型"区别于"轨迹重放"的证据。

证据小结

验证层指标结果证明的主张
内在任务分组一致性0.974(vs ground-truth)解缠能力:能正确发现并分离交织任务
内在步骤重建率74.9%,远超最强工作流诱导基线建模忠实度:模型确实解释了观测行为
外在held-out 任务准确率+30.0% 超最强基线复用价值:模型捕捉到可迁移任务结构

双层设计的说服力在于:内在层排除了"碰巧在下游表现好但模型本身是错的",外在层排除了"模型忠实但无用"——两个方向的反驳都被堵住了。

六、效果优势的根源解释

为何远超工作流诱导基线(内在层)

工作流诱导基线的根本局限在于输入假设与真实数据的错配:它假设轨迹是单一任务、单一工作流的展开,于是把交织轨迹整体当作一条流程来拟合。当轨迹里混着两个任务时,基线只有两种下场——把两个任务的步骤强行压进一条流程(模型混杂失真),或把任务切换误判为流程分支(控制流被污染)。

TMI 的改变在于先解缠、后建模:0.974 的分组一致性保证每个潜任务拿到干净的单任务轨迹,建模阶段的输入分布与模型假设重新匹配。因果链是:解缠步骤 → 消除任务间事件混杂 → 单任务轨迹上目标分解与控制流识别不被干扰 → 步骤重建率大幅领先。这不是"多了一个预处理步骤"的工程差异,而是让建模问题前提条件得到满足的结构性差异。

此外,双模型表示保留了可执行语义。摘要式产物是自然语言,机器无法直接执行、也无法判断对错;而目标树 + 控制流是符号结构,每个观测步骤能映射到模型中的明确位置——这正是 74.9% 重建率可被计算的原因:只有结构化模型才谈得上"重建了多少"。

为何技能派生带来 30% 提升(外在层)

关键在于技能从过程模型投影而来,而过程模型给出的是可复用的控制流,不是文本描述。从摘要文本派生的"技能"本质是一段操作说明书——agent 读它、模仿它,执行时仍要临场决定何时循环、何时终止;从过程模型派生的技能自带控制结构——“迭代设计"技能内嵌了"检查→实现→重建→验证,未达要求则再来一轮"的 WHILE 循环,调用它时循环逻辑已结构化地固化在技能里。

这解释了 held-out 任务上的提升:新任务与建模任务共享的是任务结构(比如同为"迭代改进型"任务),而非表面操作。过程模型恰好把这种结构编码为控制流,结构相似性得以迁移;文本摘要丢掉了控制结构,迁移的只是表面描述。因果链:过程模型显式表示 SEQ/WHILE → 技能携带可执行控制流而非描述性文本 → 在结构同构的新任务上直接复用执行逻辑 → 准确率 +30%。

一个诚实的补充

74.9%(而非 95%+)的重建率也提示了方法的边界:真实轨迹中存在相当比例的行为(探索性操作、失败尝试、无目的浏览)难以纳入规范的任务模型。它划出了这个抽象的适用范围:任务模型建模的是工作中结构化的部分。组织知识管理场景下这个覆盖度已经很高,但把它当作人类计算机行为的完整理论则会过度外推。

七、必要知识反推

假设一个没有背景的人要做这项工作,他最少需要掌握什么?

领域知识层

  • 计算机使用 agent 的运作方式:截图-动作循环、GUI 可操作性、agent 执行任务的成败形态。不理解这个,就无法统一处理"轨迹来自人类或 agent”,也无法设计 held-out 评估。
  • 人类计算机使用行为的真实形态:必须知道真实工作是多线程交织的,否则会把"单任务轨迹"当成合理假设,直接掉进基线的坑。
  • 组织知识管理的痛点:了解"绝大多数专业知识未文档化"、审计与复用的真实需求,才能把"可审计、可复用"定义为硬约束而非附加项。

方法论知识层

  • 过程挖掘与工作流挖掘:Petri 网、控制流原语(顺序、循环、分支)这些经典建模工具,直接构成过程模型的表示语言。
  • 程序合成与技能诱导脉络:Voyager 等工作证明的"经验→技能→复用"范式,是外在评估设计(技能派生)的思想来源。
  • 无监督结构发现的评估方法论:ground-truth 分组一致性 + 重建率做内在验证、held-out 迁移做外在验证的双层设计本身就是关键方法论知识。
  • LLM 作为语义抽象器的用法:把多模态 LLM 当作"低层事件→高层语义"的提升函数,而不是端到端黑盒。

工程知识层

  • 轨迹采集与受控数据集构造:如何采到带 ground-truth 的人类与 agent 轨迹,是内在评估得以计算的前提。
  • 符号模型的可执行化:把 SEQ/WHILE 结构投影为 agent 可调用技能的工程链路。
  • 多模态输入处理:截图流 + 动作序列的切分、上下文组织与成本控制。

知识融合的关键节点

  1. “被动轨迹 = 过程挖掘的新事件日志”:把业务流程挖掘的建模语言迁移到截图-动作流上,中间靠 LLM 语义提升架桥——这是问题定义的融合点。
  2. “双模型分离”:目标层次(来自规划/知识组织传统)与控制流(来自过程挖掘传统)的配对,源于对"审计需要意图、复用需要流程"这一领域需求的洞察——这是表示设计的融合点。
  3. “任务模型→技能"的投影:把符号模型接入 agent 技能生态(程序合成传统),让外在价值可被测量——这是价值闭环的融合点。

八、论文中可以提取的通用性灵感

灵感一:被动数据 → 符号知识的提炼范式

核心思想:最有价值的知识往往不在主动收集的数据里,而在被动记录的行为流里;把后者提炼为符号化结构是可复用的范式——录制是廉价的,理解是稀缺的,让理解自动化。

论文证据:TMI 从无标注的被动截图-动作流中提炼出可审计双模型,74.9% 的观测步骤可被模型重建,证明被动数据蕴含足以支撑结构化建模的信息量。

推广场景:(1) 从客服对话录音中诱导标准应答流程模型;(2) 从外科手术视频流中提炼操作规范用于教学;(3) 从开发者 IDE 操作记录中诱导工程实践模型。

灵感二:可审计性是 agent 知识管理的刚需

核心思想:当 AI 系统积累的知识要进入组织决策链时,“符号化、可人工检查"不是复古偏好,而是信任建立的必要条件——黑盒记忆无法被审计,无法被审计就无法被追责与采纳。

论文证据:论文明确把可审计列为设计目标:目标树允许审查者逐步核对"这一步是为了什么”,这是自然语言摘要与向量记忆都做不到的。

推广场景:(1) 医疗 AI 的诊断知识库需逐条审查;(2) 金融风控规则须向监管解释来源;(3) 企业 agent 的操作权限策略需人工复核。

灵感三:双模型分离——“做什么"与"怎么做"解耦

核心思想:对复杂行为建模时,把目标结构(为什么/做什么)与过程结构(怎么执行)分离为两个互补模型,各自更纯粹、更完整,合起来覆盖单一模型无法覆盖的理解与复用需求。

论文证据:层次目标模型支撑审计与跨情境泛化,过程模型支撑程序化复用与技能派生;74.9% 重建与 30% 迁移分别由两个维度的信息贡献。

推广场景:(1) 产品需求(目标树)与技术方案(控制流)分离管理;(2) 教学设计中学习目标与教学流程分开设计;(3) 编译器的语法树与控制流图双表示。

灵感四:技能 = 任务模型的操作化投影

核心思想:知识要产生行动价值,需要一次"投影”——从描述性结构中抽取可执行单元;投影后的可复用性取决于源结构是否显式编码了控制逻辑,而非描述是否详尽。

论文证据:从过程模型(自带 SEQ/WHILE 控制流)派生的技能,在 held-out 任务上比最强基线提升 30.0%——提升根源被追溯到控制流的结构化保留,而非文本内容多寡。

推广场景:(1) 把 SOP 文档投影为 RPA 机器人技能;(2) 把管理方法论投影为工作流自动化规则;(3) 把科研实验记录投影为可重跑的 pipeline 模板。

灵感五:先解缠、后建模——混合信号的分解先于结构化

核心思想:面对多源混合的观测数据,任何结构化建模都要先做"归属判定”(哪些观测属于同一生成过程);分解质量是后续一切建模质量的上界。

论文证据:0.974 的分组一致性是全部后续结果的前提;工作流基线正因缺少解缠步骤,在交织轨迹上建模失真,重建率被大幅拉开差距。

推广场景:(1) 混杂日志先做会话分离再建模;(2) 混合语料先做主题分离再训练领域模型;(3) 多故障叠加的信号先做源分离再诊断。

结语

这篇论文本质上是在为"agent 进入真实工作"补一门基础课:从环境的被动记录中,自学出工作的结构。它的贡献可以压缩成三句话:证明了被动轨迹里确实藏着可计算的任务结构(0.974 / 74.9%);给出了刻画任务结构的恰当表示(目标层次 × 控制流双模型);验证了这种结构能转化为 agent 的行动能力(+30.0%)。更长远地看,它指向组织知识管理的新可能——那些从未写进任何文档的专家操作知识,第一次有了自动沉淀为可审计、可复用资产的路径。