PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems —— 精读
论文链接:https://arxiv.org/abs/2608.28378
发表时间:2026 年 8 月 28 日(arXiv:2608.28378v1)
发表机构:北京大学(多媒体信息处理国家重点实验室)+ 小米 LLM-Core + 香港大学 + 中国人民大学——典型高校+企业合作,一作吕航龙(北京大学)在小米 LLM-Core 团队实习期间完成主要贡献,通讯作者为北大 Tong Yang 与小米罗福莉
领域标签:cs.CL / Agent 训练数据合成 / 用户模拟
备注:训练与评测模型为 Qwen3.5-27B 与 MiMo-V2-Flash(小米);评测用户模拟器为 Claude Opus 4.6,裁判为 DeepSeek-V4-Pro;基准基于 CLAW-EVAL 构建。论文承诺开源数据与基准。
一、论文背景
1.1 Agent 的训练数据假设与真实使用脱节
大模型已经从单轮问答者进化为 agentic workflow 执行者:通过工具使用、多步推理和持续对话解决真实任务。但现有工具使用数据合成方法(如 ToolACE、APIGen 系列)通常在固定 API 模式上离线生成轨迹——一条信息完备的查询导向一条规划好的工具调用链。
真实使用完全不是这样。论文对 16K 真实会话(SWE-chat、Computer-Use 公开数据集 + 内部部署日志,各占 25%/25%/50%)做了系统分析,结论是:
- 75.9% 的交互是多轮;多轮会话中用户消息中位数为 10 轮;
- 多轮会话平均 99.3 次工具调用(单轮的 10.3 倍)、平均 212K 字符(4.7 倍);
- 38.7% 的多轮会话含显式纠错(单轮的 19.4 倍),其中 36.0% 发生在工具执行之后;
- 纠错的对象是:上下文丢失(7.0K 次)、方法错误(2.1K)、格式错误(1.9K)、无视指令(714)、幻觉(316)。
与之对照,其部署助手的训练语料 100% 单轮。用户在真实场景中追加需求、改变方向、检查中间输出、纠正错误;而模型是在「首条消息即完备」的假设下训练和评测的——这个缺口是构建强 agent 的核心瓶颈。
1.2 造一个「真实用户模拟器」难在哪
关闭这个缺口需要一个能复现人类交互方式的用户模拟器,论文指出三个环环相扣的挑战:
- 多样且连贯的用户:职业、性格、技术熟练度、知识背景要同时塑造任务目标和沟通风格——不能把不搭的组合(如非技术用户配高技术亲和职业)硬塞给模拟器;
- 可控的轮级行为:模拟器要发出简短、增量、有时纠正性的消息,而不是 LLM 默认的冗长、过度配合的对话风格;
- 有据且可扩展的对话:对话要源于真实用户需求、通过与真实部署 agent 的在线交互展开,且要过滤低质量数据。
1.3 问题的本质
深一层看,这是一个信息不对称问题:真实用户手里握着不会一次性说全的隐藏意图(预算、偏好、背景约束),agent 只能通过提问和执行逐步挖掘。离线脚本化数据把这场「博弈」拍扁成了单轮完形填空,模型从未学过如何在信息不完备时主动澄清、如何在用户改口时维护状态。PersonaForge 的全部设计都围绕「把这场博弈造出来」展开。
二、论文定位和关联工作
2.1 研究谱系梳理
(1)Agentic LLM 与评测基准。 ReAct/Toolformer/AutoGen 确立了工具使用与多智能体范式;评测从静态 QA 转向可执行任务:AgentBench、SWE-bench、WebArena、OSWorld、BrowseComp、τ-bench。论文的批评精准:这些基准大多用固定任务考 agent,而不是在「渐进转向的真实用户」下训练和评测。与 τ-bench 系列的脚本化用户不同,PersonaForge 的用户是带隐藏上下文的活模型。
(2)人物建模与用户模拟。 PersonaHub 做大规模人物库;Li et al. 2025 指出 LLM 生成人物有系统性偏差;Generative Agents、CAMEL 把人物+记忆+角色扮演用于沙盒;PatientSim 等做领域特定模拟。PersonaForge 的差异点:人物建模不只变身份,还控制沟通风格、隐藏上下文、渐进披露和在线交互中的纠正行为。
(3)工具使用数据合成。 APIGen(多轮)、ToolACE(单轮函数调用)是主流路线——离线、固定 API、信息完备。论文的对照实验直接证明:这两类语料在该基准上不涨反跌(−2.7% / −5.5%)。
2.2 基准对比定位
| 基准 | 任务数 | 语言 | 活模型用户 | 人物多样性 | 渐进披露 | 嵌入矛盾 | 纠错行为 | 人工验证 | 逐任务评分标准 |
|---|---|---|---|---|---|---|---|---|---|
| τ-bench/τ2-bench | 3 域 | en | 脚本固定 | 部分 | × | 部分 | ✓ | ✓ | 策略规则 |
| ToolSandbox | 1032 | en | ✓ | × | 部分 | × | × | ✓ | 里程碑 |
| BFCL v3 多轮 | 800 | en | 脚本模板 | × | 部分 | × | × | ✓ | 状态检查 |
| ACEBench(agent) | 2000 | zh+en | ✓ | × | 部分 | × | × | ✓ | 规则 |
| WildToolBench | 1024 | en | ×(静态) | × | ✓ | × | ✓ | ✓ | ✓ |
| PersonaForge-Bench | 138 | zh+en | ✓(人物+隐藏上下文) | ✓(4 维) | ✓ | ✓ | ✓ | ✓ | ✓(逐任务) |
定位结论:PersonaForge-Bench 是唯一同时具备「人物条件化活用户模拟器(含隐藏上下文)+ 渐进披露 + 嵌入矛盾 + 纠错行为 + 人工验证 + 逐任务评分标准」的基准;PersonaForge 框架本身则是首个系统性弥合「75.9% 多轮真实使用 vs 100% 单轮训练数据」缺口的数据合成方案。
三、问题定义
3.1 具体问题与抽象
具体问题:如何合成训练数据,让 agent 学会在信息不完备、用户渐进披露、频繁纠错的真实多轮交互中表现良好?
核心洞察:把「用户」从数据的背景板提升为一等可控变量。agent 的交互能力本质上是对「隐藏状态逐步揭示」过程的响应能力,那么合成数据的本质就是构造一个可控的隐藏状态机——人物画像决定隐藏状态的内容,行为规则决定揭示的节奏,真实种子查询决定状态的锚点。
类比:如果说传统工具数据合成是「拍好的电影」(轨迹固定),PersonaForge 是「即兴戏剧」——给演员(用户模拟器)完整的人物小传和隐藏动机,让他对着真实舞台(部署的 agent)现场发挥。
3.2 形式化
- 给定:真实种子查询池(WildChat、LMSYS-Chat-1M)、人物空间(职业 70 × MBTI 16 × 技术级 3 × 知识背景 25,带相容性约束)、目标 agentic 系统。
- 求:一套合成管线,输出满足三性质的多轮轨迹语料——① 用户-任务连贯(人物与查询语义匹配);② 轮级行为可控(简短、增量、按需纠错);③ 扎根真实需求与真实执行(用户后续消息以 agent 实际行为为条件)。
- 配套求:一个能区分「完备查询执行」与「真实用户交互」能力的评测基准。
3.3 抽象的精妙之处
「信息不对称」这个抽象让三个挑战各得其所:隐藏状态(画像+连接记忆+任务场景)归模拟器私有,agent 只见累计消息与自身工具输出。有了不对称,渐进披露不再是刻意编排的剧本,而是隐藏状态在交互中的自然涌现——这比显式脚本化「第 N 轮说什么」的方案泛化性强得多。
四、问题解法
PersonaForge 分三阶段:画像构建(§3.1)、对话生成(§3.2)、质量控制(§3.3)。
4.1 画像构建:逆向深度构建 + SOUL 提示
四维人物空间:
| 维度 | 取值 | 作用 |
|---|---|---|
| 职业 | 70 类(标注技术亲和度与兼容知识域) | 决定任务目标的自然性 |
| MBTI 性格 | 16 型(INTJ→简练效率型;ENFP→好奇易跑题) | 决定沟通风格 |
| 技术熟练度 | 专家/中级/新手 3 级 | 决定行话 vs 白话 |
| 知识背景 | 25 域(专家技能/熟悉主题/盲区结构化字段) | 决定领域深浅 |
生成前强制相容性规则(非技术用户不配高技术亲和职业),杜绝「地产中介发股权估值查询」式的违和组合。
逆向深度构建(Reverse Deep Construction):这是与「正向采样」(先抽人物再造查询)相对的路线——从 WildChat/LMSYS 的真实种子查询出发,让 LLM 反推一个合理的人物画像,再生成扎根于该画像的任务场景与连接记忆。论文的对照案例很有说服力:正向采样的记忆是「 plausible 但互不相关」的碎片(Excel 模板、医药股、客户首付恰好并存),逆向构建的记忆收敛于同一个进行中场景的多个侧面(爱尔兰 SPV 收购的税务结构/跨辖区比较/登记程序),有真实的专有名词与量化细节(Irish Revenue、CGT),构成可供逐轮揭示的潜在上下文。论文实测训练数据全部走逆向路径。
SOUL 提示结构(模拟器用户的可执行状态表示,借鉴 OpenClaw 部署系统的结构化提示原则,但用在用户侧):
- 核心身份段落(把人物锚定在具体生活情境);
- 性格-行为映射(抽象参数而非话语示例——论文发现示例会让多样性塌缩);
- 沟通风格参数(消息长度、正式度、表情使用);
- 连接记忆模板(预先确立的会话级事实,防止模拟器在被追问时编造矛盾细节)——消融中影响最大的单一组件。
4.2 对话生成:信息不对称 + 行为规则
信息不对称是发动机:模拟器可见 SOUL 提示、连接记忆、任务场景;目标系统只见累计用户消息与自身工具输出。每轮模拟器以隐藏状态 + agent 实际行为为条件,产出简短、自然的消息——追加需求、引入真实的不一致、或在该纠正时纠正。意图的渐进披露由此自然发生。
固定行为规则(让模拟器像用户而非另一个助手):
- 消息简短(追问不复述任务);
- 每轮一问(避免 unnatural 的连环多问);
- 主动验证数值结果与代码输出(复现真实纠错行为);
- 无 AI 自我意识(维持人物一致性);
- 自然终止信号(任务完成即收)。
4.3 质量控制:三段过滤
| 阶段 | 操作 | 去除率 |
|---|---|---|
| 生成前 | 人物组合相容性检查 + 种子查询最低复杂度过滤 | 12% + 8% |
| 运行时 | 角色反转检测:用户消息超 1500 字符(真实数据 99.2% 追问低于此阈值)即标记,另查代码粘贴模式防误伤 | 7% |
| 后处理 | 角色反转截断、退化模式过滤、格式归一、工具配置随机化 | 4% |
四级联锁约保留 74%(约四分之一会话被丢弃)。最终语料 6.3K 会话 / 430K 消息,96% 多轮(均值 9.3 用户轮),用户消息中位长约 100 字符;四维人物分布的归一化熵 0.77–0.93,多样性充分。
4.4 PersonaForge-Bench:138 题人工标注基准
- 构成:138 任务(中文 110 / 英文 28),20+ 专业领域(聚合为 8 个报告桶),基于 CLAW-EVAL 构建;每任务强制持续多轮交互。
- 三设计原则:渐进信息披露(考 agent 能否问出并整合缺失约束);嵌入矛盾(考状态维护与冲突检测,如用户声称利率 3.95% 而合同为 LPR+40BP 即 4.35%);领域特定评分标准(MUST_ASK 澄清项、带容差窗口的参考计算、逐步评估链)。
- 四维等权评分:交互效率(轮数/工具调用数)、工具适当性(选对工具、查询精良、一次成功)、任务完成(覆盖全部需求、挖掘隐藏需求、发现矛盾)、回复质量(结构清晰、数值准确、直击要点)。
- 协议:每任务 3 次独立试验取平均;裁判 DeepSeek-V4-Pro 收到原查询+参考解+领域标准+通用四维规则;人工验证裁判-人类一致性 κ_jh=0.79(人类间 κ_hh=0.81)、r=0.84。
五、评估指标与实验证据
5.1 实验设置
Qwen3.5-27B 与 MiMo-V2-Flash 全参数 SFT(6.3K 会话,5 epochs,lr 5e-5,128K 上下文,共 2550 GPU 时);对照 zero-shot 基座、真实用户回放数据训练版(同规模)、外部闭源模型(Claude Opus 4.6、Gemini 3.1 Pro、GPT-5.5)与竞争闭源模型(MiMo-V2-Pro、Kimi-K2.5、MiniMax-M2.7、GLM-5.1)。
5.2 主结果
| 模型 | 效率 | 工具 | 完成 | 回复 | 综合 |
|---|---|---|---|---|---|
| Claude Opus 4.6 | 83.0 | 95.3 | 86.5 | 87.8 | 88.2 |
| Qwen3.5-27B(基座) | 74.0 | 88.1 | 70.6 | 72.1 | 76.2 |
| Qwen3.5-27B + PersonaForge | 76.5 | 89.1 | 76.5 | 78.9 | 80.3(+4.1%) |
| MiMo-V2-Flash(基座) | 53.2 | 73.5 | 53.5 | 61.3 | 60.4 |
| MiMo-V2-Flash + PersonaForge | 69.8 | 83.7 | 75.5 | 75.4 | 76.1(+15.7%) |
Qwen 侧增益集中于任务完成(+6.0%)与回复质量(+6.8%,*为 95% CI 排零显著);MiMo 侧任务完成 +22.0%(相对 +41.1%)、效率 +16.6%、工具 +10.1%、回复 +14.0%,四维全部显著。呈现清晰的规模化模式:基座越弱、空间越大,增益越大。
值得注意:PersonaForge 训练后的 MiMo-V2-Flash(76.1%)已超过 GLM-5.1(75.5%)并逼近 Kimi-K2.5(83.6%)的量级——6.3K 条会话数据的杠杆相当可观。
5.3 交互效率的独立量化
MiMo-V2-Flash SFT 后:轮数 −20.7%、工具调用 −9.2%、web_fetch 调用 −54.2%;触及 25 轮上限的任务从 73 降到 30(−58.9%),同时任务完成 +22.0%。Qwen 侧同向(轮数 −19.7%、工具 −25.5%、上限案例 −60.2%)。更少轮数 + 更高完成度说明增益来自交互选择性的改善而非堆量。
5.4 消融与对照(证据链的关键)
| 对照(Qwen3.5-27B) | 综合 Δ | 95% CI |
|---|---|---|
| APIGen-MT-5k(外部多轮语料) | −2.7% | [−6.0, +0.7] |
| ToolACE(外部单轮语料) | −5.5% | [−9.4, −1.6](显著回退) |
| 正向采样构建(等规模同质控) | +1.2% | [−1.6, +4.2](不显著,且工具维 −5.8%**) |
| 真实用户回放 | +4.7% 之差 | PersonaForge 胜(任务完成 +8.5%) |
| LoRA(r=32) 同语料 | +3.8% | [+1.4, +6.3](复现全 SFT 档案) |
SOUL 组件消融:去连接记忆综合分 80.3→78.9(任务完成 −3.5%);再去缺陷与性格特质 78.2(−2.1%)。行为级消融(40 人物 × 6 条件 = 240 对话):去连接记忆是唯一产生多指标显著变化的单组件(渐进披露 d=+0.31 等 4 项),最小化条件(三组件同去)6 项中 5 项显著退化——组件间是冗余协同而非简单叠加。
5.5 泛化与稳健性
- OOD 迁移:CLAW-EVAL 留出任务上 MiMo 59.0%→69.1%(+10.1%),Pass@3 52.6%→76.3%;BFCL v3 多轮(第三方规则评分)63.0%→65.3%——排除对基准评分标准的过拟合。
- 长度/格式偏倚排除:SFT 使助手输出增 57%,但长度分层显示增益在最短四分位最大(+24.8%);回归分析控制长度后 SFT 效应 β=+0.087(p=0.001);表格/标题分层各组内增益一致。
- 双裁判与跨模拟器:Gemini 3.1 Pro 独立复评增益 +15.6%(vs +15.7%);换 GPT-5.5 当用户模拟器,绝对分变化但系统排序不变。
- 盲测真实感:标注者无法区分 PersonaForge 对话与真实用户(判对率 51.6%,p=0.90;判为人类 72% vs 真实 75%);意图忠实审计 200 例中零漂移(96.0% 完整保留)。
指标体系的证明力分析:这套实验设计的亮点在于「每找一个混淆解释就做一个对照」——数据量(等规模对照)、数据配方(正向 vs 逆向)、微调方法、裁判选择、长度与格式偏倚、同族模拟器偏袒,逐一排除。唯一要留意的是英文子集仅 28 题、统计功效不足(论文自己如实标注),聚合增益主要由中文子集驱动。
六、效果优势的根源解释
对比对象一:离线完备查询语料(APIGen/ToolACE)。 它们为何在自有领域有效?因为固定 API 编排内任务分布均匀、轨迹可验证。根本局限:交互范式错配——它们教会模型「给定完整规格执行」,而真实交互是「在信息不完备下协商」。因果链:完备查询语料 → 模型从未见过首消息不完备的分布 → 在渐进披露任务上无从澄清与状态维护 → 综合分不升反降(−2.7%/−5.5%)。PersonaForge 的信息不对称设计使训练分布与真实分布的「揭示过程」对齐,这是任务完成维度增益最大的根源。
对比对象二:真实用户回放。 回放保留了真实人类话语,为何还差 4.7%?因为回放的用户脚本是死的——不管 agent 怎么回,下一条消息照剧本念。因果链:脚本固定 → 后续消息不以 agent 实际行为为条件 → 轨迹里充满答非所问的错位 → 模型学到的是「忍受任意追问」而非「影响用户下一步揭示」。PersonaForge 的模拟器逐轮条件于 agent 实际执行(含工具输出),用户消息构成对 agent 行为的闭环反馈——这解释了任务完成 +8.5% 的差异:模型学的是「我的行为如何改变信息环境」。
对比对象三:正向采样人物。 正向路线增益不显著(+1.2%)且工具维显著退化,根源在记忆的拓扑结构:正向记忆是互不相关的散点,没有「待揭示的潜在上下文」;逆向记忆围绕同一真实场景多角度收敛,构成可逐轮展开的隐藏状态。消融中连接记忆是唯一多指标显著的单组件、其去除使渐进披露比从 0.80 掉到 0.58(信息前置),这条因果链完整闭合:记忆拓扑 → 披露行为 → 任务完成信号 → 下游增益。
反事实检验:去 SOUL 全部行为组件 → 盲测判人率从 72% 掉到 66%、自然度 3.88→3.3 区间;换正向构建 → 增益消失;换回放 → 增益减半。三个反事实分别锁死行为控制、构建方向、在线适应性三要素的必要性。
规模效应的解释:MiMo(+15.7%)大于 Qwen(+4.1%),论文的解释是基座起点低、余量大;更深一层,多轮交互能力依赖长上下文内状态维护与工具选择的组合泛化,大 MoE 的容量让 6.3K 数据的模式更容易内化为通用的交互策略而非表面风格。
七、必要知识反推
7.1 领域知识层
- 真实交互的实证形态:必须先知道 75.9% 多轮、99 次工具调用、38.7% 纠错这些统计——没有这套测量,问题定义就是猜测。会话分析的词法方法(正则匹配任务类与纠错信号、归一化流程)是获取动机的最低门槛。
- 人物建模的已有结论:LLM 人物有系统性偏差(Li et al.)、PersonaHub 式大规模人物库、示例驱动会塌缩多样性——这些前车之鉴直接塑造了「抽象参数而非话语示例」的设计决策。
- 部署系统的提示工程实践:OpenClaw 等部署助手的结构化提示原则,被迁移到用户侧。
7.2 方法论知识层
- 信息不对称的实验设计思想:知道把隐藏状态做成模拟器私有,才能让渐进披露涌现而非编排。
- 合成数据的质控方法学:用真实数据标定阈值(1500 字符来自 99.2% 分位)、角色反转的启发式检测、多级过滤的留存率核算。
- 评测理论:LLM 裁判的效度验证(κ 与 r 对标人类间一致性)、配对 bootstrap 与 Wilcoxon 显著性、长度分层的偏倚排查、交叉裁判/交叉模拟器稳健性——这套「排除混淆」的实验设计能力是论文可信度的真正来源。
- 统计功效意识:英文子集 28 题不足以显著,需要如实标注证据强度而非硬凑结论。
7.3 工程知识层
- 全参数 SFT 与 LoRA 的等价性验证:同数据同协议下 LoRA 复现全 SFT 档案,排除「增益来自微调方式」。
- 训练-评测数据隔离:TF-IDF n-gram 相似度 + 三种表面匹配做泄漏审计,两条高相似(0.90/0.89)记录主动剔除——数据卫生的工程习惯。
7.4 知识融合的关键节点
第一处融合是「实证分析 → 设计映射」:16K 会话分析提炼出的三性质(用户-任务耦合、意图逐轮展开、反馈挂钩执行)被逐一映射为框架的三组件(画像构建、对话生成、质控),动机与方案严丝合缝。第二处是「逆向构建 × 连接记忆」的化学反应:单独看反推画像不新鲜、连接记忆也不新鲜,但逆向路径保证了记忆围绕真实场景收敛,连接记忆才有可揭示的拓扑深度——这解释了为何正向+记忆的组合打不出同样效果。第三处是「模拟器行为度量 → 下游训练信号」的双层验证链:行为级消融(240 对话)与下游训练消融(SFT 后基准分)相互印证,把「像不像人」与「有没有用」接通了。
八、论文中可以提取的通用性灵感
灵感一:先测真实分布,再造合成分布。 核心思想:合成数据的第一原则是让训练分布对齐实测的真实使用分布,而不是对齐「方便合成的分布」。 论文证据:75.9% 多轮 vs 100% 单轮训练语料的缺口是全部工作的动机;等规模的外部完备查询语料 −2.7%/−5.5% 反证分布错配的代价。 推广场景:① 对话产品冷启动前先分析工单/客服日志再合成;② 代码模型的仓库级真实改动分布 vs 合成单文件任务;③ 推荐系统离线模拟的会话长度分布校准;④ 机器人任务的真机遥操作分布引导。
灵感二:信息不对称是涌现式数据合成的引擎。 核心思想:与其脚本化编排交互,不如给一方私有隐藏状态,让目标行为在博弈中自然涌现。 论文证据:模拟器私有 SOUL/记忆/场景 vs agent 只见消息与工具输出,渐进披露自然发生;盲测判人率 51.6%(与瞎猜无异)。 推广场景:① 谈判/销售训练模拟器(对方保留底线与预算);② 红队安全评测(攻击者私有攻击意图);③ 教育辅导(学生隐藏的误解图式);④ 医疗问诊训练(患者隐藏病史与依从性)。
灵感三:隐藏记忆的拓扑决定可披露性。 核心思想:合成角色的背景记忆应围绕单一场景多角度收敛而非散点罗列,后者没有可逐轮展开的潜在上下文。 论文证据:逆向构建的记忆收敛于同一 SPV 场景三侧面、正向散点无揭示深度;去连接记忆使渐进披露比 0.80→0.58、任务完成 −3.5%。 推广场景:① 剧本杀/互动小说 NPC 背景设定;② 用户画像系统的情景化记忆组织;③ 多轮检索增强的查询历史压缩。
灵感四:等规模对照才能把「配方」与「数量」解耦。 核心思想:证明数据合成的价值必须固定规模、方法、基座,只变配方。 论文证据:等规模外部语料、等规模正向构建、LoRA/全 SFT、真实回放四组对照把增益唯一归因于「人物扎根的逆向构建+在线交互」配方。 推广场景:① 蒸馏数据的配比消融;② 课程学习的数据顺序对照;③ 任何「换数据不换量」的 A/B。
灵感五:逐级排除混淆的评测卫生学。 核心思想:报告增益时把长度、格式、裁判、模拟器同族偏袒等替代解释逐一量化排除,证据链才闭合。 论文证据:长度分层(最短四分位增益最大)、回归控制(β_SFT=+0.087)、双裁判(+15.6% vs +15.7%)、跨模拟器(排序不变)。 推广场景:① RLHF 评测中奖励模型偏好长度时的分层分析;② Agent 基准的确定性规则评分交叉验证;③ A/B 测试中的辛普森悖论排查。
灵感六:可控的「不完美」是被低估的数据维度。 核心思想:让模拟方保留人类的低效与纠错(短消息、一次一问、主动验证、跑题),训练信号反而更强。 论文证据:SOUL 缺陷与行为参数形成冗余约束,全去掉时 6 项行为指标 5 项显著退化;盲测中「类人缺陷」维度几乎追平真实(3.59 vs 3.62)。 推广场景:① 语音助手训练注入口语不流利;② 协作机器人的犹豫与修正轨迹;③ 代码补全的非线性编辑序列建模。