基于机器之心直播间分享转写整理。分享嘉宾:深圳大学计算机与软件学院博士研究生苏向宇,论文已被 ICRA 2026 接收,并获选自动化领域最佳论文。合作方施比特机器人已将该方法部署到真实工业产线。
一、背景与问题:工业产线的"人工驱动"困境
在传统工业制造产线中,当需要让多个机器人协作完成一个加工任务(如打磨、分拣、搬运),整个流程是完全人工驱动的。具体来说,它包含两个关键阶段:
- 任务规划(Task Planning):专家需要将自然语言描述的制造任务,手动转化为数学求解器可以理解的约束表达(formulation),然后交给求解器生成一个没有资源冲突的工序调度方案。
- 程序生成(Program Generation):专家需要为调度中的每一个工序,一行一行手写出完整的机器人执行程序。
这种模式的致命缺陷是:每当任务变化或产线配置变化时,整个冗长的人工操作都需要重新完成,既耗时又不灵活。随着柔性制造、快速换产需求的增长,这种依赖人工的方式已经成为瓶颈。
新的变化
LLM 自动化工业产线规划的契机
大语言模型在代码生成和任务规划方面展现了强大的语义理解能力,研究者开始探索能否让 LLM 自动完成上述两个阶段——从自然语言输入直接生成可执行的调度方案和操作程序。但直接将任务丢给 LLM 并不可行,原因在于工业场景的特殊约束(见下文)。
二、核心挑战与解决方案
挑战一:任务规划——工业任务远比"桌面抓取"复杂
新的变化:传统 LLM 规划方法在工业场景失效
现有的 LLM 任务规划方法大多聚焦于简单的"桌面抓取"任务,这类任务的特征是执行步骤相对独立——几个机器人并行执行各自的动作,互不影响。但在工业产线上,任务执行受到严格的时间和空间限制:
- 某个工件的加工工序有严格的先后顺序
- 使用的资源(机器、机器人)有严格的互斥访问限制
- 多个工序之间存在复杂的串并行混合依赖关系
如果让 LLM 直接生成最终的调度方案,正确率极低,因为它无法可靠地处理这些硬约束。
作者观点 + 解释:LLM 做语义理解,求解器做硬约束保证
苏向宇团队采用了一种分工策略:让 LLM 做它真正擅长的事——语义理解,然后使用专业的约束求解器来保证硬约束的满足。具体来说:
- LLM 从自然语言输入中自动提取工序、分配机器人、确定工序执行顺序
- 将这些信息建模为一个提取图(节点=工序,边=先后顺序和资源限制)
- 将提取图交给现有求解器,生成高效的调度方案
这种"LLM 负责理解,求解器负责保证"的思路,大幅提升了任务规划的成功率。
挑战二:程序生成——真实产线的程序长且依赖具体环境
新的变化:工业产线程序的高度差异性
在真实工业产线上,每个工序的执行逻辑非常复杂,对应的程序代码远比桌面任务长得多。更关键的是,即使是相同的工序,由于产线配置或机器人型号的不同,执行逻辑也会有微妙差异。例如,两个机器人都在执行"搬运"操作,但因为一个机器人的相机安装在末端(而非悬挂在上方),它的程序就需要额外包含"计算拍照位置"的动作步骤。这意味着工业产线的程序是高度依赖具体环境的,直接让 LLM 生成又长又复杂的程序,经常出现关键步骤丢失或顺序错乱。
作者观点 + 解释:发现重复模式,构建工序流程树实现零样本泛化
团队的核心观察是:工业程序中存在大量重复的动作模式,这些模式不是单一动作,而是由多个动作组成的"动作块"(Action Block)。基于此,他们设计了以下流程:
- 让 LLM 从已有程序样例中发现重复模式,自动总结为动作块
- 基于动作块构建一棵工序流程树:每个程序样例对应从根节点到叶子节点的一条完整路径
- 当需要为新产线生成程序时,通过组合已有路径中的动作块,生成全新的执行路径
这种设计的精妙之处在于:动作块既有功能标识(支持哪些工序),又有具体的动作序列,这为 LLM 在选择路径和拼接代码时提供了更多参照信息,大大提高了正确率。同时,这也实现了真正的零样本泛化——无需重新训练,就能为从未见过的产线配置生成可执行程序。
三、实验验证:跨产线、跨任务的泛化能力
IMR Bench 数据集
为了全面评估方法性能,团队构建了 IMR Bench 数据集,主要面向船舶制造等重型加工行业,包含:
- 23 个场景(不同产线布局和资源配置)
- 50 个任务,按难度分为三等:
- 单机器人任务:最简单
- 简单多机器人任务:所有工序以串行或并行方式执行
- 复杂多机器人任务:工序以串并行混合方式执行,对算法的并发处理能力要求更高
实验结果
新的变化:方法显著优于现有方案,且差距随任务难度增大而扩大
在关键指标(完工时间、资源利用率、执行成功率)上,AIML 方法显著优于所有基线方法。一个重要观察是:随着任务难度提升,AIML 与基线方法的差距不断扩大——任务越复杂,优势越明显。
基线方法常见的错误模式包括:
- 线性序列输出:将调度结果输出为线性序列,容易导致资源冲突(如两个工序同时要用一个机器人)
- 依赖图冗余边:直接让 LLM 输出依赖图,但复杂任务中容易产生非必要的依赖边,导致完工时间过长
相比之下,AIML 将复杂的约束满足交给专业求解器,保证了调度结果的高效性。
真实产线部署
合作方施比特机器人已将该方法集成到其"昆吾"产品中,在真实工业产线上完成了部署验证。从自然语言任务描述到控制程序的自动生成,整个流程可以在平台上直接运行。生成的执行程序以低代码形式展示,确认无误后即可启动执行。
四、核心贡献总结
作者观点 + 解释:三点关键贡献
AIML 框架:提出了一个新颖的利用 LLM 完成工业多机器人任务规划和执行程序生成的框架。核心思想是"LLM 做语义分析,结构化工具保证约束满足和可执行性"——这是一个Harness Engineering(工具编排工程)的思路,而非简单的端到端生成。
IMR Bench 数据集:为工业产线多机器人规划算法的评估提供了标准化基准,填补了该领域缺乏系统性评测工具的空白。
虚实双重验证 + 零样本泛化:同时在虚拟仿真环境和真实产线上验证了算法的有效性。更重要的是,该方法本质上是**零样本(zero-shot)**的——换场景、换任务都不需要重新训练或人工调参,只需要做适当的 prompt 工程来引导 LLM 输出更准确的结果。
五、问答环节要点
1. 框架如何将自然语言转化为机器人可执行的规划和代码?
框架首先利用 LLM 从自然语言输入中提取工序、分配机器人、确定执行顺序,建模为提取图后经求解器得到规划方案。程序生成方面,通过预先构建的工序流程树,选择完整路径并将包含的动作块拼接为可执行程序。
2. 与传统多机器人规划方法相比最大优势?
最大优势在于去掉了人工参与环节。传统方法需要人工将制造任务分解为求解器可理解的描述;AIML 直接从自然语言自动转化,大幅减少了人的工作量,实现了整个流程的自动化。
3. 自动总结在生成程序时如何保证正确性?
自动总结将重复模式规范化——不仅总结模式本身,还标注它在哪些工序中被使用、需要完成什么功能。这样 LLM 在选择执行路径和拼接代码时有了更直观的参照,知道每个节点完成什么功能、支持哪些工序,从而提高了正确率。
4. 换产线或换工装能否直接复用?
可以直接复用。方法本质上是零样本(zero-shot)的,核心贡献在于 Harness Engineering 而非模型训练。换场景、换任务不需要重新训练或人工调参。真实部署时,合作方会先在产线的数字孪生中测试算法,验证通过后再交给现场工作人员进行实际部署。