整理自西湖大学张驰(Westlake University)在「即兴之星」主办活动上的报告演讲。张驰团队从2023年起深耕Agent研究,在GUI Agent领域发表了开创性工作App Agent。本次报告主题为"自主进化智能体:从固定工作流到动态架构的演进",系统梳理了Agent进化的四个层级。
引言:Agent研究的特殊性——在模型的输出接口上做研究
张驰开场提出了一个他自己"到现在都没想清楚"的问题:要不要让博士生一开始就完全投入Agent研究?
背景是: 过去的AI研究范式集中在模型层面和理论层面(如改进网络架构、训练算法),很少在"模型的输出输入接口"层面做研究。Agent恰恰是一个特殊的领域——它研究的不是模型内部能力有多强,而是模型如何与外部环境交互(调用API、操作软件、影响物理或数字环境)。
为什么最近"想通了"? 张驰坦言,驱动这个改观的现实因素是工业界对Agent人才的需求极为旺盛。“如果培养一个学生毕业之后是百万年薪,那你确实很难去定义这算不算一种成功、算不算一种能力。” 这反映了Agent研究虽然方法论上与经典AI研究不同,但其产业价值已经被充分验证。
张驰还分享了一个从业者都有的感受:Agent领域的技术迭代速度极快,“每天新出的技术太多太频繁,以至于都没时间去follow”。他在推特上看到一个说法——“你可能真的需要失业很久才能追上所有AI方面的技术”。但张驰强调:真正有价值的东西还在前沿,作为老师和学生,保持对前沿的了解至关重要,才能做出更有影响力的工作。
本次报告的核心概念是**“进化”(Evolution)**。张驰指出,和"世界模型"一样,“进化"在Agent领域也缺乏统一定义。他结合团队的四个研究工作,将进化拆解为四个递进层级:知识、经验、动作、架构。
一、知识的进化:Text-to-SQL中的"反向探索"范式
1. 新的变化
从"直接回答"到"先探索数据库再回答”——Agent不再是无知的工具
Text-to-SQL(自然语言转数据库查询语言)是大模型最早的应用场景之一。用户用自然语言提问(如"每个商户平均有多少订单?"),大模型将问题翻译成SQL查询语句,在数据库中执行并返回结果。
但这件事远比想象的难。 张驰指出,大模型写通用代码的能力已经很强(“coding is dead"已成为行业共识),但写SQL的整体水平仍然偏低。原因不在于语法或逻辑,而在于"信息差”:
- 同名词未必同意: 多个表里可能都有"status"字段,但在不同表中含义完全不同。AI(无论用Claude Code还是其他工具)很难判断在当前语境下"status"究竟指什么。
- 数据库结构极其复杂: 一个数据库可能有成百上千张表,表与表之间的关联、属性的语义边界,都需要深度领域知识才能理解。
这导致了一个根本矛盾: 一个对数据库不熟悉的大模型,无法准确地将抽象问题转化为可执行操作。而一个人类专家之所以能做好,前提是他"对这个数据库的各种属性了如指掌"。
2. 作者观点与解释
反向思考的力量:构造问题比回答问题容易得多
张驰团队发表在ACL的工作(“SQA整”)提出了一个两阶段范式:探索(Exploration)+ 部署(Deployment),让Agent"像人一样"先熟悉数据库再工作。
核心洞察极其精妙: 如果给你一个问题让你在数据库中找答案,这非常难。但反过来——如果给你一个数据库,让你想可以构造什么问题,这就很容易了。比如你看到表格里有"平均数"和"数量"字段,自然就能想到"是否可以构造一个关于总数的问题?"
探索阶段的工作流程:
- Agent在数据库中自主探索,结合树状搜索结构
- 每次探索生成一个"三元组"经验:(数据库片段,SQL查询语句,可构造的问题)
- 验证三元组是否可执行、是否合理
- 通过验证的三元组存入记忆(Memory)
部署阶段: 当用户提出真实问题时,Agent检索历史经验,找到最相关的案例作为参考,再执行任务。实验显示,在开源模型上准确率有显著提升。
张驰坦承的边界条件: 如果只针对一个数据库做overfitting(过拟合),肯定是最准确的做法。但如果要实现跨数据库的迁移泛化,这种"快速的知识迭代"是一种高效且通用的做法。探索的质量受探索次数和大模型temperature(“预测的想象力”)的影响。
进化的本质: 你原来不了解的东西,现在了解了,下次做事情可以更准、更高效——这就是知识层面的进化。张驰认为,连最基础的RAG(检索增强生成)本质上也是一种知识进化。
二、经验的进化:App Agent——为什么微调模型操作APP是死路一条
1. 新的变化
从"微调模型"到"自动生成说明书"——GUI Agent范式的根本转向
2023年末,当GPT-4V等模型获得多模态(视觉)能力后,张驰团队率先提出了GUI Agent(图形界面智能体)的概念,发表了该领域第一篇工作App Agent——让AI通过"看"手机屏幕来操作APP。
最初的本能做法:微调模型。 张驰团队最初的想法是标注大量截图问答数据(“这个UI元素是什么?它的位置在哪?功能是什么?想实现某功能应该点哪里?"),然后微调一个开源多模态模型,让它专门擅长操作微信、QQ等常用APP。
但他们很快意识到这条路走不通,原因有三:
- 效率太低: 为了学习一个小图标的功能,需要微调整个大语言模型——投入产出比极差。
- 知识无法迁移: 在一个APP上微调的模型,换一个APP就完全不work了。
- APP更新即失效: APP几乎每天都在更新,一旦界面变化,就需要重新微调整个模型。
2. 作者观点与解释
核心主张:Agent的泛化只能通过few-shot能力实现,不能通过训练实现
张驰反复强调一个判断:“Agent想实现泛化,就必须依赖few-shot(小样本)能力。微调和数据可以服务于先验能力(让模型对UI有整体认识),但你无法通过训练实现泛化。”
他以"豆包手机"为例说明了这条路线的天花板:豆包手机可以把常用APP做得非常好、非常准,但一旦遇到小众APP就做不好。因为微调只能覆盖见过的场景,而探索式学习可以覆盖任何场景。
人是怎么熟悉一个新APP的? 张驰总结了两种方式,都依赖few-shot迁移能力:
- 自主试错: 你从没见过的APP,摸索一下、点一下看看页面怎么变化,很快就能总结出使用方法。本质上是因为人用过太多APP,对"APP这个东西"有了先验知识。
- 看演示: 别人当着你面演示怎么用,你观察"点了什么、发生了什么”,逻辑与自主试错完全一致。
App Agent的解决方案:自动生成"说明书"
基于上述观察,张驰团队设计了一套探索策略:
- Agent在APP中点击未知功能的UI元素
- 观察点击前后两个页面的变化
- 总结"这个元素的功能是什么"——生成一条说明
- 不断探索,积累大量说明,构成一份"APP说明书"
- 操作APP时,Agent参考这份动态生成的说明书做决策
实验数据极具说服力:
| 说明书来源 | 任务成功率 |
|---|---|
| 无说明书 | ~48% |
| 自动探索生成的说明书 | ~73%(+25个百分点) |
| 看别人演示总结的说明书 | ~83%(再+10个百分点) |
| 人工编写的说明书 | ~95.6% |
外部知识库相比微调的三大优势:
- 适配新APP极其高效: APP更新后,只需在知识库中调整对应条目,无需重新训练模型。
- 可针对性优化: 发现Agent混淆两个UI元素,只需在知识库中强调它们的区别即可解决。
- 知识可跨APP复用: 说明书是文本形式的知识,比模型参数更容易迁移。
进化的本质: 对UI的经验积累——原来不了解的界面功能,现在了解了。这种进化不是模型本身变强了,而是Agent通过外部知识库变得更聪明了。
三、动作的进化:App Agent X——让Agent长出"肌肉记忆"
1. 新的变化
从"每步都要思考"到"简单操作形成捷径"——Agent效率的质的飞跃
App Agent解决了准确率问题,但张驰团队很快发现了一个新的效率瓶颈:GUI Agent太慢了。
问题有多严重? 以在YouTube搜索一个视频为例,Agent需要:点击搜索框(思考20秒)→ 输入内容(思考20秒)→ 点击提交(思考20秒)→ 后面还有一长串操作。而人类做这三步根本不需要任何思考——已经形成了"肌肉记忆"。
根本原因: GUI Agent的action空间太low-level(低维)了。它能做的操作只有"点某个位置"“滑动某个位置"“长按某个位置”。无论一个操作是否需要智能,Agent都必须一视同仁地推理和思考。 这就好比一个人每次拿筷子都要重新学习怎么夹菜——荒谬至极。
2. 作者观点与解释
核心思想:将重复的low-level动作序列压缩为high-level Action(捷径)
张驰团队发表了App Agent X(标题即"可进化的GUI Agent”),核心做法是:
- 先让Agent执行一次任务,记录完整的操作链路(页面节点 + 动作节点的链条)
- 将链路拆成三元组,让模型充分理解每个环节的功能
- 识别哪些环节"不太会变、会稳定"——比如"点搜索框→输入内容→点提交"这三步永远是绑定在一起的
- 将这些稳定序列压缩成一个high-level action(如"search")
- 下次执行类似任务时,Agent的action空间中多了一个选项:直接选"search",三步自动执行,零思考
实验效果: 完成任务的平均时间大幅缩短,总步数显著减少,Token消耗也大幅降低。
从研究角度的关键创新:自我涌现而非人工定义
张驰特别区分了工程做法和研究做法:
- 工程做法(RPA路线): 人工定义high-level action,类似"按键精灵"录制并重复播放固定动作。RPA是一个极端——完全无智能,永远重复。
- 研究做法(App Agent X路线): Agent基于自己的历史轨迹,自主发现哪些环节可以被压缩,自己进化出新的high-level action。
张驰将这视为RPA与Agent的融合: RPA是零智能的全自动,Agent是全智能的低效率。App Agent X找到了中间地带——“一些intelligence-free的环节是不需要reason的”,让Agent把智能用在真正需要的地方。
一个令人惊喜的行业印证: 张驰提到Claude最近上线的"录制"功能(在Computer Use中),思想和App Agent X"非常非常像"——人来演示一个链路,系统自动抽象成一个可复用的skill。下次Agent就按照这个workflow执行。这说明从学术界到工业界,“让Agent从经验中进化出高维动作"已成为共识。
进化的本质: Agent的action空间从有限的几种(点击、滑动、长按),进化出了更高效、更高维的动作。这服务于准确率,更服务于效率。
四、架构的进化:Learning to Be a Doctor——用Agent优化Agent
1. 新的变化
从"人设计Agent架构"到"Agent设计Agent架构”——最激进、最高维的进化
前三个层级的进化分别发生在知识、经验和动作层面。第四个层级最为激进——工作流(Workflow)整体范式的进化,即让Agent自己来设计、优化Agent的架构。
背景:多Agent架构(Multi-Agent Framework)的兴起与困境。 2023年末,MetaGPT等开源项目将"软件公司SOP"套用在多Agent框架上——让不同的Agent扮演产品经理、工程师、测试、架构师等角色,按预定流程推进项目。医学诊断领域也有类似的多Agent架构:针对一张医学图像,从皮肤科、内科等不同角度诊断,最后汇总观点。
但手动设计这些架构有根本性局限: 需要人观察问题、找原因、修改架构(比如发现图像理解有问题就加一个专门的医学图像理解Agent,发现推理有问题就加辩论/反思机制)。这个过程本身可以被自动化。
2. 作者观点与解释
借鉴神经架构搜索(NAS):数据驱动的Agent设计
张驰从2020年左右极其火热的Neural Architecture Search(神经架构搜索)领域汲取灵感。NAS的核心思想是:不要靠人的启发式经验(“我觉得这里该叠一层卷积”)来设计网络,而是构造一个搜索空间,用可微优化或强化学习自动找到最优结构。
将这个思想迁移到Agent领域:
- 搜索空间(Search Space): Agent架构的候选选项——在哪里加条件判断、在哪里加循环、在哪里加并行分支;以及prompt层面的设计——思维链、反思机制、Tree of Thought等现成经验。
- 优化器: 另一个"元Agent"观察当前Agent的犯错原因,看到每个环节的输入输出和正确/错误答案,然后决定下一步如何优化——是优化prompt还是优化framework。
- 优化信号: 如果Agent在合理输入下准确率很高,说明架构好;如果错误多,说明设计有问题。
医学诊断实验的初步验证: 从最简单的"一问一答"(输入图像直接回答)开始,Agent自主进化出了更复杂的架构——自动增加了工具调用、辩论机制、反思环节等。在简单任务上取得了显著提升。
张驰的坦诚评估: 这是学术界的一个prototype(原型验证),增益在几轮搜索后会趋于收敛。但落到工业界的真实场景时,可以基于这个思想做大量扩展——search space和候选选项会因具体场景而异。
一个有趣的"暴论":中国职场经验对Agent优化的启示
张驰在报告中分享了一个半开玩笑但发人深省的观点:中国职场的某些"弊病"放在Agent上反而可能很先进。
- 裁员 → 在Agent中就是淘汰表现差的模块,替换为更好的——这恰好是"进化"
- PUA → 在prompt中威胁Agent(“做不出来你就会有大问题”),统计上确实能提升表现
- 画饼 → 在prompt中给Agent承诺/激励,也能产生效果
背后的严肃洞察是: 很多Agent研究的方法论,确实启发了真实生活中对人的管理——反过来,管理学中的策略(激励机制、淘汰机制、反馈循环)也可以迁移到Agent优化中。
进化的本质: 原来是人基于对事情的理解来设计Agent的SOP;现在是Agent基于数据和反馈,自己设计、自己优化。这是数据驱动的Agent设计——用Agent来优化Agent,用Agent来设计Agent。
总结:Agent进化的完整图景
张驰将整个报告浓缩为一张"进化全景图"——从固定工作流到动态架构,进化的四个层级层层递进:
| 进化层级 | 代表工作 | 进化的内容 | 关键机制 |
|---|---|---|---|
| 知识 | Text-to-SQL (SQA整) | 从不了解数据库到了如指掌 | 反向探索 + 经验检索 |
| 经验 | App Agent | 从不了解界面功能到熟练使用 | 自动生成说明书(外部知识库) |
| 动作 | App Agent X | 从低维点击/滑动的重复操作到高维Action涌现 | 历史轨迹分析 + Shortcut压缩 |
| 架构 | Learning to Be a Doctor | 从人设计Agent到Agent设计Agent | 神经架构搜索思想迁移 |
四个层级的共同特征: 进化都不是让模型本身(参数)变大或变强,而是让Agent在与环境的交互中,通过积累知识、形成经验、涌现高维动作、自我重构架构,来实现持续迭代。真正的智能不在于模型有多强,而在于模型如何动态地组织和利用外部资源。
这也呼应了张驰开场的判断——Agent研究的特殊性恰恰在于:它不在模型层面做研究,而在"模型的输出输入接口"层面做研究。当接口足够灵活、足够动态,Agent就不再是固定工作流的执行者,而是一个自主进化的智能体。
报告最后,张驰用一句话总结了整个团队的核心理念:“我们的工作从四个例子去讲Agent的概念——从知识、经验、动作、架构,阐释Agent的进化。”