OSWorld-Pro:用过程式评测给 Computer-Use Agent 做「分步体检」

OSWorld-Pro 是 NVIDIA 提出的首个面向 Computer-Use Agent(CUA)的过程式评测基准,用来补 OSWorld 那类「只看最终结果」评测的盲区。它包含 305 个长程任务、2814 个顺序依赖子目标、67,264 条步级人工标注(>5000 人时),覆盖 Diversity(117)/ Coordination(109,需跨 ≥4 个应用)/ Robustness(79,跨 Linux 发行版与 GUI)三类,任务平均 9.2 个顺序子目标、3.45 个应用(OSWorld 仅 1.34)。论文用与人类对齐的 LLM-Judge(GPT-5.6-Sol Max)做子目标完成度判定,其 1-MAE 达 93.0,逼近人类标注的 96.0。核心发现:即便最强模型也很吃力——Claude Opus 4.8 Max 以 77.7% 总完成率居首(OSWorld 同级最强 Opus 为 83.4%);开源最佳 Qwen3.8 Flash Next 仅 55.1%,且在 Robustness 上骤降到 32.9%;Minimax M3 从 OSWorld 的 75.2% 暴跌到 28.9%。过程式视角还暴露了结果式评测看不到的失败模式:强模型也会陷在 subgoal-irrelevant 动作里(Claude Opus 5 曾卡 59 步做无关操作),弱模型则在 click 坐标这类基础操作上频繁出错。本文按九部分结构拆解其背景、定位、问题定义、数据构建、LLM-Judge 设计、外部交叉验证、核心结果、失败模式分析与启示。

September 23, 2026 · 5 min

EvoSkill-GUI 精读:技能不是静态文档,而是能自我修订的活知识

浙大×电子科大提出 EvoSkill-GUI:现有 Agent 技能框架把技能当部署前写好的静态文档,但 GUI 环境的弹窗、延迟加载、控件迁移让静态技能迅速过期。EvoSkill 把技能做成结构化多文件包(检索元数据+可执行计划+备份定位+失败恢复规则+失败案例),通过 reflect-revise-reuse 循环在部署时从执行反馈中持续修订,全程零训练。Mobile-World/AndroidWorld/OSWorld 三大基准最大增益 +16.2%/+6.0%/+10.5%,进化出的技能库还能反哺相关任务。

September 18, 2026 · 2 min

Agent进化的四个层级:从知识更新到工作流自我设计——西湖大学张驰解读智能体动态架构

整理自西湖大学张驰在「即兴之星」活动上的学术报告。张驰将Agent的"进化"拆解为四个递进层级——知识进化(Text-to-SQL的探索-部署范式)、经验进化(App Agent的自动生成说明书)、动作进化(App Agent X的高维Action涌现)、架构进化(Learning to Be a Doctor的Agent自优化工作流)。核心主张:真正的进化不是模型参数变大,而是让Agent像人一样,通过积累知识、形成肌肉记忆、涌现高维动作、最终自我设计工作流来不断迭代。报告还分享了GUI Agent不应靠微调实现泛化、RPA与Agent的融合思路、以及"用Agent优化Agent"这一神经架构搜索思想在Agent时代的回归。

July 2, 2026 · 2 min