<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>GUI Agent on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/gui-agent/</link><description>Recent content in GUI Agent on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 23 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/gui-agent/index.xml" rel="self" type="application/rss+xml"/><item><title>OSWorld-Pro：用过程式评测给 Computer-Use Agent 做「分步体检」</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-osworld-pro-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-osworld-pro-paper-reading/</guid><description>OSWorld-Pro 是 NVIDIA 提出的首个面向 Computer-Use Agent（CUA）的过程式评测基准，用来补 OSWorld 那类「只看最终结果」评测的盲区。它包含 305 个长程任务、2814 个顺序依赖子目标、67,264 条步级人工标注（&amp;gt;5000 人时），覆盖 Diversity（117）/ Coordination（109，需跨 ≥4 个应用）/ Robustness（79，跨 Linux 发行版与 GUI）三类，任务平均 9.2 个顺序子目标、3.45 个应用（OSWorld 仅 1.34）。论文用与人类对齐的 LLM-Judge（GPT-5.6-Sol Max）做子目标完成度判定，其 1-MAE 达 93.0，逼近人类标注的 96.0。核心发现：即便最强模型也很吃力——Claude Opus 4.8 Max 以 77.7% 总完成率居首（OSWorld 同级最强 Opus 为 83.4%）；开源最佳 Qwen3.8 Flash Next 仅 55.1%，且在 Robustness 上骤降到 32.9%；Minimax M3 从 OSWorld 的 75.2% 暴跌到 28.9%。过程式视角还暴露了结果式评测看不到的失败模式：强模型也会陷在 subgoal-irrelevant 动作里（Claude Opus 5 曾卡 59 步做无关操作），弱模型则在 click 坐标这类基础操作上频繁出错。本文按九部分结构拆解其背景、定位、问题定义、数据构建、LLM-Judge 设计、外部交叉验证、核心结果、失败模式分析与启示。</description></item><item><title>EvoSkill-GUI 精读：技能不是静态文档，而是能自我修订的活知识</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-evoskill-gui-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-evoskill-gui-paper-reading/</guid><description>浙大×电子科大提出 EvoSkill-GUI：现有 Agent 技能框架把技能当部署前写好的静态文档，但 GUI 环境的弹窗、延迟加载、控件迁移让静态技能迅速过期。EvoSkill 把技能做成结构化多文件包（检索元数据+可执行计划+备份定位+失败恢复规则+失败案例），通过 reflect-revise-reuse 循环在部署时从执行反馈中持续修订，全程零训练。Mobile-World/AndroidWorld/OSWorld 三大基准最大增益 +16.2%/+6.0%/+10.5%，进化出的技能库还能反哺相关任务。</description></item><item><title>Agent进化的四个层级：从知识更新到工作流自我设计——西湖大学张驰解读智能体动态架构</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-02-zhangchi-agent-evolution-four-levels/</link><pubDate>Thu, 02 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-02-zhangchi-agent-evolution-four-levels/</guid><description>整理自西湖大学张驰在「即兴之星」活动上的学术报告。张驰将Agent的&amp;quot;进化&amp;quot;拆解为四个递进层级——知识进化（Text-to-SQL的探索-部署范式）、经验进化（App Agent的自动生成说明书）、动作进化（App Agent X的高维Action涌现）、架构进化（Learning to Be a Doctor的Agent自优化工作流）。核心主张：真正的进化不是模型参数变大，而是让Agent像人一样，通过积累知识、形成肌肉记忆、涌现高维动作、最终自我设计工作流来不断迭代。报告还分享了GUI Agent不应靠微调实现泛化、RPA与Agent的融合思路、以及&amp;quot;用Agent优化Agent&amp;quot;这一神经架构搜索思想在Agent时代的回归。</description></item></channel></rss>