8月20日阿里放出了 Qwen-UI-Agent,一个专门干”操作界面”这件事的基座模型。手机、电脑、网页三端全覆盖,还带 DeepSearch 环境。
先看数字。移动端 MobileWorld 82.1%,比 GPT-5.6 Sol 高 12 个点,比 Claude Opus 4.8 高 14.6 个点;换到贴近真机的 MobileWorld-Real,92.2%,把 Gemini 3.1 Pro 也压下去了;AndroidDaily 97.5%,基本是天花板。桌面端 OSWorld-Verified 79.5%,WebArena 73.6% 排第一,GUI Grounding 的 ScreenSpot-Pro 81.5%。
这事的关键其实不在榜单,在他们怎么造训练环境。阿里搭了一套 100 多台真手机、150 多款 App 的真机集群,让模型在真的系统里点、划、等加载、被弹窗打断。GUI 智能体一直卡在”仿真里跑得飞起,装到真机上就懵”,因为模拟器不会给你弹一个开屏广告,也不会让你的网络突然卡三秒。用真机跑数据成本高得多,但这一步不吃透,benchmark 再漂亮也落不了地。
另一个被低估的点是 Grounding。让模型说出”我要点搜索框”很容易,让它在 1080p 截图里精确指出搜索框的像素坐标才是硬活。ScreenSpot-Pro 考的就是这个,81.5% 意味着五次里面大概有一次会点歪——听起来还行,但如果一个任务要连点十几步,单步 81.5% 乘起来就很难看了。所以后面几个刷新 SOTA 的基准更值得看,它们考的是端到端把事办成。
对普通用户来说,这类模型真正兑现的场景是”帮我把这个 App 里的东西导出来”、”照着这个流程给我把表填了”。目前还没到你能随手托付的程度,但从模拟器搬到真机这一步走完了,剩下的就是磨。
顺带说一句,阿里这两年在 通义Qwen 这条线上的节奏是真的快,开源基座、多模态、Agent 三头并进,海外开发者社区的讨论热度也一直没掉下去。
阿里发Qwen-UI-Agent:让模型自己在手机上点来点去,AndroidDaily跑到97.5%