Qwen-UI-Agent 发布:阿里让 AI 直接看懂屏幕操作 App,真机 92.2% 超越 GPT-5.6 Sol——GUI 智能体从嘴替到手替(2026年8月)
Qwen-UI-Agent 深度解析:阿里千问 2026-08-20 发布的 GUI 图形界面智能体基座模型,覆盖手机/PC/网页/深度搜索四环境,真机 MobileWorld-Real 92.2%、AndroidDaily 97.5%、OSWorld-Verified 79.5%、WebArena 73.6% 等基准全面对标超越 GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro。含技术拆解、四强横评、安全机制与落地场景。
先说结论
2026 年 8 月 20 日晚,阿里千问正式发布 Qwen-UI-Agent——一个以真实世界为中心的 GUI(图形用户界面)智能体基座模型。它做的事情很朴素也很颠覆:不依赖任何 API,AI 直接看懂屏幕截图、理解界面布局、模拟手指和鼠标完成操作,把高德、大众点评、12306 这类没有开放接口的传统软件,变成 AI 可以驱动的"手脚"。官方数据显示,真机基准 MobileWorld-Real 达到 92.2%,AndroidDaily 高达 97.5%,多项评测刷新 SOTA,综合对标并超越 GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro 等海外旗舰。
一、Qwen-UI-Agent 是什么:数字设备的"通用执行器"
在理解这款模型之前,先想一个问题:为什么 AI 助手能做那么多事,却搞不定"帮我打开 App 订个餐"?
因为绝大多数操作类任务依赖 API——软件厂商不开放接口,AI 就无从下手。而现实世界大量软件(尤其是手机 App)并没有公开 API,改造又贵又慢。
Qwen-UI-Agent 的路线完全不同:把屏幕当作输入,把点击、滑动、输入当作输出。模型先"看懂"当前界面(按钮在哪、输入框在哪、哪些文字可选),再决定下一步动作,循环往复直到任务完成。官方称其为"数字设备通用执行器"——不需要改造任何程序,AI 靠看懂屏幕就能操作。
这不是第一个做这件事的模型。Claude、GPT 系列都展示过 computer use 能力,智谱的 AutoGLM 也在国内抢先落地。但 Qwen-UI-Agent 的差异在于两点:一是它把"真机"作为训练和评测的主战场,二是它同时覆盖手机、PC、浏览器和深度搜索四个环境,并依托 Harness 框架与自家的 DeepSearch 深度搜索联动。
二、五大基准全面看:多项 SOTA、一项近满分
根据千问官方公布的评测数据,Qwen-UI-Agent 在五类 GUI 任务上全面对标乃至超越海外旗舰:
移动端(模拟环境)
- MobileWorld:82.1%,分别领先 GPT-5.6 Sol 12.0 个百分点、Claude Opus 4.8 14.6 个百分点、Seed 2.1 Pro 8.9 个百分点
- AndroidDaily:97.5%,接近满分
移动端(真机环境)
- MobileWorld-Real:92.2%,超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro
桌面端
- OSWorld-Verified:79.5%,超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro
- OSWorld-v2 Partial:40.0%,同时相比基线节省 58% 执行步数
浏览器与深度搜索
- WebArena:73.6%,位列所有对比模型第一
- BrowseComp-ZH:75.0%
界面定位(GUI Grounding)
- ScreenSpot-Pro:81.5%,其余 4 个 grounding 评测基准也全部刷新 SOTA
还有一个容易被忽略的点:Qwen-UI-Agent 在通用能力和 Agentic 能力上"保持或超越训练基座模型",并且大幅领先同类 GUI 专用模型。换句话说,它不是"只会点屏幕的偏科生",而是"通用智能不缩水、还会操作屏幕的全能生"——这意味着它能在真实世界的长尾需求里兜底,而不只在评测榜单上好看。想了解它背后的国产模型家族,可参考我们对 Qwen3.8-Max 的完整解析。
三、真机环境的含金量:从模拟到真实的最后一公里
GUI Agent 领域有个公认的难题:模拟器里跑得好,真机上一塌糊涂。
屏幕分辨率不同、动画时序不同、弹窗乱入、网络延迟、第三方 App 更新改版……模拟环境里训练出来的模型,一上真机就容易"迷路"。过去很多团队的策略是加大模拟数据,而 Qwen-UI-Agent 选择正面硬刚:搭建了覆盖 100+ 台真实手机、150+ 应用的移动真机环境,用于任务构建、轨迹采集、模型训练与评测,并自建了 MobileWorld-Real 真机基准(400+ 任务、100+ 应用),打通"从模拟到真实"的最后一公里。
这也是为什么真机的 92.2% 比模拟环境的 82.1% 更值得关注——前者是在真实手机上跑出来的,包含真机才有的各种意外情况。
四、技术拆解:GUI+CLI 混合动作与 100 步长程强化学习
Qwen-UI-Agent 有三个技术特点值得开发者关注:
1. GUI 图形操作 + CLI 命令行混合动作
它不只输出"点击、滑动",还能在需要时直接执行命令行。官方数据显示,约 40% 的桌面任务涉及批量 CLI 命令。混合动作的好处是效率:能一条命令解决的,不必一步步点界面;界面能处理的,也不必费劲敲命令。
2. 超 100 步长程轨迹在线强化学习
真实任务往往要几十上百步(订个咖啡:搜索→打开点评→筛选→记店名→切小红书→查评价→总结)。官方称模型支持超 100 步的长轨迹在线强化学习,使用约 1 万个并发环境持续迭代,并搭载 AutoResearch 式 AI 驱动数据飞轮,实现任务闭环迭代——跑得越多、错得越少。
3. 依托 Harness 框架,跨设备任务接力
Qwen-UI-Agent 具备主动服务能力,支持手机、电脑跨设备任务接力,还可以和 DeepSearch 联动,把网页检索和界面操作结合起来——搜到信息后直接落地成操作。这套"模型+框架"的组合拳,与 DeepSeek Harness 提出的"模型(大脑)+ 框架(身体)= Agent"思路殊途同归,可参考我们此前的 DeepSeek Harness 开源解析。
五、四强横评:Qwen-UI-Agent 凭什么登顶
把 Qwen-UI-Agent 与三款海外旗舰(GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro)放在同一张表里看,登顶逻辑更清楚:
| 维度 | Qwen-UI-Agent | GPT-5.6 Sol | Claude Opus 4.8 | Gemini 3.1 Pro |
|---|---|---|---|---|
| 移动端 MobileWorld | 82.1% | 70.1% | 67.5% | 未披露 |
| 真机 MobileWorld-Real | 92.2%(登顶) | 被超越 | 被超越 | 被超越 |
| AndroidDaily | 97.5%(近满分) | 未披露 | 未披露 | 未披露 |
| 桌面 OSWorld-Verified | 79.5%(第一) | 未披露 | 未披露 | 被超越 |
| 浏览器 WebArena | 73.6%(第一) | 未披露 | 未披露 | 未披露 |
| GUI 定位 ScreenSpot-Pro | 81.5%(SOTA) | 未披露 | 未披露 | 未披露 |
| 敏感操作确认 | 支付/删数据需确认 | 有安全护栏 | 有安全护栏 | 有安全护栏 |
可以看出,Qwen-UI-Agent 的优势在"全环境通吃":移动、桌面、浏览器、界面定位四条线同时登顶,而不是单点突出。这也是它敢自称"以真实世界为中心"的底气。
六、安全机制:该拒绝的拒绝,该确认的确认
让 AI 操作你的手机和电脑,安全是第一道坎。Qwen-UI-Agent 的安全设计分两层:
- 拒绝层:非法或高风险任务直接拒绝执行;
- 确认层:支付、删除数据、权限授权等敏感操作,在关键步骤停下来,向用户明确提示、等用户确认后才继续。
这种"操作自由 + 关键节点人工确认"的模式,基本是 GUI Agent 行业的共识设计——既要让 AI 干得动活,又要让用户始终握有刹车。对普通用户来说,这意味着即使 AI 在替你跑任务,涉及钱和隐私的每一步都还在你手里。
七、谁在受益:三类人现在就能用上
1. 普通用户
手机上的高频操作(查路线、订餐、比价、看攻略)可以交给 AI 一站式完成。官方演示的典型场景:让 AI 在高德搜索地址→大众点评找附近咖啡馆→小红书查评价推荐,全链路自动串联;或者让 AI 在 12306 查下周三最早到杭州西的高铁班次。
2. 企业
大量内部系统(OA、ERP、老旧业务软件)没有 API,改造周期长、成本高。Qwen-UI-Agent 提供了一条"零改造"路径:AI 直接操作现有界面,把 RPA 的活儿干得更聪明——因为它能理解界面语义,界面改版后也能自适应,而不是像传统 RPA 那样依赖固定坐标。
3. 开发者
GUI Agent 是 2026 年最热门的 Agent 赛道之一。Qwen-UI-Agent 作为基座模型,叠加 Harness 框架和 DeepSearch,为开发"数字员工"提供了完整底座;自建的真机基准 MobileWorld-Real 也给行业提供了一个可复用的评测标尺。搭配 通义千问 生态里的其他模型与工具,可以快速搭建"看懂屏幕、替你干活"的应用。
八、诚实边界:榜单之外,还有三道坎
评测登顶不等于体验无敌,有几点必须说清楚:
- 榜单以官方自报为准:MobileWorld-Real 等真机基准是阿里自建并公布的,对比模型成绩来自官方披露口径,建议等第三方复测和开放评测后再下最终结论;
- 生态与落地成本未明:真机集群训练意味着成本不低,模型的 API 定价、开源节奏都还没公布,中小团队能否用得起要等后续;
- 长尾 App 的阅读理解仍是考验:真机 92.2% 背后是 100+ 应用,但现实世界的软件数以百万计,改版、冷门应用、复杂页面依然是持续挑战。
九、行业拐点:从嘴替到手替
Qwen-UI-Agent 的发布,标志着一个明确信号:国产大模型的竞争,正在从"谁能说得更好"转向"谁能干得更多"。聊天、写作、编程之后,操作实体软件成为新的战场。当 AI 能真正替你点外卖、查票、操作企业系统,Agent 就不再是"对话框里的助手",而是"屏幕上的员工"。
这与端侧大模型把 AI 塞进手机的趋势相互叠加——AI 离用户越来越近,能干的事越来越多。想了解这条脉络,可以看看我们对 2026 端侧大模型拐点 的分析,以及国产模型阵营最近的密集动作(如 GLM-5.3 的纯后训练路线)。
对普通用户而言,AI 的可用边界正从"信息"扩展到"动作";对企业而言,大量存量软件第一次有了"零改造智能化"的可能。拐点已至,接下来的问题是:谁先把这些能力变成稳定、便宜、好用的产品。
FAQ
Qwen-UI-Agent 和普通大模型有什么区别? 普通大模型只能处理文本和图片,回答"怎么做";Qwen-UI-Agent 是 GUI 智能体基座模型,能把屏幕截图当作输入、把点击/滑动/输入当作输出,直接模拟人类操作手机和电脑软件,从"嘴替"变成"手替"。它同时保留基座模型的通用对话与 Agent 能力,不是偏科的界面专用模型。
它能操作哪些软件?需要 API 吗? 不需要 API。它的核心价值正是解决大量没有开放接口的传统软件——AI 依靠看懂屏幕就完成操作,覆盖手机 App、PC 桌面软件、网页以及深度搜索环境。官方基于 100+ 台真实手机、150+ 应用构建训练与评测环境,并支持跨设备任务接力。
真机 MobileWorld-Real 92.2% 是什么概念? MobileWorld-Real 是阿里自建的真机基准,包含 400+ 真实任务、100+ 应用,在真实手机上运行而非模拟器,能反映弹窗、网络、动画时序等真实干扰。92.2% 的成绩超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol;模拟端 MobileWorld 82.1%,领先 GPT-5.6 Sol 12.0 个百分点。
AI 操作我的手机安全吗?会不会乱点? Qwen-UI-Agent 的安全机制分两层:非法或高风险任务直接拒绝执行;支付、删除数据、权限授权等敏感操作会在关键步骤停下来,明确提示并等待用户确认后才继续。操作自由与人工刹车并存,敏感环节始终由用户把关。
什么时候能用上?会开源吗? 目前官方已发布模型与 Harness 框架能力介绍,API 定价与开源节奏尚未公布。参考阿里千问 Qwen 系列的惯例(Qwen3.8-Max 等均已开源),开源可能性较大,但需以官方后续公告为准。可关注千问官方渠道获取上线信息。
*数据来源:千问官方公众号、IT之家、快科技、DoNews、凤凰网(2026-08-20 报道),评测数据以官方公布为准。*
❓ 常见问题
普通大模型只能处理文本和图片,回答你怎么做;Qwen-UI-Agent 是 GUI 智能体基座模型,能把屏幕截图当作输入、把点击/滑动/输入当作输出,直接模拟人类操作手机和电脑软件,从嘴替变成手替。它同时保留基座模型的通用对话与 Agent 能力,不是偏科的界面专用模型。
不需要 API。它的核心价值正是解决大量没有开放接口的传统软件——AI 依靠看懂屏幕就完成操作,覆盖手机 App、PC 桌面软件、网页以及深度搜索环境。官方基于 100+ 台真实手机、150+ 应用构建训练与评测环境,并支持跨设备任务接力。
MobileWorld-Real 是阿里自建的真机基准,包含 400+ 真实任务、100+ 应用,在真实手机上运行而非模拟器,能反映弹窗、网络、动画时序等真实干扰。92.2% 的成绩超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol,官方同时公布移动端模拟基准 MobileWorld 82.1%(领先 GPT-5.6 Sol 12 个百分点)。
Qwen-UI-Agent 的安全机制分两层:非法或高风险任务直接拒绝执行;支付、删除数据、权限授权等敏感操作会在关键步骤停下来,明确提示并等待用户确认后才继续。也就是说操作自由与人工刹车并存,敏感环节始终由用户把关。
目前官方已发布模型与 Harness 框架能力介绍,API 定价与开源节奏尚未公布。参考阿里千问 Qwen 系列的惯例(Qwen3.8-Max 等均已开源),开源可能性较大,但需以官方后续公告为准。开发者可关注千问官方渠道获取上线信息。