# Qwen-UI-Agent 发布：阿里让 AI 直接看懂屏幕操作 App，真机 92.2% 超越 GPT-5.6 Sol——GUI 智能体从嘴替到手替（2026年8月）

## 先说结论

2026 年 8 月 20 日晚，阿里千问正式发布 Qwen-UI-Agent——一个以真实世界为中心的 GUI（图形用户界面）智能体基座模型。它做的事情很朴素也很颠覆：不依赖任何 API，AI 直接看懂屏幕截图、理解界面布局、模拟手指和鼠标完成操作，把高德、大众点评、12306 这类没有开放接口的传统软件，变成 AI 可以驱动的"手脚"。官方数据显示，真机基准 MobileWorld-Real 达到 92.2%，AndroidDaily 高达 97.5%，多项评测刷新 SOTA，综合对标并超越 [GPT-5.6 Sol](/tools/chatgpt/)、[Claude Opus 4.8](/tools/claude/)、[Gemini 3.1 Pro](/tools/gemini/) 等海外旗舰。

## 一、Qwen-UI-Agent 是什么：数字设备的"通用执行器"

在理解这款模型之前，先想一个问题：为什么 AI 助手能做那么多事，却搞不定"帮我打开 App 订个餐"？

因为绝大多数操作类任务依赖 API——软件厂商不开放接口，AI 就无从下手。而现实世界大量软件（尤其是手机 App）并没有公开 API，改造又贵又慢。

Qwen-UI-Agent 的路线完全不同：把屏幕当作输入，把点击、滑动、输入当作输出。模型先"看懂"当前界面（按钮在哪、输入框在哪、哪些文字可选），再决定下一步动作，循环往复直到任务完成。官方称其为"数字设备通用执行器"——不需要改造任何程序，AI 靠看懂屏幕就能操作。

这不是第一个做这件事的模型。Claude、GPT 系列都展示过 computer use 能力，智谱的 AutoGLM 也在国内抢先落地。但 Qwen-UI-Agent 的差异在于两点：一是它把"真机"作为训练和评测的主战场，二是它同时覆盖手机、PC、浏览器和深度搜索四个环境，并依托 Harness 框架与自家的 DeepSearch 深度搜索联动。

## 二、五大基准全面看：多项 SOTA、一项近满分

根据千问官方公布的评测数据，Qwen-UI-Agent 在五类 GUI 任务上全面对标乃至超越海外旗舰：

**移动端（模拟环境）**
- MobileWorld：82.1%，分别领先 GPT-5.6 Sol 12.0 个百分点、Claude Opus 4.8 14.6 个百分点、Seed 2.1 Pro 8.9 个百分点
- AndroidDaily：97.5%，接近满分

**移动端（真机环境）**
- MobileWorld-Real：92.2%，超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro

**桌面端**
- OSWorld-Verified：79.5%，超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro
- OSWorld-v2 Partial：40.0%，同时相比基线节省 58% 执行步数

**浏览器与深度搜索**
- WebArena：73.6%，位列所有对比模型第一
- BrowseComp-ZH：75.0%

**界面定位（GUI Grounding）**
- ScreenSpot-Pro：81.5%，其余 4 个 grounding 评测基准也全部刷新 SOTA

还有一个容易被忽略的点：Qwen-UI-Agent 在通用能力和 Agentic 能力上"保持或超越训练基座模型"，并且大幅领先同类 GUI 专用模型。换句话说，它不是"只会点屏幕的偏科生"，而是"通用智能不缩水、还会操作屏幕的全能生"——这意味着它能在真实世界的长尾需求里兜底，而不只在评测榜单上好看。想了解它背后的国产模型家族，可参考我们对 [Qwen3.8-Max](/articles/qwen38-max-open-source-long-horizon-agent-2026/) 的完整解析。

## 三、真机环境的含金量：从模拟到真实的最后一公里

GUI Agent 领域有个公认的难题：模拟器里跑得好，真机上一塌糊涂。

屏幕分辨率不同、动画时序不同、弹窗乱入、网络延迟、第三方 App 更新改版……模拟环境里训练出来的模型，一上真机就容易"迷路"。过去很多团队的策略是加大模拟数据，而 Qwen-UI-Agent 选择正面硬刚：搭建了覆盖 100+ 台真实手机、150+ 应用的移动真机环境，用于任务构建、轨迹采集、模型训练与评测，并自建了 MobileWorld-Real 真机基准（400+ 任务、100+ 应用），打通"从模拟到真实"的最后一公里。

这也是为什么真机的 92.2% 比模拟环境的 82.1% 更值得关注——前者是在真实手机上跑出来的，包含真机才有的各种意外情况。

## 四、技术拆解：GUI+CLI 混合动作与 100 步长程强化学习

Qwen-UI-Agent 有三个技术特点值得开发者关注：

**1. GUI 图形操作 + CLI 命令行混合动作**

它不只输出"点击、滑动"，还能在需要时直接执行命令行。官方数据显示，约 40% 的桌面任务涉及批量 CLI 命令。混合动作的好处是效率：能一条命令解决的，不必一步步点界面；界面能处理的，也不必费劲敲命令。

**2. 超 100 步长程轨迹在线强化学习**

真实任务往往要几十上百步（订个咖啡：搜索→打开点评→筛选→记店名→切小红书→查评价→总结）。官方称模型支持超 100 步的长轨迹在线强化学习，使用约 1 万个并发环境持续迭代，并搭载 AutoResearch 式 AI 驱动数据飞轮，实现任务闭环迭代——跑得越多、错得越少。

**3. 依托 Harness 框架，跨设备任务接力**

Qwen-UI-Agent 具备主动服务能力，支持手机、电脑跨设备任务接力，还可以和 DeepSearch 联动，把网页检索和界面操作结合起来——搜到信息后直接落地成操作。这套"模型+框架"的组合拳，与 DeepSeek Harness 提出的"模型（大脑）+ 框架（身体）= Agent"思路殊途同归，可参考我们此前的 [DeepSeek Harness 开源解析](/articles/deepseek-harness-open-source-agent-framework-2026/)。

## 五、四强横评：Qwen-UI-Agent 凭什么登顶

把 Qwen-UI-Agent 与三款海外旗舰（GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro）放在同一张表里看，登顶逻辑更清楚：

| 维度 | Qwen-UI-Agent | GPT-5.6 Sol | Claude Opus 4.8 | Gemini 3.1 Pro |
|------|--------------|-------------|-----------------|----------------|
| 移动端 MobileWorld | 82.1% | 70.1% | 67.5% | 未披露 |
| 真机 MobileWorld-Real | 92.2%（登顶） | 被超越 | 被超越 | 被超越 |
| AndroidDaily | 97.5%（近满分） | 未披露 | 未披露 | 未披露 |
| 桌面 OSWorld-Verified | 79.5%（第一） | 未披露 | 未披露 | 被超越 |
| 浏览器 WebArena | 73.6%（第一） | 未披露 | 未披露 | 未披露 |
| GUI 定位 ScreenSpot-Pro | 81.5%（SOTA） | 未披露 | 未披露 | 未披露 |
| 敏感操作确认 | 支付/删数据需确认 | 有安全护栏 | 有安全护栏 | 有安全护栏 |

可以看出，Qwen-UI-Agent 的优势在"全环境通吃"：移动、桌面、浏览器、界面定位四条线同时登顶，而不是单点突出。这也是它敢自称"以真实世界为中心"的底气。

 
   
   ▲ Qwen-UI-Agent vs GPT-5.6 Sol vs Claude Opus 4.8 四强横评 
 

## 六、安全机制：该拒绝的拒绝，该确认的确认

让 AI 操作你的手机和电脑，安全是第一道坎。Qwen-UI-Agent 的安全设计分两层：

- **拒绝层**：非法或高风险任务直接拒绝执行；
- **确认层**：支付、删除数据、权限授权等敏感操作，在关键步骤停下来，向用户明确提示、等用户确认后才继续。

这种"操作自由 + 关键节点人工确认"的模式，基本是 GUI Agent 行业的共识设计——既要让 AI 干得动活，又要让用户始终握有刹车。对普通用户来说，这意味着即使 AI 在替你跑任务，涉及钱和隐私的每一步都还在你手里。

## 七、谁在受益：三类人现在就能用上

**1. 普通用户**

手机上的高频操作（查路线、订餐、比价、看攻略）可以交给 AI 一站式完成。官方演示的典型场景：让 AI 在高德搜索地址→大众点评找附近咖啡馆→小红书查评价推荐，全链路自动串联；或者让 AI 在 12306 查下周三最早到杭州西的高铁班次。

**2. 企业**

大量内部系统（OA、ERP、老旧业务软件）没有 API，改造周期长、成本高。Qwen-UI-Agent 提供了一条"零改造"路径：AI 直接操作现有界面，把 RPA 的活儿干得更聪明——因为它能理解界面语义，界面改版后也能自适应，而不是像传统 RPA 那样依赖固定坐标。

**3. 开发者**

GUI Agent 是 2026 年最热门的 Agent 赛道之一。Qwen-UI-Agent 作为基座模型，叠加 Harness 框架和 DeepSearch，为开发"数字员工"提供了完整底座；自建的真机基准 MobileWorld-Real 也给行业提供了一个可复用的评测标尺。搭配 [通义千问](/tools/qwen-chat/) 生态里的其他模型与工具，可以快速搭建"看懂屏幕、替你干活"的应用。

## 八、诚实边界：榜单之外，还有三道坎

评测登顶不等于体验无敌，有几点必须说清楚：

1. **榜单以官方自报为准**：MobileWorld-Real 等真机基准是阿里自建并公布的，对比模型成绩来自官方披露口径，建议等第三方复测和开放评测后再下最终结论；
2. **生态与落地成本未明**：真机集群训练意味着成本不低，模型的 API 定价、开源节奏都还没公布，中小团队能否用得起要等后续；
3. **长尾 App 的阅读理解仍是考验**：真机 92.2% 背后是 100+ 应用，但现实世界的软件数以百万计，改版、冷门应用、复杂页面依然是持续挑战。

## 九、行业拐点：从嘴替到手替

Qwen-UI-Agent 的发布，标志着一个明确信号：国产大模型的竞争，正在从"谁能说得更好"转向"谁能干得更多"。聊天、写作、编程之后，操作实体软件成为新的战场。当 AI 能真正替你点外卖、查票、操作企业系统，Agent 就不再是"对话框里的助手"，而是"屏幕上的员工"。

这与端侧大模型把 AI 塞进手机的趋势相互叠加——AI 离用户越来越近，能干的事越来越多。想了解这条脉络，可以看看我们对 [2026 端侧大模型拐点](/articles/edge-ai-ondevice-large-model-202607/) 的分析，以及国产模型阵营最近的密集动作（如 [GLM-5.3 的纯后训练路线](/articles/glm-5-3-post-training-cyber-security-2026/)）。

对普通用户而言，AI 的可用边界正从"信息"扩展到"动作"；对企业而言，大量存量软件第一次有了"零改造智能化"的可能。拐点已至，接下来的问题是：谁先把这些能力变成稳定、便宜、好用的产品。

## FAQ

**Qwen-UI-Agent 和普通大模型有什么区别？**
普通大模型只能处理文本和图片，回答"怎么做"；Qwen-UI-Agent 是 GUI 智能体基座模型，能把屏幕截图当作输入、把点击/滑动/输入当作输出，直接模拟人类操作手机和电脑软件，从"嘴替"变成"手替"。它同时保留基座模型的通用对话与 Agent 能力，不是偏科的界面专用模型。

**它能操作哪些软件？需要 API 吗？**
不需要 API。它的核心价值正是解决大量没有开放接口的传统软件——AI 依靠看懂屏幕就完成操作，覆盖手机 App、PC 桌面软件、网页以及深度搜索环境。官方基于 100+ 台真实手机、150+ 应用构建训练与评测环境，并支持跨设备任务接力。

**真机 MobileWorld-Real 92.2% 是什么概念？**
MobileWorld-Real 是阿里自建的真机基准，包含 400+ 真实任务、100+ 应用，在真实手机上运行而非模拟器，能反映弹窗、网络、动画时序等真实干扰。92.2% 的成绩超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol；模拟端 MobileWorld 82.1%，领先 GPT-5.6 Sol 12.0 个百分点。

**AI 操作我的手机安全吗？会不会乱点？**
Qwen-UI-Agent 的安全机制分两层：非法或高风险任务直接拒绝执行；支付、删除数据、权限授权等敏感操作会在关键步骤停下来，明确提示并等待用户确认后才继续。操作自由与人工刹车并存，敏感环节始终由用户把关。

**什么时候能用上？会开源吗？**
目前官方已发布模型与 Harness 框架能力介绍，API 定价与开源节奏尚未公布。参考阿里千问 Qwen 系列的惯例（Qwen3.8-Max 等均已开源），开源可能性较大，但需以官方后续公告为准。可关注千问官方渠道获取上线信息。

*数据来源：千问官方公众号、IT之家、快科技、DoNews、凤凰网（2026-08-20 报道），评测数据以官方公布为准。*
