阿里 Qwen-UI-Agent 上线:100 多台真机训出来的模型,主打一个“会用每一块屏幕“

大家好,我是木泽。
2026 年 8 月 20 日,阿里千问正式发布 GUI 智能体基座模型 Qwen-UI-Agent。它让 AI 直接看懂屏幕、操作 App 和软件,覆盖手机、电脑、网页、深度搜索四端。模型基于 Qwen 3.5 系列,提供 4B / 27B / 35B-A3B 三个版本,主力 27B。
⭐️ 核心要点:在 6 项核心 GUI 基准里 5 项刷 SOTA,包括移动端 MobileWorld 82.1%、真机基准 MobileWorld-Real 92.2%、AndroidDaily 97.5%。训练用 100+ 台真实手机 + 150+ 款应用的真机集群,自建 MobileWorld-Real 基准(400+ 任务、100+ 应用)。技术报告(arXiv 2607.28227)、项目主页、GitHub 仓库同步开源。
它到底是什么
Qwen-UI-Agent 不只是一个聊天模型,它是让 AI 直接看懂屏幕、操作 App 和软件的基座模型,定位是"数字设备上的通用执行器"。

具体能干什么,举三个官方演示场景:
- 跨 App 查信息:让它帮你查高德找咖啡馆、到大众点评找附近高人气店、再去小红书看前 5 条笔记推荐——它会自己点开不同 App、输入、滑动、截图理解。
- 跨端任务编排:让你下周三从北京回杭州,帮你看 12306 最早到杭州西的高铁时刻、算地铁到公司时间、再在钉钉安排到达后的项目同步会。
- 文件批处理:手机相册里的收据移到电脑 receipts 文件夹,按日期重命名,再生成 Excel 汇总——跨手机+电脑+本地文件三端。
⚠️ 注意:演示是演示,真实业务能不能稳跑、能不能扛住 App 频繁改版,得等社区大规模实测。目前开放的是模型权重和技术报告,不是"开箱即用"的 SaaS 产品。
🌈 拓展:主力版本参数量 27B,比同档闭源旗舰小一个数量级,但多项 GUI 基准跑赢 GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 等头部模型。意味着这条路的门槛不在参数规模,而在训练基建。
关键看点:真机训练,把 sim-to-real 的最后一公里走通
这是整件事里,对工程同学最有信息量的一条。
现状:此前大多数 GUI 智能体是在模拟器里训练和评测的。模型在仿真 App 上点得很溜,换到真机就掉点——按钮位置差几个像素、弹窗样式不同、应用版本更新,就可能点错。
问题:而中国应用的生态又更独特——同一类功能(点外卖、买机票、查地图)有大量本地化 App,UI 规则和交互细节跟海外完全不一样。纯模拟器训出来的模型,在国内 App 上水土不服。
解法:Qwen-UI-Agent 直接搭了一个真机训练集群——
- 100+ 台真实手机、150+ 款应用组成的真机移动环境,用于任务构建、轨迹采集、模型训练、评测
- 自建 MobileWorld-Real 真机基准,400+ 任务 × 100+ 应用,直接对真实设备跑分
- 在此基础上训练出模型,再用 SFT + 100+ 步轨迹在线 RL、约 10000 个并发环境同时 rollout 持续打长程任务

⭐️ 重点:它刷榜不是靠"在模拟器上跑分高",而是在真机基准上实打实领先——MobileWorld 82.1%、MobileWorld-Real 92.2%、AndroidDaily 97.5%。这个路线一旦跑通,门槛就从"谁参数多"变成了"谁有真机集群 + 真实数据",对国产做端侧 Agent 的团队是利好。
几项值得记牢的对比数据
| 场景 | 基准 | 分数 | 领先对手 / 备注 |
|---|---|---|---|
| 移动端 | MobileWorld | 82.1% | 领先 GPT-5.6 Sol 12.0pct、Claude Opus 4.8 14.6pct、字节 Seed 2.1 Pro 8.9pct |
| 真机基准 | MobileWorld-Real | 92.2% | 超过 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro |
| 日常 Android | AndroidDaily | 97.5% | 接近满分 |
| 电脑端 | OSWorld-Verified | 79.5% | 超过 GPT-5.5、Gemini 3.1 Pro |
| 电脑端 | OSWorld-v2 Partial | 40.0% | 相比基线节省 58% 执行步数 |
| 浏览器 / 深度搜索 | WebArena | 73.6% | 所有对比模型里排第一 |
| 浏览器 / 深度搜索 | BrowseComp-ZH | 75.0% | — |
| GUI Grounding | ScreenSpot-Pro | 81.5% | 其余 4 个 grounding 评测也全部刷 SOTA |
不止点屏幕:CLI 协同 + 批量输出
容易被忽略但很实用的一点——Qwen-UI-Agent 不只能 GUI 点击,还能直接执行命令行操作,并在单次决策中批量输出多个动作。
具体表现:
- 电脑任务里,CLI 动作占比近半
- 约 40% 的动作以 batched actions 形式输出——一次给一串,而不是点一次等一次
这两个能力叠加,让它在跨网站调研产品、核对价格、生成比价方案这类任务上,执行轨迹明显缩短。对自动化办公、批量数据采集这类场景,是实打实的效率杠杆。
🌈 拓展:CLI + GUI 协同还意味着——它能在深度搜索场景里让 GUI 负责网页检索和数据源定位,CLI 负责数据下载与分析。这种"双通道"组合比纯 GUI 或纯 CLI 都更接近真实办公流。
安全机制 + 长程任务
两个工程落地的关键支撑:
安全机制:
- 面对违法或高风险请求:模型不执行任何界面操作,直接拒绝并终止任务
- 面对支付、数据删除、隐私授权等敏感场景:在关键步骤主动停手,向用户说明情况,待明确确认后再继续
危险请求不执行,敏感操作不擅自决定——这两条写得很清楚,对企业落地很关键。
长程任务能力:
- 支持在超过 100 步的超长轨迹上进行在线 RL 训练
- 配合约 10000 个并发环境同时 rollout
- 配合模型自适应课程学习,持续攻克长程任务
⭐️ 重点:GUI 智能体最容易翻车的就是"长链路"——前面 30 步没出错,第 80 步突然点错一个按钮全盘崩。100 步在线 RL + 万级并发环境,是它能不能扛住真实业务复杂度的工程底线。
对做 Agent / 自动化的同学意味着什么
这事对咱们后端、AI 应用、自动化方向的工程师,三件事值得提:
- 做 GUI Agent / 手机助手的团队:可以拿它做基座自训或微调,重点评估"真机稳跑能力"——演示分数高不代表业务能落地,得拿自己业务 App 跑压测
- 做自动化办公 / RPA 升级:CLI + 批量输出的组合,比传统 RPA 脚本灵活度高很多——不再死磕 XPath,而是让模型理解界面再决策
- 做端侧 智能体 / 跨端应用编排:4B 轻量版本给端侧部署留了口子,27B 主力给云端,35B-A3B 给复杂规划场景,可以按需选
⚠️ 最后再强调一次:基准刷榜 ≠ 业务落地。真机训练这条路国产抢到了身位,但能不能稳定应对真实 App 频繁改版、复杂异常路径,还得等大规模实测。
写在最后
Qwen-UI-Agent 这事让我看到,国产在 GUI 智能体这条赛道上,靠"真机训练"这种硬核工程基建抢到了身位—— AI 操作屏幕这件事,从演示视频到真实业务能稳跑,还有不少距离。
各位同学,你们觉得AI操作屏幕有没有实用性,能落地吗?评论区可以聊一聊😊。
既然看到这了,如果这篇对你有用,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~感谢收看,我们下期见。
更多推荐


所有评论(0)