Qwen-UI-Agent:AI长出“手“了,真能替人操作手机电脑?
摘要:本文介绍阿里千问 8 月 20 日发布的 GUI 智能体基座模型 Qwen-UI-Agent。它让 AI 学会"看懂屏幕、点击按钮、填写表单",从而真正替人操作手机和电脑。文章用数据对比展示其在真机测试中的领先表现,并通过跨 App 办事、无 API 操作、跨设备协同等案例说明能力边界,同时解答"现在能否使用"和"安全性如何"两大核心疑问。
Qwen-UI-Agent:AI长出"手"了,真能替人操作手机电脑?
阿里千问 8月20日发布的 GUI 智能体基座模型,移动端真机测试成功率 92.2%,超越 GPT-5.6 和 Claude,但普通用户什么时候能用上?
一、到底什么是"GUI智能体"?
打比方。
过去你对着 ChatGPT 说:"帮我订一张明天从北京到杭州的高铁票。"
它只能给你回复一段文字攻略——"你可以在 12306 App 上买票,车次 Gxxx……"
然后你得自己打开 App,自己选时间,自己付款。
现在,Qwen-UI-Agent 不一样了。
你给它一个指令,它直接看屏幕、点按钮、填表单、完成操作。
就像在你手机/电脑上坐了一个人,帮你跑完这一切。
这就是 GUI 智能体——
GUI = Graphical User Interface(图形界面),
就是你能看见、能点击的那个画面。
AI 学会"看懂屏幕 → 模仿人的点击/滑动/输入",就成了这个"电子手"。
阿里这次发布的 Qwen-UI-Agent,核心定位就一句话:
让 AI 真正"会用"每一块屏幕。
二、成绩有多猛?先看数据
这是这次最硬的底气,数据来自阿里官方,对比的是 GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro 这些海外旗舰:
| 测试场景 | Qwen-UI-Agent | GPT-5.6 Sol | Claude Opus 4.8 | 说明 |
|---|---|---|---|---|
| 移动端通用任务 | 82.1% | 67.5% | 62.3% | 领先约 12-15 个点 |
| 真机实测(MobileWorld-Real) | 92.2% | 85.4% | 84.7% | 在真实手机上跑的分数 |
| 安卓日常任务(AndroidDaily) | 97.5% | 79.8% | 92.6% | 接近满分,日常操作几乎没问题 |
| 电脑桌面操作(OSWorld-Verified) | 79.5% | 76.2% | 78.8% | 电脑端也领先 |
| 网页操作(WebArena) | 73.6% | 71.2% | 69.5% | 所有对比模型里排第一 |
关键区别:这次是"真机测试"。
很多 GUI 智能体在模拟器里成绩很好,但放到真实手机/电脑上就掉链子。
阿里这次专门搭了 100 多台真机 + 150 多款真实 App 来做训练和评测,所以这个分数更接近你实际使用时的体验。
三、它能干什么?举几个例子
例1:跨 App 办事,一气呵成
你说:"帮我查一下北京到杭州最早的高铁,再看下杭州西到阿里园区坐地铁要多久,算算几点能到公司,最后在钉钉创建一个会议。"
它自己操作:12306 查车次 → 地图查路线 → 钉钉建会议,全程不用你动手。
例2:没有 API 也能用
很多老软件、政务系统、企业内部工具,根本不提供接口给 AI 调用。
Qwen-UI-Agent 不需要任何 API,它直接看屏幕、点按钮,相当于一个通用的"电子手",所有有界面的东西都能操作。
例3:手机照片传到电脑自动生成表格
你在手机相册里找到几张发票,它自动把照片传到电脑 → 分类归档 → 生成 Excel 报销单。
跨设备协同,无缝接力。
四、最重要的问题:我现在能用吗?
直接回答:还不能像 ChatGPT 那样直接打开就用。
现状拆解:
现在能用的群体:开发者 / 技术人员
Qwen-UI-Agent 目前以基座模型的形式开放,技术报告、项目主页、代码已经公开:
- GitHub:
github.com/Tongyi-MAI/MAI-UI - 项目官网:
tongyi-mai.github.io/Qwen-UI-Agent - 技术报告:arXiv 论文
技术要求较高:
- 本地部署需要 GPU(7B 模型约需 10GB 显存,27B 需要 24GB)
- 云端 API 通过阿里云百炼平台调用,按 token 计费
- 需要一定的编程和部署能力
普通用户什么时候能用?
官方预测 2026 年 Q4 会有更完整的消费级产品落地。
可以关注的入口:
- 通义千问 App:已有 GUI Agent 能力的测试版
- 通义千问办公:8 月刚公测,集成 AI Agent 办公能力
- 阿里钉钉:企业场景下的自动化 Agent
一句话:想自己玩 → 现在找开发者;想看产品化 → 等 Q4。
五、安全吗?会不会乱删文件、乱付钱?
这是很多人最担心的问题。阿里的设计思路是:能干活,但不能乱干。
具体机制:
| 场景 | 处理方式 |
|---|---|
| 违法 / 高风险请求 | 直接拒绝,不执行任何操作 |
| 支付、转账 | 填好金额后停下来,等你确认才付款 |
| 删除文件 / 数据 | 弹出确认窗口,不擅自执行 |
| 隐私授权(访问通讯录等) | 主动询问,等你点头 |
| 信息不完整 | 先追问,不替你做猜测性操作 |
举例:你说"在支付宝给我妈发 500 元红包",它会一路操作到填好金额和备注,在最后一步付款时停下来,等你点确认才会真的发出去。
简单说:敏感操作永远在你点头之前停手。
六、一句话总结
Qwen-UI-Agent 的意义不在于跑分第一,而在于它让 AI 从"只会说话"进化到了"能动手"——这在技术上是一个质变。
对普通人来说,它意味着未来你的手机助手不再只是一个聊天机器人,而是一个真的能替你跑腿办事的"数字助理"。
现在还在开发者阶段,但那个未来,已经能看到轮廓了。
更多信息大家可以关注我的同名公众号《木圭的AI时代指南》,有免费API资讯分享及AI热点资讯/工具评测等等。
更多推荐
所有评论(0)