摘要:本文介绍阿里千问 8 月 20 日发布的 GUI 智能体基座模型 Qwen-UI-Agent。它让 AI 学会"看懂屏幕、点击按钮、填写表单",从而真正替人操作手机和电脑。文章用数据对比展示其在真机测试中的领先表现,并通过跨 App 办事、无 API 操作、跨设备协同等案例说明能力边界,同时解答"现在能否使用"和"安全性如何"两大核心疑问。

Qwen-UI-Agent:AI长出"手"了,真能替人操作手机电脑?

阿里千问 8月20日发布的 GUI 智能体基座模型,移动端真机测试成功率 92.2%,超越 GPT-5.6 和 Claude,但普通用户什么时候能用上?


一、到底什么是"GUI智能体"?

打比方。

过去你对着 ChatGPT 说:"帮我订一张明天从北京到杭州的高铁票。"
它只能给你回复一段文字攻略——"你可以在 12306 App 上买票,车次 Gxxx……"
然后你得自己打开 App,自己选时间,自己付款。

现在,Qwen-UI-Agent 不一样了。
你给它一个指令,它直接看屏幕、点按钮、填表单、完成操作
就像在你手机/电脑上坐了一个人,帮你跑完这一切。

这就是 GUI 智能体——
GUI = Graphical User Interface(图形界面)
就是你能看见、能点击的那个画面。
AI 学会"看懂屏幕 → 模仿人的点击/滑动/输入",就成了这个"电子手"。

阿里这次发布的 Qwen-UI-Agent,核心定位就一句话:
让 AI 真正"会用"每一块屏幕。


二、成绩有多猛?先看数据

这是这次最硬的底气,数据来自阿里官方,对比的是 GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro 这些海外旗舰:

测试场景 Qwen-UI-Agent GPT-5.6 Sol Claude Opus 4.8 说明
移动端通用任务 82.1% 67.5% 62.3% 领先约 12-15 个点
真机实测(MobileWorld-Real) 92.2% 85.4% 84.7% 在真实手机上跑的分数
安卓日常任务(AndroidDaily) 97.5% 79.8% 92.6% 接近满分,日常操作几乎没问题
电脑桌面操作(OSWorld-Verified) 79.5% 76.2% 78.8% 电脑端也领先
网页操作(WebArena) 73.6% 71.2% 69.5% 所有对比模型里排第一

关键区别:这次是"真机测试"。
很多 GUI 智能体在模拟器里成绩很好,但放到真实手机/电脑上就掉链子。
阿里这次专门搭了 100 多台真机 + 150 多款真实 App 来做训练和评测,所以这个分数更接近你实际使用时的体验。


三、它能干什么?举几个例子

例1:跨 App 办事,一气呵成

你说:"帮我查一下北京到杭州最早的高铁,再看下杭州西到阿里园区坐地铁要多久,算算几点能到公司,最后在钉钉创建一个会议。"

它自己操作:12306 查车次 → 地图查路线 → 钉钉建会议,全程不用你动手。

例2:没有 API 也能用

很多老软件、政务系统、企业内部工具,根本不提供接口给 AI 调用。
Qwen-UI-Agent 不需要任何 API,它直接看屏幕、点按钮,相当于一个通用的"电子手",所有有界面的东西都能操作。

例3:手机照片传到电脑自动生成表格

你在手机相册里找到几张发票,它自动把照片传到电脑 → 分类归档 → 生成 Excel 报销单。
跨设备协同,无缝接力。


四、最重要的问题:我现在能用吗?

直接回答:还不能像 ChatGPT 那样直接打开就用。

现状拆解:

现在能用的群体:开发者 / 技术人员

Qwen-UI-Agent 目前以基座模型的形式开放,技术报告、项目主页、代码已经公开:

  • GitHub:github.com/Tongyi-MAI/MAI-UI
  • 项目官网:tongyi-mai.github.io/Qwen-UI-Agent
  • 技术报告:arXiv 论文

技术要求较高:

  • 本地部署需要 GPU(7B 模型约需 10GB 显存,27B 需要 24GB)
  • 云端 API 通过阿里云百炼平台调用,按 token 计费
  • 需要一定的编程和部署能力

普通用户什么时候能用?

官方预测 2026 年 Q4 会有更完整的消费级产品落地。
可以关注的入口:

  1. 通义千问 App:已有 GUI Agent 能力的测试版
  2. 通义千问办公:8 月刚公测,集成 AI Agent 办公能力
  3. 阿里钉钉:企业场景下的自动化 Agent

一句话:想自己玩 → 现在找开发者;想看产品化 → 等 Q4。


五、安全吗?会不会乱删文件、乱付钱?

这是很多人最担心的问题。阿里的设计思路是:能干活,但不能乱干。

具体机制:

场景 处理方式
违法 / 高风险请求 直接拒绝,不执行任何操作
支付、转账 填好金额后停下来,等你确认才付款
删除文件 / 数据 弹出确认窗口,不擅自执行
隐私授权(访问通讯录等) 主动询问,等你点头
信息不完整 先追问,不替你做猜测性操作

举例:你说"在支付宝给我妈发 500 元红包",它会一路操作到填好金额和备注,在最后一步付款时停下来,等你点确认才会真的发出去。

简单说:敏感操作永远在你点头之前停手。


六、一句话总结

Qwen-UI-Agent 的意义不在于跑分第一,而在于它让 AI 从"只会说话"进化到了"能动手"——这在技术上是一个质变。

对普通人来说,它意味着未来你的手机助手不再只是一个聊天机器人,而是一个真的能替你跑腿办事的"数字助理"。

现在还在开发者阶段,但那个未来,已经能看到轮廓了。


更多信息大家可以关注我的同名公众号《木圭的AI时代指南》,有免费API资讯分享及AI热点资讯/工具评测等等。

#AI #人工智能 #Qwen #GUI智能体 #AI助手 #科技科普

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐