Ferret-UI Lite:Apple 3B端侧GUI Agent,让AI在手机本地看懂并操作界面
 

你对着手机说"帮我把今天的健康数据整理成一份周报,发到我的邮箱",AI不需要把屏幕截图传到云端,而是在手机本地直接"看"懂健康APP的界面,找到步数、心率、睡眠数据,切换到邮件APP,填写收件人、主题和正文,点击发送——整个过程在本地完成,延迟低、隐私安全、不需要联网。这就是端侧GUI Agent(On-Device GUI Agent)的愿景:让AI像人一样看懂屏幕、操作界面,而且完全运行在你的设备上。

然而,当前大多数能控制GUI的AI Agent都依赖GPT-4o、Gemini等大型云端模型,这带来了三个根本问题:①延迟高——每次操作都需要网络往返,无法满足实时交互需求;②隐私风险——屏幕截图可能包含敏感信息(聊天记录、银行账户、健康数据),上传到云端存在隐私泄露风险;③可靠性差——没有网络连接时完全无法使用。对于手机、PC等个人设备来说,端侧部署是GUI Agent走向实用的必由之路。

但端侧部署意味着模型参数量必须足够小(通常3B-7B以下),而小模型在GUI理解上面临巨大挑战:UI屏幕通常是细长比例、包含大量小物体(图标、文字、按钮),需要高分辨率感知;多步导航需要复杂的规划、错误恢复和上下文理解;不同平台(iOS、Android、Web、Desktop)的界面风格和交互方式差异巨大。如何让一个3B的小模型在端侧实现有竞争力的GUI理解和操作能力?

2026年2月,Apple机器学习研究团队发布了Ferret-UI Lite——一个3B参数的端到端GUI Agent,专门针对移动端、Web端和桌面端的跨平台GUI操作优化。其核心创新包括:①精心策划的真实+合成多样化GUI数据混合,统一动作空间和坐标表示;②推理时的思维链(CoT)推理和视觉工具使用(图像裁剪+放大)实现高分辨率UI感知;③监督微调(SFT)+强化学习(RL)两阶段训练策略,针对定位和导航设计专门的奖励函数。在GUI定位基准上,Ferret-UI Lite以3B参数超越了所有其他3B模型,在ScreenSpot-Pro上达到53.3%,比7B的UI-TARS-1.5高出超过15个百分点,甚至接近72B大模型的水平。

本文将从Ferret-UI Lite要解决的核心问题出发,深入拆解其三大技术创新、模型架构、全面的性能基准和消融实验,以及Apple团队从构建小型端侧GUI Agent中总结的关键经验教训。

一、Ferret-UI Lite是什么:3B端侧跨平台GUI Agent

1.1 基本信息

项目

详情

论文标题

Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents

arXiv编号

2509.26539

发布时间

2026年2月(Apple Machine Learning Research)

研发机构

Apple 机器学习研究团队

核心作者

Zhen Yang, Zi-Yi Dou, Di Feng, Forrest Huang, Anh Nguyen, Keen You, Omar Attia, Yuhao Yang, Michael Feng, Haotian Zhang, Ram Ramrakhya, Chao Jia, Jeffrey Nichols, Alexander Toshev, Yinfei Yang, Zhe Gan

模型参数量

3B

模型类型

端到端GUI Agent(多模态大语言模型)

支持平台

移动端(iOS/Android)、Web端、桌面端(macOS/Windows)

核心能力

GUI定位(grounding)、GUI导航(navigation)、界面理解、思维链推理、视觉工具使用(缩放)

训练策略

两阶段:监督微调(SFT)+ 强化学习(RL)

推理优化

思维链(CoT)推理 + 视觉工具使用(图像裁剪+放大zoom-in)

部署目标

端侧设备(手机、PC),低延迟、隐私保护、离线可用

前身模型

Ferret(2024)→ Ferret-UI(ECCV 2024)→ Ferret-UI 2(ICLR 2025)→ Ferret-UI Lite(2026)

1.2 Ferret家族演进

Ferret-UI Lite是Apple Ferret系列的最新成员,该系列专注于细粒度空间理解和UI界面理解:

模型

发布时间

会议/期刊

核心定位

关键创新

Ferret

2024年初

—

细粒度空间理解MLLM

空间感知视觉采样器,支持点/框/自由形状引用,CLIP-ViT-L/14+Vicuna

Ferret-UI

2024年9月

ECCV 2024

移动端UI理解

"任意分辨率"(将屏幕分成2个子图放大细节),引用/定位/推理能力,图标识别/找文字/组件列举

Ferret-UI 2

2025年4月

ICLR 2025

跨平台通用UI理解

自适应N网格划分机制,覆盖iPhone/Android/iPad/Webpage/AppleTV,最佳网格尺寸计算

Ferret-UI Lite

2026年2月

Apple ML Research

3B端侧GUI Agent

真实+合成数据混合、CoT+缩放视觉工具、SFT+RL两阶段训练、跨平台统一动作空间

从Ferret到Ferret-UI Lite的演进路线清晰地展示了Apple的战略:从通用细粒度空间理解,到移动端UI理解,到跨平台通用UI理解,再到端侧可部署的轻量级GUI Agent。Ferret-UI Lite不是简单的模型压缩,而是针对端侧场景重新设计了数据、推理和训练策略,在3B参数下实现了有竞争力的GUI操作能力。

1.3 核心定位

Ferret-UI Lite的核心定位是一个可以在端侧设备上运行的、跨平台的、端到端GUI Agent。与依赖云端大模型的GUI Agent相比,它有三个本质区别:

  • 端侧部署:3B参数量可以在手机、PC等个人设备上本地运行,不需要联网,延迟低,隐私安全;
  • 端到端操作:不是只做UI理解(定位元素),而是端到端地完成GUI操作任务——理解用户指令、规划步骤、定位元素、执行动作(tap/swipe/type/scroll等)、处理错误;
  • 跨平台统一:统一的动作空间和坐标表示,同时支持移动端、Web端和桌面端,不需要为每个平台单独训练模型。

二、核心挑战:小模型如何看懂并操作复杂GUI

构建小型端侧GUI Agent面临多个层面的挑战,这些挑战是Ferret-UI Lite所有技术设计的出发点。

2.1 UI屏幕的特殊性

  • 细长比例:手机屏幕通常是9:19.5或类似的细长比例,与自然图像的4:3或1:1比例差异巨大,标准视觉编码器处理时会严重压缩垂直方向的信息;
  • 小物体密集:UI屏幕包含大量小物体(图标、文字、按钮、开关),这些物体在低分辨率下几乎无法辨认,需要高分辨率感知;
  • 布局结构化:UI界面有严格的布局结构(导航栏、内容区、标签栏),元素之间有明确的空间关系和功能关联,理解这些结构关系对操作至关重要;
  • 平台多样性:iOS、Android、Web、Desktop的界面风格、设计规范、交互方式差异巨大,一个模型需要同时适应多种平台。

2.2 小模型的能力局限

  • 高分辨率感知困难:3B小模型的视觉编码器和语言模型容量有限,处理高分辨率屏幕时计算量和内存消耗巨大,通常只能使用较低分辨率,导致小元素识别困难;
  • 多步推理能力弱:复杂GUI导航任务需要多步规划、状态跟踪、错误恢复和上下文理解,这些能力对小模型来说非常困难;
  • 数据效率要求高:小模型需要更多、更高质量的训练数据才能达到有竞争力的性能,但GUI操作数据的收集和标注成本很高;
  • 泛化能力有限:小模型更容易过拟合到训练数据中的特定平台和应用,对未见界面的泛化能力较弱。

2.3 训练与评估的挑战

  • 数据格式不统一:不同GUI数据集的标注格式差异巨大——有些用边界框,有些用单点坐标,有些用元素ID,动作表示也不统一(自由文本 vs 结构化函数调用);
  • 导航任务评估困难:多步导航任务的成功与否需要完整的环境交互,评估成本高,而且中间步骤的正确性难以精确评估;
  • 强化学习奖励设计:GUI操作的奖励设计非常微妙——定位任务需要容忍一定的坐标误差,导航任务需要区分动作类型和参数的正确性,简单的精确匹配奖励会导致训练困难;
  • 合成数据的真实性:合成数据可以大幅增加训练量,但如何让合成数据足够真实、包含错误和恢复策略,而不是完美的"教科书"轨迹,是一个关键挑战。

2.4 Ferret-UI Lite的解决思路

针对这些挑战,Ferret-UI Lite从三个维度进行了系统性设计:

  1. 数据维度:精心策划真实+合成的多样化GUI数据混合,统一坐标表示(中心点坐标)和动作空间(结构化函数调用),覆盖移动/Web/Desktop多平台;
  1. 推理维度:思维链(CoT)推理增强小模型的多步规划能力,视觉工具使用(图像裁剪+放大zoom-in)解决高分辨率小元素感知问题;
  1. 训练维度:SFT+RL两阶段训练,SFT建立基础能力,RL通过精心设计的奖励(定位用包含奖励、导航用类型+参数分离奖励)进一步提升性能。

三、核心创新一:真实+合成多样化GUI数据混合

数据是小模型达到有竞争力性能的关键。Ferret-UI Lite在数据层面做了大量精心设计,包括数据来源的多样性、格式的统一化、以及合成数据的高质量生成。

3.1 多源真实数据

Ferret-UI Lite从多个来源收集真实GUI数据,覆盖三大平台:

  • 移动端应用:来自iOS和Android应用的屏幕截图和交互轨迹,覆盖社交、购物、工具、健康等多种应用类别;
  • Web界面:来自网页的截图和操作数据,覆盖电商、新闻、社交、工具等各类网站;
  • 桌面应用:来自macOS和Windows桌面应用的截图和操作数据,覆盖办公、创意、开发等场景。

多平台数据的混合训练让模型学会了不同平台的界面设计规范和交互模式,提升了跨平台泛化能力。

3.2 统一坐标表示:中心点坐标

不同GUI数据集的元素标注格式差异巨大——有些用边界框(x1,y1,x2,y2),有些用单点坐标(x,y),有些用元素ID。这种格式差异会导致模型过拟合到特定数据集的格式,影响泛化。

Ferret-UI Lite的解决方案是将所有标注统一转换为中心点坐标(center-point coordinates):

  • 对于边界框标注,取框的中心点作为目标坐标;
  • 对于单点标注,直接使用该点;
  • 模型输出统一为中心点坐标,而不是边界框或元素ID。

这种统一表示有三个优势:①防止模型过拟合到特定数据集的标注格式;②中心点坐标比边界框更简洁,减少了输出空间的复杂度;③对于GUI操作来说,中心点坐标已经足够——tap、click等操作只需要中心点。

3.3 统一动作空间:结构化函数调用

对于动作输出,Ferret-UI Lite没有采用自由文本描述(如"点击右上角的设置按钮"),而是设计了跨平台统一的结构化函数调用表示:

  • 每个动作表示为一个函数调用,包含动作类型和具体参数;
  • 动作类型包括:tap(点击)、swipe(滑动)、type(输入文字)、scroll(滚动)、long_press(长按)、back(返回)、home(主页)等;
  • 参数包括:目标坐标(x,y)、滑动方向和距离、输入文本内容等;
  • 这种函数调用表示在移动、Web、Desktop平台上统一使用,不需要为每个平台设计不同的动作格式。

结构化函数调用相比自由文本有三个优势:①输出更可解释、更容易评估;②减少了模型生成无效动作格式的概率;③便于与实际的GUI自动化系统对接,模型输出可以直接转换为设备操作指令。

3.4 高质量合成数据生成

真实GUI操作数据的收集和标注成本很高,而且难以覆盖所有场景和错误情况。Ferret-UI Lite通过多种方式生成高质量合成数据来补充真实数据:

  • 离线轨迹增强:对已有的真实交互轨迹进行增强,包括修改动作顺序、替换目标元素、引入错误步骤等,生成更多样化的训练样本;
  • 多智能体在线rollout:构建在线多智能体系统,让多个Agent在真实或模拟的GUI环境中交互,生成包含错误和恢复策略的真实感交互轨迹。这种在线生成的数据比离线增强更接近真实使用场景;
  • 高分辨率定位数据:通过组合多张屏幕截图、裁剪和放大局部区域,生成高分辨率的UI定位训练数据,专门增强模型对小元素的感知能力;

思维链推理轨迹:使用GPT-4为GUI操作任务生成思维链(CoT)推理轨迹,包括任务分析、步骤规划、元素定位理由、错误处理等,让小模型学会显式推理。

合成数据的关键设计原则是真实性和多样性——不是生成完美的"教科书"轨迹,而是包含真实使用中的错误、犹豫、回退和恢复策略,让模型学会处理不完美的交互过程。消融实验证明,合成数据对ScreenSpot-Pro等困难基准有显著提升,思维链数据对导航性能有显著提升(长CoT提升4.1%)。

3.5 数据混合策略:平衡定位与导航

Ferret-UI Lite的训练数据包含两大类任务:GUI定位(grounding,给定描述找到元素坐标)和GUI导航(navigation,多步操作完成任务)。消融实验发现,定位数据和导航数据的平衡比例对整体性能至关重要:

  • 定位数据帮助模型学会精确找到UI元素,这是所有操作的基础;
  • 导航数据帮助模型学会多步规划和状态跟踪,这是完成复杂任务的关键;
  • 两类数据互相增强——学习定位有助于导航中的元素查找,学习导航提供了更好的上下文来理解界面布局;
  • 平衡比例的数据混合 consistently 优于偏向某一类的数据分布。

这一发现对小模型训练尤为重要——小模型的容量有限,需要精心平衡不同任务类型的数据比例,才能在各方面都达到较好的性能。

四、核心创新二:推理时技术——思维链与视觉工具使用

小模型的容量有限,单纯依靠模型参数很难同时实现高分辨率感知和多步推理。Ferret-UI Lite的第二个核心创新是在推理时引入两种技术来增强小模型的能力:思维链(Chain-of-Thought, CoT)推理和视觉工具使用(Visual Tool-Use)。

4.1 思维链推理:让小模型学会"先想后做"

复杂GUI导航任务需要多步规划、状态跟踪和错误恢复,这些能力对3B小模型来说非常困难。Ferret-UI Lite的解决方案是在推理时引入思维链(CoT)推理——模型在执行动作之前,先输出一段推理文本,分析任务、规划步骤、说明理由,然后再输出具体动作。

CoT训练数据生成:

  • 使用GPT-4为GUI操作任务生成思维链推理轨迹,包括:任务分析(用户想做什么)、步骤规划(需要哪几步)、元素定位理由(为什么选这个元素)、错误处理(如果操作失败怎么办);
  • 生成两种长度的CoT:短CoT(简短的推理,1-2句话)和长CoT(详细的推理,多步骤分析);
  • 在SFT阶段用这些CoT数据训练模型,让模型学会在推理时自动输出推理过程。

CoT的效果:消融实验证明,CoT对导航性能有显著提升:

  • 基线(无CoT):AndroidWorld 13.7%;
  • + 短CoT:15.8%(+2.1%);
  • + 长CoT:19.6%(+4.1%)。

长CoT的提升比短CoT更大,说明更详细的显式推理对小模型的多步导航帮助更大。这符合直觉——小模型的"工作记忆"有限,把推理过程显式写出来可以减轻内部状态跟踪的负担。

4.2 视觉工具使用:缩放机制解决高分辨率感知

Ferret-UI Lite缩放机制:初始预测→裁剪放大→精修预测,模仿人类先大致看再聚焦细看的行为
 

UI屏幕包含大量小元素(图标、文字、按钮),3B小模型的视觉编码器很难在低分辨率下准确识别这些小元素。如果直接使用高分辨率输入,计算量和内存消耗会急剧增加,端侧设备无法承受。Ferret-UI Lite的解决方案是视觉工具使用(Visual Tool-Use)——通过图像裁剪和放大(zoom-in)实现高分辨率感知。

缩放机制的工作流程:

  1. 初始预测(Initial Prediction):模型首先在完整的低分辨率屏幕截图上做出粗略的预测,估计目标元素的大致位置;
  1. 裁剪与放大(Crop & Zoom):根据初始预测的位置,裁剪屏幕的对应区域,然后将裁剪区域放大到更高分辨率。这样模型只需要处理一个小区域的高分辨率图像,而不是整个屏幕的高分辨率图像;
  1. 精修预测(Refined Prediction):在放大后的裁剪区域上做出更精确的最终预测,得到目标元素的精确坐标。

缩放机制的优势:

  • 计算效率高:只对目标区域进行高分辨率处理,而不是整个屏幕,计算量和内存消耗远低于直接使用高分辨率输入;
  • 模仿人类行为:人类在操作GUI时也是先大致看一下屏幕,找到目标区域,然后聚焦细看——缩放机制正是模仿了这种"先大致看,再聚焦细看"的人类行为模式;
  • 小元素识别精准:放大后的区域分辨率更高,小图标、小文字的识别精度显著提升;
  • 端侧友好:计算量可控,适合在手机、PC等端侧设备上运行。

缩放机制的效果:消融实验证明,RL训练后引入缩放操作可以进一步提升定位性能,尤其是在ScreenSpot-Pro等包含大量小元素的困难基准上。缩放机制与RL的结合是Ferret-UI Lite在定位任务上超越其他3B模型的关键因素之一。

4.3 推理时技术的协同

思维链推理和视觉工具使用不是孤立的,而是在推理过程中协同工作:

  • CoT推理帮助模型决定"应该看哪里"——在思维链中分析任务需求,确定需要定位的目标元素类型,然后做出初始预测;
  • 缩放机制帮助模型"看得更清楚"——在初始预测的位置裁剪放大,精确定位目标元素;
  • 精确定位后,模型在CoT中说明选择该元素的理由,然后输出具体动作;
  • 如果动作执行后发现错误(如点错了位置),模型可以在CoT中分析错误原因,重新进行初始预测和缩放,实现错误恢复。

这种"推理→预测→缩放→精修→动作→验证"的迭代流程,让3B小模型在推理时动态分配计算资源——把更多的计算用在需要精确感知的目标区域,而不是均匀地处理整个屏幕。这是小模型在端侧实现高性能GUI理解的关键设计哲学。

五、核心创新三:SFT+RL两阶段训练与奖励设计

Ferret-UI Lite的第三个核心创新是两阶段训练策略:第一阶段监督微调(SFT)建立基础能力,第二阶段强化学习(RL)通过精心设计的奖励函数进一步提升性能。特别是RL阶段的奖励设计,针对GUI定位和导航的特点做了专门优化。

5.1 第一阶段:监督微调(SFT)

SFT阶段使用精心策划的真实+合成GUI数据混合,以标准的监督学习方式训练模型:

  • 输入:GUI屏幕截图 + 用户指令(自然语言);
  • 输出:思维链推理文本 + 结构化函数调用动作(包含目标坐标);
  • 损失函数:标准的语言模型交叉熵损失,对推理文本和动作输出统一计算;
  • 数据混合:平衡比例的定位数据和导航数据,覆盖移动/Web/Desktop多平台。

SFT阶段让模型学会了基本的GUI理解和操作能力,包括:理解用户指令、识别UI元素、输出正确的动作格式、执行简单的多步导航。

5.2 第二阶段:强化学习(RL)与奖励设计

SFT建立了基础能力,但模仿学习要求模型的输出与训练样本精确匹配,这限制了模型的探索能力和泛化能力。RL阶段允许模型探索不同的操作方式,只要最终达到目标就获得奖励,从而提升性能和鲁棒性。

Ferret-UI Lite针对GUI定位和导航两类任务,设计了不同的奖励函数:

定位任务奖励:包含式奖励(Containment-based Reward)

  • 传统的精确匹配奖励要求模型预测的中心点与目标中心点完全一致(或在极小的误差范围内),这对GUI定位来说过于严格——只要点在目标元素的边界框内,操作就是成功的;
  • Ferret-UI Lite采用包含式奖励:只要模型预测的点落在目标元素的边界框内,就给予正奖励,而不要求精确匹配中心点;
  • 这种奖励设计更符合GUI操作的实际需求——tap/click操作只需要点在元素范围内,不需要精确到中心点;
  • 包含式奖励与缩放机制结合效果更好——模型先粗略预测(只要在目标区域内就有奖励),然后通过缩放精修到更精确的位置。

导航任务奖励:类型匹配 + 参数精度分离

  • 导航任务的动作包含两个维度:动作类型(tap/swipe/type/scroll等)和动作参数(坐标、方向、文本内容等);
  • Ferret-UI Lite将奖励分离为两个组件:①动作类型匹配奖励——选择了正确的动作类型就给予部分奖励;②参数精度奖励——参数(坐标、文本等)越精确,奖励越高;
  • 这种分离设计让模型明白:选择正确的动作类型(如"应该tap而不是swipe")很重要,即使坐标不够精确也能获得部分奖励;同时鼓励模型不断提升参数精度;
  • 对于多步导航任务,最终奖励基于任务是否成功完成,中间步骤的奖励基于动作类型和参数的正确性。

5.3 RL的效果

消融实验证明,RL训练对定位性能有一致的提升:

  • RL consistently 提升GUI定位性能,在ScreenSpot-V2、ScreenSpot-Pro、OSWorld-G等基准上都有提升;
  • RL训练后引入缩放(zoom-in)操作可以进一步提升定位性能,两者结合效果最佳;
  • 包含式奖励比精确匹配奖励更适合GUI定位,因为它更符合实际操作需求,也更容易训练;
  • 小模型对奖励设计非常敏感——好的奖励设计可以带来显著提升,不好的奖励设计可能导致训练不稳定或性能下降。

5.4 训练策略的关键经验

Apple团队从Ferret-UI Lite的训练中总结了几条关键经验:

  1. RL有价值但需要精心设计奖励:小模型对奖励公式非常敏感,鲁棒的评估指标对成功训练至关重要;
  1. 包含式奖励适合定位:GUI定位不需要精确到中心点,只要在目标元素范围内就应该奖励,这种设计更符合实际需求;
  1. 导航奖励设计仍然具有挑战性:跨不同界面类型和平台设计统一的导航奖励很困难,动作类型和参数的分离只是一个开始;
  1. SFT是基础,RL是提升:SFT建立基本能力和动作格式,RL在SFT基础上探索和优化,两者缺一不可;
  1. 数据平衡比数据量更重要:定位和导航数据的平衡比例对整体性能影响很大,平衡的数据混合 consistently 优于偏向某一类的数据分布。

六、模型架构与推理流程

Ferret-UI Lite模型架构与推理流程:输入→视觉编码器→LLM(3B)→CoT推理→视觉工具使用(缩放)→结构化动作输出
 

6.1 整体架构

Ferret-UI Lite采用端到端的多模态大语言模型架构,基于Ferret-UI/Ferret-UI 2的基础构建,主要组件包括:

  1. 视觉编码器:基于ViT的视觉编码器,将GUI屏幕截图编码为视觉特征。继承了Ferret-UI系列的高分辨率处理能力,支持细长比例的手机屏幕;
  1. 多模态投影器:将视觉特征映射到语言模型的输入维度空间,实现视觉和语言的模态对齐;
  1. 语言模型(3B):3B参数的解码器-only语言模型,是整个系统的核心。它接收视觉特征和用户指令,输出思维链推理文本和结构化动作函数调用;
  1. 视觉工具使用模块:在推理时动态调用图像裁剪和放大工具,实现高分辨率UI感知。这不是一个独立的模型组件,而是推理流程中的一个操作步骤;
  1. 动作输出层:输出结构化的函数调用动作,包括动作类型(tap/swipe/type/scroll等)和参数(坐标、方向、文本等)。

6.2 推理流程

Ferret-UI Lite的完整推理流程如下:

  1. 输入接收:接收GUI屏幕截图和用户自然语言指令;
  1. 视觉编码:视觉编码器将屏幕截图编码为视觉特征,通过投影器映射到语言模型输入空间;
  1. 思维链推理:语言模型首先输出思维链推理文本,分析任务需求、规划操作步骤、确定需要定位的目标元素;
  1. 初始预测:基于推理和视觉特征,模型做出目标元素位置的初始粗略预测;
  1. 视觉工具使用(缩放):根据初始预测位置,裁剪屏幕对应区域并放大,在放大区域上重新分析;
  1. 精修预测:在放大区域上做出目标元素的精确最终预测;
  1. 动作输出:输出结构化函数调用动作,包含动作类型和精确参数;
  1. 执行与验证:动作在GUI环境中执行,模型观察执行结果,如果任务未完成或出现错误,回到步骤3继续推理和操作,直到任务完成或达到最大步数。

6.3 架构设计的关键特点

  • 端到端统一:视觉理解、推理规划、动作输出都在同一个语言模型中完成,不需要多个模型的pipeline,减少了误差累积和系统复杂度;
  • 推理时动态计算:缩放机制让模型在推理时动态分配计算资源——把更多计算用在需要精确感知的目标区域,而不是均匀处理整个屏幕,这对端侧小模型尤为重要;
  • 结构化输出:动作输出为结构化函数调用,而不是自由文本,便于评估和与实际GUI自动化系统对接;
  • 跨平台统一:统一的坐标表示(中心点)和动作空间(函数调用),同时支持移动/Web/Desktop,不需要为每个平台单独训练。

七、性能表现:3B参数超越7B模型的GUI定位

Ferret-UI Lite在多个GUI基准上进行了全面评估,覆盖GUI定位(grounding)、Android控制、GUI导航(navigation)三大类任务。所有结果均在3B参数模型上测得,与2B-72B的各种模型进行对比。

7.1 GUI定位:3B超越所有3B模型,接近72B

GUI定位任务是指给定自然语言描述,在屏幕上找到对应UI元素的位置(中心点坐标)。Ferret-UI Lite在三个主流定位基准上进行了评估:

模型

参数量

ScreenSpot-V2

ScreenSpot-Pro

OSWorld-G

UITars

2B

84.7

18.9

-

QwenVL 2.5

3B

-

25.9

27.3

UI-R1

3B

89.2

33.5

-

SE-GUI

3B

90.3

36.1

-

Jedi

3B

88.8

37.1

50.9

GUI-G1

3B

-

38.1

-

Ferret-UI Lite

3B

91.6

53.3

55.3

GTA1

7B

92.4

50.1

67.7

GUI-OWL

7B

92.8

54.9

55.9

Seed-1.5-VL

-

95.2

60.9

62.9

UITars 1.5

72B

94.2

61.6

47.5

GTA1

72B

94.8

58.4

66.7

关键发现:

  • 超越所有3B模型:Ferret-UI Lite(3B)在三个定位基准上都超越了所有其他3B模型。ScreenSpot-V2 91.6%(比第二高的SE-GUI 90.3%高1.3%),ScreenSpot-Pro 53.3%(比第二高的GUI-G1 38.1%高15.2%),OSWorld-G 55.3%(比第二高的Jedi 50.9%高4.4%);
  • ScreenSpot-Pro超越7B模型15%+:在最困难的ScreenSpot-Pro基准上,Ferret-UI Lite的53.3%比7B的GTA1(50.1%)高3.2%,比7B的UI-TARS-1.5高出超过15个百分点(论文中明确指出"surpassing UI-TARS-1.5 (7B) by over 15%"),甚至接近72B的GTA1(58.4%)和UITars 1.5(61.6%);
  • OSWorld-G接近7B:在OSWorld-G上,Ferret-UI Lite的55.3%与7B的GUI-OWL(55.9%)几乎持平,大幅超越其他3B模型;
  • ScreenSpot-V2接近7B:在较简单的ScreenSpot-V2上,Ferret-UI Lite的91.6%已经接近7B模型(GTA1 92.4%、GUI-OWL 92.8%),说明在简单定位任务上3B小模型已经接近7B水平。

这些结果证明,通过数据混合、推理时缩放和RL训练,3B小模型可以在GUI定位任务上达到甚至超越7B模型的水平。定位任务主要依赖精确的视觉感知和元素匹配,这些能力可以通过针对性的优化来弥补参数规模的不足。

7.2 Android控制:离线指令跟随

Android Control基准评估模型在Android界面上执行指令的能力,分为低级指令(LL,简单操作)和高级指令(HL,复杂多步操作):

模型

参数量

低级指令(LL)

高级指令(HL)

InternVL-2

4B

80.1

66.7

OSAtlas

4B

80.6

67.5

Ferret-UI Lite

3B

86.6

68.9

Qwen2-VL

7B

82.6

69.7

Aguvis

72B

84.4

66.4

Ferret-UI Lite(3B)在低级指令上达到86.6%,超越了4B的InternVL-2(80.1%)和OSAtlas(80.6%),也超越了7B的Qwen2-VL(82.6%)和72B的Aguvis(84.4%)。在高级指令上达到68.9%,与7B的Qwen2-VL(69.7%)几乎持平,超越4B模型和72B的Aguvis。这说明在Android控制任务上,3B小模型通过针对性优化已经可以超越更大的模型。

7.3 GUI导航:多步操作的挑战

GUI导航任务需要模型执行多步操作来完成复杂任务(如"在购物APP中搜索iPhone并加入购物车"),这对小模型的多步推理能力是巨大挑战。

AndroidWorld成功率:

模型

参数量

AndroidWorld成功率

QwenVL 2.5

3B

16.8

ScaleCUA

3B

23.7

Ferret-UI Lite

3B

28.0

QwenVL 2.5

7B

19.5

UITars 1.5

7B

26.4

ScaleCUA

7B

27.2

UITars 1.5

72B

37.7(reported 46.6)

ScaleCUA

32B

30.6

Ferret-UI Lite(3B)在AndroidWorld上达到28.0%,是3B模型中最高的,超越了7B的QwenVL 2.5(19.5%)和UITars 1.5(26.4%),也超越了7B的ScaleCUA(27.2%)。但与72B的UITars 1.5(37.7%,reported 46.6%)和32B的ScaleCUA(30.6%)仍有差距。

OSWorld-Verified成功率:

模型

参数量

OSWorld-Verified成功率

ScaleCUA

3B

9.6

Kimi-VL

3B

9.7

OpenCUA

A3B

16.9

Ferret-UI Lite

3B

17.3

ScaleCUA

7B

14.3

UITars 1.5

7B

24.5

OpenCUA

7B

24.3

Doubao-1.5-Thinking

-

31.9

Claude-4-Sonnet

-

31.2

在OSWorld-Verified(桌面端复杂任务)上,Ferret-UI Lite达到17.3%,是3B模型中最高的,超越了7B的ScaleCUA(14.3%),但与7B的UITars 1.5(24.5%)和OpenCUA(24.3%)仍有明显差距,与闭源大模型(Doubao 31.9%、Claude 31.2%)差距更大。OSWorld整体成功率为19.8%。

导航任务的关键发现:Ferret-UI Lite在导航任务上的表现明显落后于大模型,这揭示了一个 fundamental 的挑战:多步推理、错误恢复和长程规划仍然倾向于更大的模型。随着任务复杂度增加,性能差距会扩大,这表明某些认知能力可能需要最低的参数阈值。定位任务可以通过针对性优化弥补规模不足,但复杂导航任务的多步推理能力对小模型来说仍然是根本性挑战。

八、消融实验:每个设计选择的贡献

8.1 RL与缩放的效果

  • RL训练 consistently 提升GUI定位性能,在所有三个定位基准上都有提升;
  • RL训练后引入缩放(zoom-in)操作可以进一步提升定位性能,两者结合效果最佳;
  • 包含式奖励(containment-based)比精确匹配奖励更适合GUI定位。

8.2 数据平衡的效果

  • 定位数据和导航数据的平衡比例对整体性能至关重要;
  • 平衡比例的数据混合 consistently 优于偏向某一类的数据分布;
  • 两类数据互相增强——学习定位有助于导航,学习导航提供更好的界面布局理解上下文。

8.3 合成高分辨率数据的效果

  • 合成高分辨率数据在ScreenSpot-V2上有 modest 提升;
  • 在更困难的ScreenSpot-Pro基准上有显著提升;
  • 这说明合成数据对困难场景(小元素、复杂布局)的帮助更大。

8.4 思维链数据的效果

模型变体

AndroidWorld成功率

提升

基线(无CoT)

13.7

-

+ 短CoT

15.8

+2.1

+ 长CoT

19.6

+4.1

+ 长CoT + 合成数据(5K)

20.3

+0.7

+ 长CoT + 合成数据(13K)

22.4

+2.1

+ 长CoT + 合成数据(17K)

25.2

+2.8

关键发现:①思维链数据对导航性能有显著提升,长CoT(+4.1%)比短CoT(+2.1%)效果更好;②合成数据在长CoT基础上进一步提升性能,且数据量越大提升越明显(5K→13K→17K,逐步提升);③从基线13.7%到最终25.2%,CoT+合成数据总共提升了11.5个百分点,证明了推理时技术和数据增强对小模型导航能力的巨大价值。

九、关键经验教训

Apple团队从构建Ferret-UI Lite的过程中总结了多条关键经验教训,这些经验对构建小型端侧GUI Agent具有普遍指导意义:

  1. 数据多样性比原始数量更重要:平衡的定位+导航数据混合优于专门化数据集,多样化的真实+合成数据比单纯增加数据量更有效;
  1. 合成数据可以有效增强有限的人工标注:特别是当合成数据捕捉到真实的错误模式和恢复策略时,效果更好。在线多智能体rollout生成的包含错误和恢复的轨迹,比离线增强的完美轨迹更有价值;
  1. 视觉技术(如缩放)为计算约束提供架构层面的解决方案:缩放机制让小模型可以动态分配计算资源,在需要精确感知的区域使用高分辨率,而不是均匀处理整个屏幕,这是端侧小模型的关键设计哲学;
  1. RL有价值但需要精心设计奖励:小模型对奖励公式非常敏感,鲁棒的评估指标对成功训练至关重要。包含式奖励适合定位,但导航奖励设计仍然具有挑战性;
  1. 定位任务可以通过针对性优化克服规模限制:Ferret-UI Lite证明3B小模型可以在GUI定位上超越7B模型,因为定位主要依赖精确感知和元素匹配,这些能力可以通过数据、缩放和RL来优化;
  1. 多步推理仍然倾向于更大模型:复杂导航需要规划、错误恢复和长程规划,这些能力对小模型来说是根本性挑战,性能差距随任务复杂度增加而扩大;
  1. 混合方法(本地+远程)可能提供最佳平衡:对于隐私和延迟比完美任务完成更重要的应用,小模型提供了令人信服的替代方案;但对于复杂多步工作流,结合本地和远程处理的混合方法可能提供能力和约束的最佳平衡;
  1. 统一坐标表示和动作空间是跨平台泛化的关键:中心点坐标和结构化函数调用的统一表示,防止了模型过拟合到特定数据集格式,也便于跨平台部署。

十、应用场景与落地价值

应用领域

核心价值

典型用例

智能助手(Siri/小爱等)

端侧GUI操作,低延迟、隐私安全、离线可用

"帮我发微信给张三"、"设置明天早上7点的闹钟"、"把健康数据整理成报告"

无障碍辅助

帮助视障/运动障碍用户操作手机,端侧处理保护隐私

语音控制手机操作、屏幕元素朗读、自动化日常操作

UI自动化测试

端侧运行测试Agent,不需要云端API,降低成本

自动化UI测试、回归测试、兼容性测试、用户旅程模拟

RPA与办公自动化

本地操作桌面应用,数据不出设备,适合敏感数据处理

表格数据录入、报表生成、邮件处理、跨应用数据搬运

隐私敏感场景

完全端侧运行,屏幕截图不上传云端,保护用户隐私

银行APP操作、医疗健康数据处理、企业内部系统操作、个人隐私数据处理

离线/弱网环境

不需要联网即可操作GUI,适合网络不稳定的场景

飞行模式下操作、偏远地区使用、车载系统操作、工业设备离线操作

低延迟实时交互

端侧推理延迟低,适合需要实时响应的交互场景

实时语音控制、游戏辅助、实时翻译、实时屏幕内容分析

十一、局限性与未来方向

11.1 当前局限性

  1. 复杂多步导航能力有限:在AndroidWorld(28.0%)和OSWorld(19.8%)上的成功率仍然较低,与大模型(UITars 1.5 72B 37.7%、Claude 31.2%)有明显差距。多步规划、错误恢复和长程推理对3B小模型来说是根本性挑战;
  1. 长任务的状态跟踪困难:对于需要10步以上操作的复杂任务,小模型容易丢失上下文、忘记之前的操作状态,导致任务失败;
  1. 错误恢复能力弱:当操作出现错误(如点错位置、页面加载失败)时,小模型往往无法有效识别错误并恢复,而是继续执行错误的操作;
  1. 跨应用泛化有限:对于训练数据中未见过的应用和界面风格,模型的泛化能力有限,可能无法正确识别和操作陌生UI元素;
  1. 缩放机制的迭代开销:缩放机制需要额外的推理步骤(初始预测→裁剪→放大→精修),增加了推理延迟,在需要极快响应的场景中可能成为瓶颈;
  1. 仅支持中心点坐标:统一为中心点坐标虽然简化了输出,但对于需要精确边界框的任务(如元素裁剪、区域选择)不够精确。

11.2 未来方向

  1. 混合本地+远程架构:简单任务在端侧完成(保护隐私、低延迟),复杂多步任务卸载到云端大模型完成,结合两者优势;
  1. 更强的小模型推理能力:通过更好的CoT训练、推理时搜索(如Tree of Thoughts)、记忆增强等技术,提升小模型的多步推理和错误恢复能力;
  1. 更大规模和更高质量的合成数据:利用更先进的合成数据生成技术(如多智能体交互、世界模型模拟),生成更真实、更多样、包含复杂错误和恢复策略的训练数据;
  1. 端侧硬件加速:随着手机NPU/TPU性能的提升和模型压缩技术的进步,可以在端侧运行更大的模型(7B-14B),进一步缩小与云端大模型的差距;
  1. 多模态动作空间扩展:从当前的tap/swipe/type等基础动作扩展到更复杂的动作(如拖拽、手势、语音输入、传感器控制),支持更丰富的GUI操作;
  1. 持续学习与个性化:让端侧GUI Agent能够根据用户的使用习惯和偏好进行持续学习和个性化适配,提升特定用户场景下的性能;
  1. 安全与对齐:端侧GUI Agent可以直接操作用户设备,需要严格的安全机制和对齐训练,防止误操作、恶意操作和隐私泄露。

Ferret-UI Lite代表了端侧GUI Agent发展的一个重要里程碑——它证明了通过精心设计的数据、推理时技术和训练策略,3B小模型可以在GUI定位等感知任务上超越7B模型,在导航等推理任务上达到有竞争力的水平。虽然复杂多步导航仍然是小模型的短板,但定位能力的突破、端侧部署的优势(隐私、低延迟、离线可用)以及混合架构的潜力,让端侧GUI Agent成为AI助手发展的重要方向。随着端侧硬件的进步、模型压缩技术的成熟和合成数据质量的提升,端侧GUI Agent的能力边界将不断扩展,最终让每一个用户都能拥有一个完全运行在自己设备上、保护隐私、实时响应的AI助手——这正是Apple Ferret系列一直在追求的愿景。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐