Qwen-UI-Agent – 阿里通义推出的GUI智能体基座模型

AI模型9小时前发布 智小研
10 0

Qwen-UI-Agent是一款由阿里通义推出的GUI智能体基座模型,主要用于在手机、电脑和网页端像真人一样操作界面并完成跨应用长程任务,支持GUI与命令行混合执行及批量动作输出,适用于本地生活服务、办公自动化与深度调研等智能体应用场景。

基础信息内容
产品定位GUI智能体基座模型
开发方阿里巴巴通义实验室
训练环境100多台真机、150多个真实应用
执行方式GUI操作与CLI命令混合执行
长程能力支持100步以上超长任务
训练机制长程在线强化学习,约1万个并发环境
基准表现MobileWorld、OSWorld、WebArena等八项SOTA
安全机制违法请求直接拒绝,敏感操作交还用户
适用人群智能体开发者、企业自动化团队、应用厂商
Qwen-UI-Agent官网界面

Qwen-UI-Agent核心能力与技术特点

GUI智能体的核心挑战不是”看得懂屏幕”,而是”在真实设备上稳定完成长链条任务”。Qwen-UI-Agent的解题思路是用真机训练替代模拟器,用混合执行提升速度,用分层安全守住底线。

跨设备GUI操作与精准定位

模型能在手机、电脑与浏览器上自动完成点击、输入、滑动等界面交互,并在ScreenSpot-Pro等grounding基准上刷新SOTA,能精准识别屏幕元素的位置与状态。精准的界面定位是GUI Agent可靠执行的基础,也是长程任务不”点错按钮”的前提。

真机多应用长程工作流

不同于依赖模拟器的方案,通义搭建了100多台真实手机、150多个应用的真机集群,直接采集真实轨迹用于训练与评测,弥合了模拟环境与真实设备之间的性能鸿沟。模型可以跨应用完成”查地图、找餐厅、订座、发日程”这类复杂长链任务,MobileWorld基准得分82.1%。

GUI与CLI混合执行提速

模型同时掌握界面操作与命令行命令,引入Batched Actions机制,单次决策可并行输出多个动作。在电脑任务中CLI占比接近一半,约40%为批量动作,整体执行步数节省近58%,让长任务跑得又稳又快。

分层安全边界管控

安全判断内嵌于任务执行全链路:违法或高风险请求在前置分类阶段被识别并直接终止;支付、删除文件、隐私授权等敏感操作在关键节点触发ask_user接管,弹窗交还用户确认后才继续,确保危险请求不执行、敏感操作不擅自决定。

长程在线强化学习

支持在超过100步的超长轨迹上进行端到端在线强化学习,依托约1万个并发环境并行rollout,配合自适应课程学习持续攻克高难度长程任务。这是它在MobileWorld、OSWorld、WebArena等八项核心基准上全面超越或持平GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro等旗舰模型的关键。

Qwen-UI-Agent与同类GUI智能体对比

通义在GUI Agent方向已有两代基座:Qwen-UI-Agent是跨端统一的新旗舰,MAI-UI则是此前聚焦移动端的基座模型。

对比维度Qwen-UI-AgentMAI-UI
产品定位跨移动端、电脑与浏览器的统一基座聚焦移动端的GUI Agent基座
MobileWorld得分82.1%41.7%
执行方式GUI与CLI混合,支持批量动作以GUI点击操作为主
长程能力100步以上在线强化学习基础长程任务支持
跨平台范围手机、电脑、浏览器统一模型主要聚焦移动端
主动服务可从真实通知信号主动发起任务被动响应用户指令
安全机制分层安全对齐与敏感操作确认基础安全对齐

通义的智能体产品线覆盖多个场景:除Qwen-UI-Agent外,此前发布的Qwen-CUA专注计算机与浏览器操作,Qwen-AgentWorld则面向智能体世界模型训练,开发者可按场景选型组合。

Qwen-UI-Agent应用场景与适用人群

Qwen-UI-Agent面向需要跨应用、跨设备自动化操作的场景,官方基于150余款国内主流App的真机训练,尤其契合中文App生态下的出行、办公、社交与电商等高频操作链路。

  • 本地生活探店:自动跨地图、点评、社交平台完成地址搜索、人气比对与口碑总结,一站式搞定约会探店
  • 行程会议联动:查询高铁班次、计算通勤时间,自动创建带提醒的会议日程
  • 深度调研报告:跨网站采集数据、运行分析脚本,自动生成Excel、PPT与Word交付物
  • 跨设备发票整理:从手机相册提取发票照片,传到电脑分类归档并生成结构化报销单
  • 航班取消应急:检测到航班取消通知后自动搜索替代航班与高铁方案,推荐最优选项交还用户决策
  • GUI与CLI协同办公:图形界面操作与命令行工具协同,完成文件批处理、数据整理等桌面端自动化任务

适用人群:主要是希望手机与电脑自动完成日常操作的个人效率用户、基于开源权重进行二次开发的开发者与技术团队,以及寻求免维护RPA替代方案的企业自动化团队。

如何使用Qwen-UI-Agent

Qwen-UI-Agent 以研究预览形式发布,模型代码已开源。开发者可通过 GitHub 仓库 Tongyi-MAI/MAI-UI 获取权重与推理代码,

  • 环境准备:Python 3.10+ 与 PyTorch 2.0+,27B 需约 56GB 显存,4B 单张 24GB 显卡即可
  • 获取模型:克隆仓库并从 Hugging Face 或 ModelScope 拉取权重,安装依赖后启动推理服务
  • 任务下发:用自然语言描述目标,模型接收屏幕截图后输出点击、输入、滑动等动作指令
  • 安全机制:违法请求直接拒绝;支付、删除、隐私授权等敏感操作停手交还用户确认
  • 混合执行:电脑端自动混用 GUI 与 CLI(CLI 占比约 40%),支持 Batched Actions 并行输出

Qwen-UI-Agent的官方资源

  • 项目官网:https://tongyi-mai.github.io/Qwen-UI-Agent/
  • GitHub仓库:https://github.com/Tongyi-MAI/MAI-UI
  • 技术论文:https://tongyi-mai.github.io/Qwen-UI-Agent/Qwen-UI-Agent-Technical-Report.pdf

常见问题

Qwen-UI-Agent是什么?

是阿里通义推出的GUI智能体基座模型,能在手机、电脑和网页端像真人一样操作界面,基于100多台真机与150多个应用训练,在MobileWorld等八项基准上全面超越或持平GPT-5.6、Claude Opus等旗舰模型。

Qwen-UI-Agent开源了吗?

官方已发布技术报告与项目主页,并开放了MobileWorld评测环境,模型权重与代码将陆续在GitHub开源,可持续关注开源仓库获取更新。

Qwen-UI-Agent支持本地部署吗?

模型权重开源后支持本地部署与二次开发,配套的MobileWorld评测环境提供Docker镜像,方便开发者复现基准测试并接入自有应用。

Qwen-UI-Agent和Qwen-CUA有什么区别?

Qwen-CUA聚焦计算机与浏览器操作的通用智能体,Qwen-UI-Agent是专门的GUI智能体基座,强调真机训练、GUI与CLI混合执行以及跨设备长程任务能力,两者定位互补。

Qwen-UI-Agent收费吗?

目前技术报告与评测环境免费开放,商业API服务与定价以通义官方公告为准,开源权重发布后可自行部署以控制成本。

安全性如何保障?

采用分层安全机制:违法或高风险请求直接拒绝终止;支付、删除数据、隐私授权等敏感操作在关键节点主动停手,弹窗交还用户确认后再继续执行。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章