Qwen-UI-Agent是一款由阿里通义推出的GUI智能体基座模型,主要用于在手机、电脑和网页端像真人一样操作界面并完成跨应用长程任务,支持GUI与命令行混合执行及批量动作输出,适用于本地生活服务、办公自动化与深度调研等智能体应用场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | GUI智能体基座模型 |
| 开发方 | 阿里巴巴通义实验室 |
| 训练环境 | 100多台真机、150多个真实应用 |
| 执行方式 | GUI操作与CLI命令混合执行 |
| 长程能力 | 支持100步以上超长任务 |
| 训练机制 | 长程在线强化学习,约1万个并发环境 |
| 基准表现 | MobileWorld、OSWorld、WebArena等八项SOTA |
| 安全机制 | 违法请求直接拒绝,敏感操作交还用户 |
| 适用人群 | 智能体开发者、企业自动化团队、应用厂商 |

Qwen-UI-Agent核心能力与技术特点
GUI智能体的核心挑战不是”看得懂屏幕”,而是”在真实设备上稳定完成长链条任务”。Qwen-UI-Agent的解题思路是用真机训练替代模拟器,用混合执行提升速度,用分层安全守住底线。
跨设备GUI操作与精准定位
模型能在手机、电脑与浏览器上自动完成点击、输入、滑动等界面交互,并在ScreenSpot-Pro等grounding基准上刷新SOTA,能精准识别屏幕元素的位置与状态。精准的界面定位是GUI Agent可靠执行的基础,也是长程任务不”点错按钮”的前提。
真机多应用长程工作流
不同于依赖模拟器的方案,通义搭建了100多台真实手机、150多个应用的真机集群,直接采集真实轨迹用于训练与评测,弥合了模拟环境与真实设备之间的性能鸿沟。模型可以跨应用完成”查地图、找餐厅、订座、发日程”这类复杂长链任务,MobileWorld基准得分82.1%。
GUI与CLI混合执行提速
模型同时掌握界面操作与命令行命令,引入Batched Actions机制,单次决策可并行输出多个动作。在电脑任务中CLI占比接近一半,约40%为批量动作,整体执行步数节省近58%,让长任务跑得又稳又快。
分层安全边界管控
安全判断内嵌于任务执行全链路:违法或高风险请求在前置分类阶段被识别并直接终止;支付、删除文件、隐私授权等敏感操作在关键节点触发ask_user接管,弹窗交还用户确认后才继续,确保危险请求不执行、敏感操作不擅自决定。
长程在线强化学习
支持在超过100步的超长轨迹上进行端到端在线强化学习,依托约1万个并发环境并行rollout,配合自适应课程学习持续攻克高难度长程任务。这是它在MobileWorld、OSWorld、WebArena等八项核心基准上全面超越或持平GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro等旗舰模型的关键。
Qwen-UI-Agent与同类GUI智能体对比
通义在GUI Agent方向已有两代基座:Qwen-UI-Agent是跨端统一的新旗舰,MAI-UI则是此前聚焦移动端的基座模型。
| 对比维度 | Qwen-UI-Agent | MAI-UI |
|---|---|---|
| 产品定位 | 跨移动端、电脑与浏览器的统一基座 | 聚焦移动端的GUI Agent基座 |
| MobileWorld得分 | 82.1% | 41.7% |
| 执行方式 | GUI与CLI混合,支持批量动作 | 以GUI点击操作为主 |
| 长程能力 | 100步以上在线强化学习 | 基础长程任务支持 |
| 跨平台范围 | 手机、电脑、浏览器统一模型 | 主要聚焦移动端 |
| 主动服务 | 可从真实通知信号主动发起任务 | 被动响应用户指令 |
| 安全机制 | 分层安全对齐与敏感操作确认 | 基础安全对齐 |
通义的智能体产品线覆盖多个场景:除Qwen-UI-Agent外,此前发布的Qwen-CUA专注计算机与浏览器操作,Qwen-AgentWorld则面向智能体世界模型训练,开发者可按场景选型组合。
Qwen-UI-Agent应用场景与适用人群
Qwen-UI-Agent面向需要跨应用、跨设备自动化操作的场景,官方基于150余款国内主流App的真机训练,尤其契合中文App生态下的出行、办公、社交与电商等高频操作链路。
- 本地生活探店:自动跨地图、点评、社交平台完成地址搜索、人气比对与口碑总结,一站式搞定约会探店
- 行程会议联动:查询高铁班次、计算通勤时间,自动创建带提醒的会议日程
- 深度调研报告:跨网站采集数据、运行分析脚本,自动生成Excel、PPT与Word交付物
- 跨设备发票整理:从手机相册提取发票照片,传到电脑分类归档并生成结构化报销单
- 航班取消应急:检测到航班取消通知后自动搜索替代航班与高铁方案,推荐最优选项交还用户决策
- GUI与CLI协同办公:图形界面操作与命令行工具协同,完成文件批处理、数据整理等桌面端自动化任务
适用人群:主要是希望手机与电脑自动完成日常操作的个人效率用户、基于开源权重进行二次开发的开发者与技术团队,以及寻求免维护RPA替代方案的企业自动化团队。
如何使用Qwen-UI-Agent
Qwen-UI-Agent 以研究预览形式发布,模型代码已开源。开发者可通过 GitHub 仓库 Tongyi-MAI/MAI-UI 获取权重与推理代码,
- 环境准备:Python 3.10+ 与 PyTorch 2.0+,27B 需约 56GB 显存,4B 单张 24GB 显卡即可
- 获取模型:克隆仓库并从 Hugging Face 或 ModelScope 拉取权重,安装依赖后启动推理服务
- 任务下发:用自然语言描述目标,模型接收屏幕截图后输出点击、输入、滑动等动作指令
- 安全机制:违法请求直接拒绝;支付、删除、隐私授权等敏感操作停手交还用户确认
- 混合执行:电脑端自动混用 GUI 与 CLI(CLI 占比约 40%),支持 Batched Actions 并行输出
Qwen-UI-Agent的官方资源
- 项目官网:https://tongyi-mai.github.io/Qwen-UI-Agent/
- GitHub仓库:https://github.com/Tongyi-MAI/MAI-UI
- 技术论文:https://tongyi-mai.github.io/Qwen-UI-Agent/Qwen-UI-Agent-Technical-Report.pdf
常见问题
Qwen-UI-Agent是什么?
是阿里通义推出的GUI智能体基座模型,能在手机、电脑和网页端像真人一样操作界面,基于100多台真机与150多个应用训练,在MobileWorld等八项基准上全面超越或持平GPT-5.6、Claude Opus等旗舰模型。
Qwen-UI-Agent开源了吗?
官方已发布技术报告与项目主页,并开放了MobileWorld评测环境,模型权重与代码将陆续在GitHub开源,可持续关注开源仓库获取更新。
Qwen-UI-Agent支持本地部署吗?
模型权重开源后支持本地部署与二次开发,配套的MobileWorld评测环境提供Docker镜像,方便开发者复现基准测试并接入自有应用。
Qwen-UI-Agent和Qwen-CUA有什么区别?
Qwen-CUA聚焦计算机与浏览器操作的通用智能体,Qwen-UI-Agent是专门的GUI智能体基座,强调真机训练、GUI与CLI混合执行以及跨设备长程任务能力,两者定位互补。
Qwen-UI-Agent收费吗?
目前技术报告与评测环境免费开放,商业API服务与定价以通义官方公告为准,开源权重发布后可自行部署以控制成本。
安全性如何保障?
采用分层安全机制:违法或高风险请求直接拒绝终止;支付、删除数据、隐私授权等敏感操作在关键节点主动停手,弹窗交还用户确认后再继续执行。
浙公网安备33010202004812号