project
Qwen-UI-Agent - 阿里通义推出的 GUI 智能体基座模型
Qwen-UI-Agent 是阿里巴巴通义团队推出的 GUI 智能体基座模型,能在手机、电脑和网页端像真人一样操作界面。模型基于 100+ 台真机、150+ 应用训练,支持 GUI ...
Qwen-UI-Agent是什么
Qwen-UI-Agent 是阿里巴巴通义团队推出的 GUI 智能体基座模型,能在手机、电脑和网页端像真人一样操作界面。模型基于 100+ 台真机、150+ 应用训练,支持 GUI 与命令行混合执行,可完成跨应用长程任务。内置安全机制,危险请求直接拒绝,支付、删除等敏感操作主动交还用户确认。在 MobileWorld、WebArena 等基准上全面超越 GPT-5.6、Claude Opus 等旗舰模型,是当前真实世界可用性最强的 GUI Agent 之一。
Qwen-UI-Agent的主要功能
-
跨设备 GUI 操作:在手机、电脑、浏览器上自动点击、输入、滑动,完成界面交互。
-
真机多应用工作流:跨 150+ 真实 App 执行复杂长链任务,如查地图→找餐厅→订座→发日程。
-
GUI + CLI 混合执行:既能点界面,也能跑命令行,支持一次输出多个批量动作提速。
-
安全边界管控:违法请求直接拒,支付、删文件、隐私授权等敏感操作主动弹窗交还用户确认。
-
长程任务处理:稳定执行 100+ 步的调研、数据分析、报告生成等超长任务。
-
精准界面定位:在 ScreenSpot-Pro 等 grounding 基准上刷新 SOTA,精准识别屏幕元素位置。
Qwen-UI-Agent的技术原理
-
真机训练环境:搭建 100+ 台真实手机、150+ 应用的真机集群,直接采集真实轨迹并用于训练与评测,弥合模拟环境与真实设备之间的性能鸿沟。
-
混合动作空间:模型同时掌握 GUI 操作(点击、滑动、输入)与 CLI 命令,引入 Batched Actions 机制,支持单次决策并行输出多个动作,使电脑任务中 CLI 占比近半,整体执行步数显著缩短。
-
长程在线强化学习:支持在超过 100 步的超长轨迹上进行端到端在线 RL 训练,依托约 10,000 个并发环境并行 rollout,配合自适应课程学习,持续攻克高难度长程任务。
-
安全对齐机制:将安全判断内嵌于任务执行全链路,通过前置分类识别违法或高风险请求并直接终止;对支付、数据删除、隐私授权等敏感场景,在关键节点触发
ask_user接管,确保危险请求不执行、敏感操作不擅自决定。 -
多模态 Grounding 与通用能力保持:在 GUI 专用训练的同时保留基座模型的通用推理与 agentic 能力,使其既能精准定位屏幕元素(刷新多项 grounding SOTA),能应对真实世界中的长尾知识与工具调用需求。
微信关注回复“开源”,加入AI开源项目交流群
如何使用Qwen-UI-Agent
-
阅读技术报告:访问 arXiv 论文了解模型架构、训练方法与 8 项基准的详细评测结果。
-
浏览项目主页:打开 tongyi-mai.github.io/Qwen-UI-Agent 观看 5 个真实场景的真机演示与交互案例。
-
跟踪开源仓库:关注 GitHub Tongyi-MAI/MAI-UI 获取后续可能发布的模型权重、代码与部署文档更新。
-
运行基准评测:使用配套仓库 Tongyi-MAI/MobileWorld 的 Docker 环境,对模型进行可复现的移动端 GUI 能力测试。
Qwen-UI-Agent的核心优势
-
真机闭环:基于 100+ 台真实手机、150+ 应用训练与评测,自建 MobileWorld-Real 真机基准,直接弥合”模拟到真实”的鸿沟。
-
全面 SOTA:在 MobileWorld、OSWorld、WebArena、ScreenSpot-Pro 等 8 项核心基准上全面超越或持平 GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro 等旗舰模型。
-
混合执行提速:统一 GUI 点击与 CLI 命令,支持单次决策批量输出多个动作,电脑任务中约 40% 为批量动作,整体节省近 58% 执行步数。
-
长程在线强化学习:支持 100+ 步超长轨迹的端到端在线 RL,依托约 10,000 并发环境并行 rollout,持续攻克复杂长程任务。
-
内置安全边界:违法/危险请求直接拒绝终止;支付、删数据、隐私授权等敏感操作在关键节点主动停手,弹窗交还用户确认后再继续。
Qwen-UI-Agent的项目地址
- 项目官网:https://tongyi-mai.github.io/Qwen-UI-Agent/
- GitHub仓库:https://github.com/Tongyi-MAI/MAI-UI
- 技术论文:https://tongyi-mai.github.io/Qwen-UI-Agent/Qwen-UI-Agent-Technical-Report.pdf
Qwen-UI-Agent的同类竞品对比
| 对比维度 | Qwen-UI-Agent | MAI-UI |
|---|---|---|
| 产品定位 | 跨移动、电脑、浏览器、DeepSearch 的统一 GUI Agent 基座 | 移动端 GUI Agent 基座模型 |
| MobileWorld | 82.1% | 41.7% |
| 执行方式 | GUI + CLI 混合,支持批量动作(Batched Actions) | 以 GUI 点击为主 |
| 长程能力 | 100+ 步在线 RL,10,000 并发环境 rollout | 基础长程任务 |
| 跨平台 | 手机、电脑、浏览器、DeepSearch 统一模型 | 主要聚焦移动端 |
| 主动服务 | 能从航班取消等真实通知信号主动发起任务 | 被动响应用户指令 |
| 安全机制 | 分层安全:违法直接拒,敏感操作弹窗交还用户确认 | 基础安全对齐 |
| 数据飞轮 | AutoResearch 式数据飞轮:Agent 自建任务、诊断失败、规划迭代 | 人工驱动迭代 |
Qwen-UI-Agent的应用场景
-
本地生活探店:自动跨高德、大众点评、小红书完成地址搜索、人气比对和口碑总结,一站式搞定约会探店。
-
行程会议联动:查 12306 高铁班次、算地铁通勤时间,自动在钉钉创建带提醒的会议日程。
-
深度调研报告:跨网站采集财报数据、运行分析脚本,自动生成 Excel、PPT 和 Word 交付物。
-
跨设备发票整理:从手机相册提取发票照片,传到电脑分类归档,并生成结构化 Excel 报销单。
-
航班取消主动应急:检测到航班取消通知后,自动搜索替代航班和高铁方案,推荐能赶上会议的最优选项并交还用户决策。