AB
AiBoss站
project

Qwen-UI-Agent - 阿里通义推出的 GUI 智能体基座模型

Qwen-UI-Agent 是阿里巴巴通义团队推出的 GUI 智能体基座模型,能在手机、电脑和网页端像真人一样操作界面。模型基于 100+ 台真机、150+ 应用训练,支持 GUI ...

Qwen-UI-Agent是什么

Qwen-UI-Agent 是阿里巴巴通义团队推出的 GUI 智能体基座模型,能在手机、电脑和网页端像真人一样操作界面。模型基于 100+ 台真机、150+ 应用训练,支持 GUI 与命令行混合执行,可完成跨应用长程任务。内置安全机制,危险请求直接拒绝,支付、删除等敏感操作主动交还用户确认。在 MobileWorld、WebArena 等基准上全面超越 GPT-5.6、Claude Opus 等旗舰模型,是当前真实世界可用性最强的 GUI Agent 之一。

Qwen-UI-Agent的主要功能

  • 跨设备 GUI 操作:在手机、电脑、浏览器上自动点击、输入、滑动,完成界面交互。
  • 真机多应用工作流:跨 150+ 真实 App 执行复杂长链任务,如查地图→找餐厅→订座→发日程。
  • GUI + CLI 混合执行:既能点界面,也能跑命令行,支持一次输出多个批量动作提速。
  • 安全边界管控:违法请求直接拒,支付、删文件、隐私授权等敏感操作主动弹窗交还用户确认。
  • 长程任务处理:稳定执行 100+ 步的调研、数据分析、报告生成等超长任务。
  • 精准界面定位:在 ScreenSpot-Pro 等 grounding 基准上刷新 SOTA,精准识别屏幕元素位置。

Qwen-UI-Agent的技术原理

  • 真机训练环境:搭建 100+ 台真实手机、150+ 应用的真机集群,直接采集真实轨迹并用于训练与评测,弥合模拟环境与真实设备之间的性能鸿沟。
  • 混合动作空间:模型同时掌握 GUI 操作(点击、滑动、输入)与 CLI 命令,引入 Batched Actions 机制,支持单次决策并行输出多个动作,使电脑任务中 CLI 占比近半,整体执行步数显著缩短。
  • 长程在线强化学习:支持在超过 100 步的超长轨迹上进行端到端在线 RL 训练,依托约 10,000 个并发环境并行 rollout,配合自适应课程学习,持续攻克高难度长程任务。
  • 安全对齐机制:将安全判断内嵌于任务执行全链路,通过前置分类识别违法或高风险请求并直接终止;对支付、数据删除、隐私授权等敏感场景,在关键节点触发 ask_user 接管,确保危险请求不执行、敏感操作不擅自决定。
  • 多模态 Grounding 与通用能力保持:在 GUI 专用训练的同时保留基座模型的通用推理与 agentic 能力,使其既能精准定位屏幕元素(刷新多项 grounding SOTA),能应对真实世界中的长尾知识与工具调用需求。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Qwen-UI-Agent

  • 阅读技术报告:访问 arXiv 论文了解模型架构、训练方法与 8 项基准的详细评测结果。
  • 浏览项目主页:打开 tongyi-mai.github.io/Qwen-UI-Agent 观看 5 个真实场景的真机演示与交互案例。
  • 跟踪开源仓库:关注 GitHub Tongyi-MAI/MAI-UI 获取后续可能发布的模型权重、代码与部署文档更新。
  • 运行基准评测:使用配套仓库 Tongyi-MAI/MobileWorld 的 Docker 环境,对模型进行可复现的移动端 GUI 能力测试。

Qwen-UI-Agent的核心优势

  • 真机闭环:基于 100+ 台真实手机、150+ 应用训练与评测,自建 MobileWorld-Real 真机基准,直接弥合”模拟到真实”的鸿沟。
  • 全面 SOTA:在 MobileWorld、OSWorld、WebArena、ScreenSpot-Pro 等 8 项核心基准上全面超越或持平 GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro 等旗舰模型。
  • 混合执行提速:统一 GUI 点击与 CLI 命令,支持单次决策批量输出多个动作,电脑任务中约 40% 为批量动作,整体节省近 58% 执行步数。
  • 长程在线强化学习:支持 100+ 步超长轨迹的端到端在线 RL,依托约 10,000 并发环境并行 rollout,持续攻克复杂长程任务。
  • 内置安全边界:违法/危险请求直接拒绝终止;支付、删数据、隐私授权等敏感操作在关键节点主动停手,弹窗交还用户确认后再继续。

Qwen-UI-Agent的项目地址

  • 项目官网:https://tongyi-mai.github.io/Qwen-UI-Agent/
  • GitHub仓库:https://github.com/Tongyi-MAI/MAI-UI
  • 技术论文:https://tongyi-mai.github.io/Qwen-UI-Agent/Qwen-UI-Agent-Technical-Report.pdf

Qwen-UI-Agent的同类竞品对比

对比维度 Qwen-UI-Agent MAI-UI
产品定位 跨移动、电脑、浏览器、DeepSearch 的统一 GUI Agent 基座 移动端 GUI Agent 基座模型
MobileWorld 82.1% 41.7%
执行方式 GUI + CLI 混合,支持批量动作(Batched Actions) 以 GUI 点击为主
长程能力 100+ 步在线 RL,10,000 并发环境 rollout 基础长程任务
跨平台 手机、电脑、浏览器、DeepSearch 统一模型 主要聚焦移动端
主动服务 能从航班取消等真实通知信号主动发起任务 被动响应用户指令
安全机制 分层安全:违法直接拒,敏感操作弹窗交还用户确认 基础安全对齐
数据飞轮 AutoResearch 式数据飞轮:Agent 自建任务、诊断失败、规划迭代 人工驱动迭代

Qwen-UI-Agent的应用场景

  • 本地生活探店:自动跨高德、大众点评、小红书完成地址搜索、人气比对和口碑总结,一站式搞定约会探店。
  • 行程会议联动:查 12306 高铁班次、算地铁通勤时间,自动在钉钉创建带提醒的会议日程。
  • 深度调研报告:跨网站采集财报数据、运行分析脚本,自动生成 Excel、PPT 和 Word 交付物。
  • 跨设备发票整理:从手机相册提取发票照片,传到电脑分类归档,并生成结构化 Excel 报销单。
  • 航班取消主动应急:检测到航班取消通知后,自动搜索替代航班和高铁方案,推荐能赶上会议的最优选项并交还用户决策。