新闻
移动端基准全面超越GPT与Claude
1 分钟阅读
移动端基准全面超越GPT与Claude!阿里发布Qwen-UI-Agent,开启GUI智能体新纪元 阿里巴巴于8月20日正式发布了全新的GUI智能体基座模型Qwen-UI-Agent。该模型全面覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境,并在多项核心图形用户界面基准测试中全面对标并超越业界多款旗舰模型。 在具体的基准表现方面,Qwen-UI-Agent在移动端展现出强劲实力。在MobileWorld基准上得分为82.1%,分别领先GPT-5.6Sol和Claude Opus4.8达12.0和14.6个百分点;在真实环境基准MobileWorld-Real上取得了92.2%的成绩,超越了Gemini3.1Pro、Claude Opus4.8以及GPT-5.6Sol;在AndroidDaily基准上更是高达97.5%,接近满分表现。在电脑端与浏览器方面,其在OSWorld-Verified上达到79.5%,超越GPT-5.5和Gemini3.1Pro;在WebArena上也以73.6%的成绩位列所有对比模型第一。此外,在GUI Grounding的ScreenSpot-Pro测试中取得81.5%的分数,并刷新了其余4个评测基准的SOTA记录。 为了攻克从模拟到真实的落地难题,Qwen-UI-Agent搭建了覆盖100多台真实手机和150多款应用的真机移动环境,用于执行任务构建、轨迹采集、模型训练与评测,并自建了包含400多项任务和100多款应用的MobileWorld-Real真机基准。除了常规的GUI点击操作外,该模型还支持直接执行命令行操作,并在单次决策中批量输出多个动作,其中电脑任务中的CLI动作占比近半,约40%的动作以批量形式输出。 在安全性与长程任务处理方面,Qwen-UI-Agent将安全机制贯穿任务执行的全过程。面对违法或高风险请求,模型会直接拒绝并终止任务;而在面对支付、数据删除、隐私授权等敏感场景时,则会在关键步骤主动停手并向用户说明情况。同时,模型支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境同时r