人工智能

阿里发布Qwen-UI-Agent 移动端基准超越GPT 5.6与Claude Opus 4.8

字号+作者:凤凰网科技 来源:凤凰网科技 2026-08-20 21:25 评论(创建话题) 收藏成功收藏本文

8月20日,阿里巴巴正式推出Qwen-UI-Agent,一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。据官方介绍,Qwe'...

8月20日,阿里巴巴正式推出Qwen-UI-Agent,一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。aCl品论天涯网


aCl品论天涯网

据官方介绍,Qwen-UI-Agent在多项GUI基准测试中全面对标并超越业界旗舰模型。移动端方面,在MobileWorld基准上达到82.1%,分别领先GPT-5.6Sol、ClaudeOpus4.8达12.0和14.6个百分点;在真机基准MobileWorld-Real上达到92.2%,超越Gemini3.1Pro、ClaudeOpus4.8、GPT-5.6Sol等模型;在AndroidDaily上更是高达97.5%,接近满分。电脑端方面,在OSWorld-Verified上达到79.5%,超越GPT-5.5、Gemini3.1Pro等模型。浏览器与DeepSearch方面,在WebArena上达到73.6%,位列所有对比模型第一。GUIGrounding方面,在ScreenSpot-Pro上达到81.5%,在其余4个评测基准也全部刷新SOTA。aCl品论天涯网


aCl品论天涯网

Qwen-UI-Agent搭建了覆盖100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建MobileWorld-Real真机基准(400多项任务、100多款应用),打通“从模拟到真实”的最后一公里。GUI操作之外,模型还能直接执行命令行操作,并在单次决策中批量输出多个动作——电脑任务中CLI动作占比近半,约40%动作以批量形式输出。aCl品论天涯网

安全机制方面,Qwen-UI-Agent将安全判断贯穿任务执行全过程:面对违法或高风险请求直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,在关键步骤主动停手并向用户说明情况。模型还支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境同时rollout,持续攻克长程任务。aCl品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]