阿里发布Qwen-UI-Agent,真机基准测试全面领跑业界旗舰

科技区角 2026-08-20 20:30

【科技纵览】8月20日,阿里巴巴正式对外披露了其最新研发成果——Qwen-UI-Agent。这是一款以真实物理世界交互为核心的GUI智能体基座模型,其应用场景广泛覆盖了移动端、PC端、网页浏览以及深度搜索(DeepSearch)等复杂环境。据官方数据显示,该模型在多项图形用户界面基准测试中表现强劲,整体性能指标已全面对标并超越当前业界的旗舰级模型。

在移动端测试环节,Qwen-UI-Agent在MobileWorld基准上斩获82.1%的高分,分别领先GPT-5.6 Sol与Claude Opus 4.8达12.0和14.6个百分点。而在更具挑战性的真机基准MobileWorld-Real中,其得分高达92.2%,成功超越Gemini 3.1 Pro等竞争对手;在AndroidDaily测试中更是逼近满分,达到97.5%。转向电脑端,该模型在OSWorld-Verified基准上取得79.5%的成绩,优于GPT-5.5及Gemini 3.1 Pro。此外,在浏览器与DeepSearch领域的WebArena测试中,它以73.6%的得分位居所有对比模型之首。在GUI Grounding方面,ScreenSpot-Pro得分为81.5%,其余四项评测基准也均刷新了SOTA纪录。

为了打通“从模拟到真实”的最后一步,研发团队构建了包含100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集及模型训练评测,并自建了涵盖400多项任务的MobileWorld-Real真机基准。值得注意的是,除了常规的GUI操作,该模型还具备直接执行命令行指令的能力,且在单次决策中能批量输出多个动作——在电脑任务中,CLI动作占比接近一半,约40%的动作以批量形式呈现。

安全机制被嵌入任务执行的全流程之中:面对违法或高风险请求,模型会直接拒绝并终止任务;而在涉及支付、数据删除或隐私授权等敏感场景时,它会在关键步骤主动暂停并向用户说明情况。技术底层方面,模型支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境的同步rollout,持续攻克长程任务难题。这一进展表明,具身智能在复杂交互场景下的可靠性正迎来实质性突破。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
测试 阿里
more
亏掉1747亿,阿里一把赚回1700亿!钱多多的人,很难输
曝苹果联合阿里自研中国专属大模型;追觅卖出首台超3万美元手机;微信称朋友圈坚守不可编辑原则;智谱发布GLM-5.3最强开源编程模型...
曝苹果联合阿里,自研中国区AI大模型
苹果生态引入阿里千问,SK海力士重庆工厂引资,OpenAI暂停Astra部分研发,第二届世界人形机器人运动会将开赛,这就是今天的其他大新闻!
阿里云M890超节点乌兰察布首发,十万亿参数MoE推理迈入云端时代
阿里发布Qwen-UI-Agent,真机基准测试全面领跑业界旗舰
刚刚,阿里Qwen3.8-27B开源!家用显卡可跑,能看图看视频
Jeff Dean,阿里花了十年也没「绕开」他
阿里达摩院启动“阿里星”招募,聚焦AI芯片与医疗智能体前沿课题
101亿元大交易!阿里巴巴正式出售灵犀互娱;大疆诉美国国防部案赢得程序性胜利;李书福辞任董事会主席,吉利汽车管理层大调整
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号