【科技纵览】8月20日,阿里巴巴正式对外披露了其最新研发成果——Qwen-UI-Agent。这是一款以真实物理世界交互为核心的GUI智能体基座模型,其应用场景广泛覆盖了移动端、PC端、网页浏览以及深度搜索(DeepSearch)等复杂环境。据官方数据显示,该模型在多项图形用户界面基准测试中表现强劲,整体性能指标已全面对标并超越当前业界的旗舰级模型。
在移动端测试环节,Qwen-UI-Agent在MobileWorld基准上斩获82.1%的高分,分别领先GPT-5.6 Sol与Claude Opus 4.8达12.0和14.6个百分点。而在更具挑战性的真机基准MobileWorld-Real中,其得分高达92.2%,成功超越Gemini 3.1 Pro等竞争对手;在AndroidDaily测试中更是逼近满分,达到97.5%。转向电脑端,该模型在OSWorld-Verified基准上取得79.5%的成绩,优于GPT-5.5及Gemini 3.1 Pro。此外,在浏览器与DeepSearch领域的WebArena测试中,它以73.6%的得分位居所有对比模型之首。在GUI Grounding方面,ScreenSpot-Pro得分为81.5%,其余四项评测基准也均刷新了SOTA纪录。
为了打通“从模拟到真实”的最后一步,研发团队构建了包含100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集及模型训练评测,并自建了涵盖400多项任务的MobileWorld-Real真机基准。值得注意的是,除了常规的GUI操作,该模型还具备直接执行命令行指令的能力,且在单次决策中能批量输出多个动作——在电脑任务中,CLI动作占比接近一半,约40%的动作以批量形式呈现。
安全机制被嵌入任务执行的全流程之中:面对违法或高风险请求,模型会直接拒绝并终止任务;而在涉及支付、数据删除或隐私授权等敏感场景时,它会在关键步骤主动暂停并向用户说明情况。技术底层方面,模型支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境的同步rollout,持续攻克长程任务难题。这一进展表明,具身智能在复杂交互场景下的可靠性正迎来实质性突破。
阿里发布Qwen-UI-Agent,真机基准测试全面领跑业界旗舰
科技区角
2026-08-20 20:30
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。