阿里巴巴于8月20日正式发布全新的GUI智能体基座模型Qwen-UI-Agent,全面覆盖移动端、电脑端、网页端及深度搜索环境。官方数据显示,该模型在MobileWorld基准上得分为82.1%,分别领先GPT-5.6Sol和Claude Opus4.8达12.0和14.6个百分点;在AndroidDaily基准上更是高达97.5%,接近满分。电脑端方面,其在OSWorld-Verified上达到79.5%,超越GPT-5.5和Gemini3.1Pro。 从行业背景看,大模型的竞争正从"会聊天、会写代码"延伸到"会操作界面、能完成真实任务"。GUI智能体需要理解屏幕上的按钮、输入框、列表与页面跳转,并像人一样完成点击、输入、滑动等操作。过去这类能力高度依赖模拟环境,真实设备上的表现往往明显衰减,而Qwen-UI-Agent把安全机制贯穿任务全程,面对敏感操作主动停手说明,试图同时解决能力与可靠性的问题。
文章图片 2
为攻克从模拟到真实的落地难题,Qwen-UI-Agent搭建了覆盖100多台真实手机和150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建了包含400多项任务和100多款应用的MobileWorld-Real真机基准。除常规GUI点击外,该模型还支持直接执行命令行操作,在单次决策中批量输出多个动作,电脑任务中CLI动作占比近半,约40%的动作以批量形式输出,工程化程度明显提升。 这种"真机+长轨迹+批量动作"的路线,实际上重新定义了智能体训练的数据与算力需求。超过100步的超长轨迹在线强化学习、约10000个并发环境同时rollout,都对训练与推理算力的稳定性、调度效率提出更高要求。GUI智能体跑得越远,算力底座与工程化能力就越成为隐形胜负手——星战科技聚焦GPU算力平台与AI实训生态,为智能体训练与推理提供可调度的算力支撑,并通过实训平台培养懂模型、会调优、能落地的工程人才,帮助企业把能演示的智能体做成能交付的智能体。
文章图片 4
从趋势看,GUI智能体正在从模型能力竞争转向工程生态竞争。模型的基准分数只是入场券,能否在真实设备上稳定完成支付、填表、跨应用协作等长程任务,决定其能否进入企业级场景。真机环境、轨迹数据、评测基准与安全机制,共同构成了GUI智能体落地的系统工程,这也意味着数据与算力基础设施的重要性将持续上升。 可以预见,随着移动端、电脑端与网页端GUI智能体的能力拉平,用户操作手机和电脑的方式将被重新定义,智能体将成为跨越应用边界的"操作层"。对企业而言,提前布局GUI智能体的应用场景与算力工程能力,将在下一轮AI应用竞争中占据主动。