首页
学习
活动
专区
工具
TVP
发布
精选内容/技术社群/优惠产品,尽在小程序
立即前往

微软OmniParser V2.0:让AI模型秒变电脑操控高手,已开源

微软近期在人工智能领域再次迈出重要一步,推出了OmniParser V2.0,这是一款基于纯视觉技术的GUI智能体解析工具,能够精准识别并解析屏幕上的可交互图标。此前,该工具与GPT-4V的结合已显著提升了其识别能力。

在2月12日,微软官方网站上正式发布了OmniParser的最新版本。这一版本不仅延续了前代产品的优势,还实现了与多个先进AI模型的兼容,包括OpenAI的多个版本(4o、o1、o3-mini)、DeepSeek R1、Qwen 2.5VL以及Anthropic的Sonnet等。这意味着这些模型在OmniParser的助力下,能够转变为操控计算机的AI智能体。

相较于V1版本,OmniParser V2.0在训练数据上进行了大幅升级,采用了更大规模的交互元素检测数据和图标功能标题数据。这一改进使得V2.0在检测较小的可交互UI元素时,准确率有了显著提升,同时推理速度也更快,延迟降低了60%。

在高分辨率Agent基准测试ScreenSpot Pro中,OmniParser V2.0与GPT-4o的结合展现出了惊人的效果。测试结果显示,V2.0+GPT-4o的准确率高达39.6%,而GPT-4o单独使用时,准确率仅为0.8%。这一对比充分展示了OmniParser V2.0在提升AI模型性能方面的巨大潜力。

为了加速不同智能体设置的实验进程,微软还推出了OmniTool这一开源工具。OmniTool是一个集成了屏幕理解、定位、动作规划和执行等基本功能的Docker化Windows系统。这一工具为将大模型转变为智能体提供了关键支持,极大地简化了实验过程。

对于对OmniParser和OmniTool感兴趣的开发者而言,微软已经提供了开源地址,方便他们获取并使用这些工具,以进一步推动人工智能技术的发展。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OB8LDuEMs1rODSBdPAlmysUQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

扫码

添加站长 进交流群

领取专属 10元无门槛券

私享最新 技术干货

扫码加入开发者社群
领券