虎科技
业界资讯 手机产品 数码产品 移动互联 软件产品 智能汽车 生活家电 关于我们 热点资讯

微软OmniParser V2.0:让AI模型秒变电脑操控高手,已开源

2025-02-17来源:ITBEAR编辑:瑞雪

微软近期在人工智能领域再次迈出重要一步,推出了OmniParser V2.0,这是一款基于纯视觉技术的GUI智能体解析工具,能够精准识别并解析屏幕上的可交互图标。此前,该工具与GPT-4V的结合已显著提升了其识别能力。

在2月12日,微软官方网站上正式发布了OmniParser的最新版本。这一版本不仅延续了前代产品的优势,还实现了与多个先进AI模型的兼容,包括OpenAI的多个版本(4o、o1、o3-mini)、DeepSeek R1、Qwen 2.5VL以及Anthropic的Sonnet等。这意味着这些模型在OmniParser的助力下,能够转变为操控计算机的AI智能体。

相较于V1版本,OmniParser V2.0在训练数据上进行了大幅升级,采用了更大规模的交互元素检测数据和图标功能标题数据。这一改进使得V2.0在检测较小的可交互UI元素时,准确率有了显著提升,同时推理速度也更快,延迟降低了60%。

在高分辨率Agent基准测试ScreenSpot Pro中,OmniParser V2.0与GPT-4o的结合展现出了惊人的效果。测试结果显示,V2.0+GPT-4o的准确率高达39.6%,而GPT-4o单独使用时,准确率仅为0.8%。这一对比充分展示了OmniParser V2.0在提升AI模型性能方面的巨大潜力。

为了加速不同智能体设置的实验进程,微软还推出了OmniTool这一开源工具。OmniTool是一个集成了屏幕理解、定位、动作规划和执行等基本功能的Docker化Windows系统。这一工具为将大模型转变为智能体提供了关键支持,极大地简化了实验过程。

对于对OmniParser和OmniTool感兴趣的开发者而言,微软已经提供了开源地址,方便他们获取并使用这些工具,以进一步推动人工智能技术的发展。

苹果iPhone Fold折叠屏前瞻:屏下摄像头无折痕,大电池或成最贵iPhone
【太平洋科技】11 月 27 日消息,苹果首款折叠屏 iPhone Fold 预计将于 2026 年秋季与 iPhone 18 Pro系列同步发布。相比三星 Z Fold 系列放弃屏下方案转向挖孔屏的设…

2025-11-30

三星出样24Gb GDDR7显存:最高36Gbps速率,助力显卡与AI计算新飞跃
如今大家对于显存产能的抢夺已经达到了前所未有的程度,厂商们也愿意在这个前所未有的年代中推出更加先进的显存产品来吸引用户购买。目前三星就表示已经顺利出样拥有36Gbps的GDDR7显存,从而为今后的显卡以及计算…

2025-11-30

AYANEO NEXT II全新旗舰Windows掌机亮相 配置强劲玩法多样引期待
IT之家 11 月 29 日消息,今日,AYANEO NEXT II 全新旗舰 Windows 掌机亮相,价格信息暂未公布。NEXT II的四颗自定义按键,导航键、等号键、LC 和 RC,支持功能自由设定,…

2025-11-30

华为测试麒麟9030宽屏竖折新机 性能升级或明年一季度亮相
【CNMO科技消息】11月28日,有数码博主爆料称,华为正在测试一款搭载麒麟9030芯片的全新宽屏比例竖向折叠屏手机。今年3月,华为发布了首款“阔”折叠屏手机Pura X,其内屏是一块16:10比例6.3英…

2025-11-29

华为Mate 80系列11月28日开售!麒麟9030 Pro芯片+6000mAh大电池,配置拉满
华为今年的旗舰机已登场,将会在11月28日全新开售,机型有所优化,全系列拥有四个版本,分别是华为Mate 80标准版本、Pro版本、Pro Max版本、RS版本,与去年同样,其中的RS版本为最高。屏幕类型升…

2025-11-29