虎科技
业界资讯 手机产品 数码产品 移动互联 软件产品 智能汽车 生活家电 关于我们 热点资讯

DeepSeek-Prover-V2数学推理新突破,88.9%通过率引领AI新标杆!

2025-05-01来源:ITBEAR编辑:瑞雪

近日,AI 开源社区 Hugging Face 迎来了一项新成果,深度求索(DeepSeek)团队发布了名为 DeepSeek-Prover-V2-671B 的大型语言模型。与此同时,该团队还在 GitHub 等平台分享了相关论文,详细介绍了这一新模型的特性和成就。

DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源模型,其基础是 DeepSeek-V3-0324。为了生成训练所需的初始数据,团队采用了递归定理证明管道的方法。这一创新使得模型在处理复杂数学问题时,能够展现出更高的精确度和效率。

DeepSeek 团队推出了两个版本的模型:DeepSeek-Prover-V2-671B 和 DeepSeek-Prover-V2-7B。前者结合了 V3 基础大模型的优点,后者则是一个增强模型。团队还发布了 DeepSeek-ProverBench 数据集,为评估模型性能提供了有力工具。

DeepSeek-Prover-V2-671B 的架构与 DeepSeek V3-0324 相同,但其应用场景却大相径庭。这款模型并非用于常规对话或推理,而是专注于形式化定理证明,专门增强了数学能力。为了实现这一目标,团队采用了复杂的策略。

首先,他们引导 DeepSeek-V3 模型将复杂的数学定理分解为一系列子目标。这一步骤整合了非形式化与形式化数学推理,使得模型能够在 Lean 4 平台上逐步完成形式化证明。接着,团队利用一个较小的 7B 参数模型来处理这些子目标的证明搜索,从而大大减轻了计算负担。

在训练过程中,团队精心筛选了一批难题,这些难题虽然 7B 模型无法直接解决,但其子目标已被证明。通过整合这些子目标的证明,团队形成了完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成了丰富的合成数据。这些数据为模型的微调提供了坚实的基础。

随后,团队利用强化学习进一步提升模型的能力。他们以二元反馈(正确或错误)作为奖励机制,通过不断的试错和优化,使得 DeepSeek-Prover-V2-671B 在神经定理证明领域取得了显著进展。在 MiniF2F-test 数据集上,该模型的通过率达到了 88.9%,在 PutnamBench 数据集中也成功解决了 49 个问题。

为了推动模型在多样化场景下的测试与应用,DeepSeek 团队还发布了 ProverBench 基准数据集。该数据集包含了 325 个形式化数学问题,其中 15 个问题源自近期的 AIME 竞赛,涉及数论与代数等高中竞赛难度的内容。其余 310 个问题则涵盖了线性代数、微积分、概率等多个领域,为高中竞赛和本科数学提供了全面的评估标准。

大疆DJI Osmo Action 6首发体验:画质续航双飞跃,户外拍摄新神器
这里我展开讲解一下,由于Action6是方形CMOS这意味着它在正常16:9和4:3情况下像素是无法覆盖整个CMOS,但在二级菜单中我们能找到自由裁切模式,开启该模式后,Action 6的拍摄页面就会变成一…

2025-11-14

W45周手机销量榜:苹果蝉联五周冠军,小米稳居国产首位,vivo紧随其后
每到周五可能大家都在等行业人士给出的最新一周国内智能手机领域排行榜,因为从周榜就可以分析出各品牌目前在国内生存状况。数据显示苹果还是国内排名第一的品牌,不过市场份额又滑落了一个百分点,这已经是苹果连续五周国内…

2025-11-14

小米潘九堂发声:雷军遭误解成“机会主义者” 真实形象亲民又勤奋
潘九堂在发文的同时,还转发了一位博主的相关消息。据CNMO了解,今年3月,雷军在个人社交媒体发布动态,晒出一张此前小米发布会上的照片,并配文:“当我站在舞台上,听到掌声响起来,都会想起那首熟悉的旋律……”此动…

2025-11-14

高通跃龙IQ-X系列工业级PC处理器发布,为工业自动化注入AI新动力
高通跃龙 IQ-X 系列为工业自动化提供了 AI 基础设施,能够实现 AI模型移植,以及面向预测性维护、状态监测和缺陷检测等关键用例的应用开发。 该平台支持Qt、CODESYS等工业软件工具,通过高通AI软…

2025-11-14

vivo Y500 Pro即将开售:低中端定位,影像突出,11月14日全新登场
屏幕保持打孔直屏,大小控制在6.67英寸,作为旗舰级护眼屏,分辨率提升到1.5K(2800*1260像素),像素密度为460 PPI,刷新率为120Hz,触控采样率在不同场景蛙有所变化,最低为130Hz,最…

2025-11-14

iQOO新机屏幕升级再发力,多系列普及2K,小屏新品或将来袭
近日,博主@数码闲聊站的一份爆料中提到,“iQOO说了无2K不旗舰,接下来Neo系列和数字系列都「全面标配2K」,iQOO15那块三星屏也颇受好评,蓝厂明年应该也会和三星显示深度合作”。 也就是说,iQO…

2025-11-14

苹果iOS 26.2 beta2测试版来袭:动画回归,游戏排序升级,老设备升级需谨慎
11 月 13 日凌晨,苹果发布 iOS 26.2 beta2 测试版,同时苹果还发布了 iPadOS 26.2 beta2、watchOS26.2 beta2、tvOS 26.2 beta2、macOS …

2025-11-13

vivo S50系列12月将至:S50 Pro mini紧凑旗舰,S50配望远镜后摄
vivo S50系列,包括 vivo S50和S50 Pro mini 。预计将在12月发布。 vivo S50 Pro mini将是一款紧凑型旗舰手机,配备 6.31 英寸显示屏。 据传闻 它将配备高通骁…

2025-11-13

​小米巴黎再拓版图!首家直营小米之家即将盛大开业​
11月13日消息,日前,小米法国副国家经理“产品逸飞”微博发文称,“巴黎米家首店,即将见面。” 据了解,这家即将开业的小米之家为直营门店。 快科技注:2019年1月18日,小米法国旗舰店在香榭丽舍大街开业,这…

2025-11-13

GPT-5.1正式登场:从参数跑分到懂你交互,AI助手开启新未来
GPT-5.1 在风格化的另一大改进是,自定义指令现在能更可靠地,在多轮对话中坚持住,ChatGPT可以更稳定地,按照我们定义的个性来完成各项任务。 OpenAI 这次提供了后悔药,付费用户在 3 个月内…

2025-11-13