虎科技
业界资讯 手机产品 数码产品 移动互联 软件产品 智能汽车 生活家电 关于我们 热点资讯

AI高考大考:DeepSeek、讯飞星火领跑,数学能力谁更强?

2025-06-08来源:ITBEAR编辑:瑞雪

在2025年高考数学科目考试结束后,网络上关于试卷难度的讨论热度不减。作为科技领域的观察者,我们不禁好奇,对于当前备受瞩目的AI技术而言,这份数学试卷是否同样具有挑战性?为了回答这个问题,我们组织了一场特别的“考试”,邀请了多家知名的大模型参与,模拟完成了一套高考数学试卷。

本次“考试”中,我们挑选了以下几家具有代表性的大模型作为“考生”:DeepSeek R1 0528、通义千问 Qwen3-235B-A22B、讯飞星火 X1-0420、豆包 Seed-Thinking-v1.5、文心 X1 Turbo、腾讯混元 Hunyuan T1 latest和GPT o3。由于网络流传的试题版本不一,我们通过多版本交叉验证和教师解题验证的方式,确保评测的准确性,试卷总分为150分。

我们特别邀请了一位拥有十年高中数学教研经验的专家汪鹏老师,对大模型的答案进行评分。考虑到部分模型在OCR识别方面的限制,我们采用了OCR转写后输入答题的方式进行处理。

接下来,让我们通过几道典型题目,看看这些大模型的表现如何。

首先是选择题第一题,各家大模型均给出了正确答案,显示出它们在基础题目上的稳定表现。

选择题第五题是一道涉及函数的题目,所有大模型再次全部答对,进一步证明了它们在复杂题目上的解题能力。

然而,在选择题第八题中,豆包大模型和DeepSeek出现了错误,而其他模型均给出了正确答案。这道题目涉及对数函数,显示出部分模型在处理特定数学知识点时的局限性。

在解答题方面,我们以第16题为例,这是一道涉及数列和函数的题目。DeepSeek、通义千问、讯飞星火和豆包大模型均给出了正确的解题过程和答案,而文心X1和腾讯混元则出现了不同程度的错误。

最后,我们来看难度更高的第18题。讯飞星火、豆包大模型、DeepSeek、通义千问和GPT o3均获得了满分,而文心X1则因答案错误而失分。

经过综合评分,DeepSeek以143分的成绩位列榜首,讯飞星火以141分紧随其后,GPT o3以138分获得第三名。这次“考试”不仅展示了AI在数学领域的强大能力,也暴露了部分模型在实际应用中的短板。

DeepSeek作为最新版本的大模型,在思考推理和数学能力方面表现出色,但OCR识别效果不佳,且推理速度慢、资源消耗高。讯飞星火则凭借其较小的模型量级和高效的数学能力,在评测中取得了优异成绩,显示出其在教育领域的深厚积累。

豆包和通义千问等大模型也表现出色,与国际顶尖模型水平相当。这次“考试”不仅是对AI数学能力的一次检验,更是对未来AI在教育领域深度应用的一次探索。

雷军晒小米YU7前向碰撞测试实拍 展现硬核安全实力
快科技11月14日消息,就在刚刚雷军发布视频称:小米YU7前向碰撞测试实拍:包括正面100%重叠、50%重叠两个场景。 事实上,在这之前小米汽车官网已经发布了这个视频,而雷军又一次转发了这个信息,为的是让更多…

2025-11-15

iPhone 17系列中国市场激活量破千万 性能升级受消费者青睐
【环球网科技综合报道】11月14日消息,据科技博主@数码闲聊站披露,苹果 iPhone 17 系列本周在中国市场的激活量已突破1000万台,创下该系列上市以来的阶段性销量新高,印证了中国消费者对其产品升级的认…

2025-11-15

华为顶级旗舰价格大降,16GB+512GB直降2100元,为新机腾位
这段时间虽然登场了很多新旗舰,但阿维觉得挺遗憾的,因为绝大多数新旗舰都只是常规升级,单纯为了启用第五代骁龙8至尊版和天玑9500,在这种情况下,甚至就连小米17 Pro系列上并不算多大创新的背屏也成为了大家津…

2025-11-14

安谋科技发布“周易”X3 NPU IP,端侧AI性能飙升助力多领域落地
智东西11月14日消息,昨日,安谋科技正式发布了专为端侧大模型而生的最新一代NPUIP——“周易”X3,其能够与Arm架构CPU、GPU协同,组成基于Arm生态的异构算力解决方案。 新的“周易”X3 NP…

2025-11-14

联想明年再发力!moto razr折叠机与Y700平板将携骁龙8系新平台登场
【CNMO科技消息】11月14日,有数码博主爆料称,联想明年将继续迭代拯救者Y700平板和moto razr系列折叠手机。这两款产品将搭载第五代骁龙8至尊版和第五代骁龙8移动平台,其中,Y700平板屏幕比例为…

2025-11-14

华为Mate70 Air深度体验:打破常规,超大屏“Air”的另类演绎
可以确定,华为Mate70 Air的影像没有因为“Air”的定义做妥协,在同价位机型中是能打的,硬件配置方面也是这个思路。这也符合华为Mate70 Air的技术路径,虽然重量不可避免地来到208g,但是保…

2025-11-14

欧加9K级大电池定版试产,一加骁龙8系直屏新机测试,中端机竞争升级
IT之家 11 月 14 日消息,博主 @数码闲聊站 今天在微博透露,欧加的 9K 级别大电池现已定版试产。 博主表示,这块电池采用单块4.51V 单电芯设计,额定容量 32.59Wh,额定电池 8760m…

2025-11-14

联发科天玑8系芯片屠榜安卓次旗舰性能榜 性能能效双优成市场新宠
以榜单第一的真我Neo7 SE为例,通过与MTK联发科技的深度联合调校,该机在同价位段中展现出极为出色的游戏性能,搭配真我GT性能引擎,通过芯片级调校,实现了持久稳定的高帧率表现,同时能耗最高可降低7%,帧…

2025-11-14

真我neo 8新机曝光:8000mAh大电池+3D超声波指纹,2000元档性价比新选择
真我手机从2018年成立到现在,也是走过了7个年头,如今真我手机全球销量达到三亿,在全球范围内跻身手机圈的第一梯队,虽说份额还是差小米等品牌很多,可知名度已经起来了。在今年真我尝试冲击高端,发布的真我GT …

2025-11-14

第45周国内手机市场格局:苹果领跑,小米vivo紧随其后竞争激烈
据CNMO了解,截至11月2日,该系列在国内的激活数量已突破825万台,其中iPhone 17 Pro Max约395.7万台、iPhone17 Pro约246.2万台、标准版iPhone 17约172.8…

2025-11-14