虎科技
业界资讯 手机产品 数码产品 移动互联 软件产品 智能汽车 生活家电 关于我们 热点资讯

中国大模型“第一”之争:Kimi K3与Qwen3.8-Max双雄格局谁更胜一筹?

2026-09-01来源:天脉网编辑:瑞雪

当前,中国大模型领域正上演一场独特的“第一”争夺战。几乎每家头部企业都宣称自家模型是“中国第一”甚至“全球前三”,这种热闹景象背后,实则是各家精心挑选定语的结果。参数最大、单项基准领先、盲测榜夺冠……不同的定语下,每个“第一”似乎都站得住脚,却又难以形成统一认知,如同智能手机时代厂商们纷纷标榜“跑分第一”“拍照第一”,新能源汽车领域则充斥着“续航第一”“智驾第一”等说法。

与中国的热闹景象不同,美国大模型行业已形成相对公认的格局。不同阶段,OpenAI、Anthropic的Claude、Google的Gemini等轮流领跑。2026年年中,共识是Anthropic重新占据优势,其Claude Fable 5在Artificial Analysis智能指数上以约60分位居榜首,GPT - 5.6 Sol以约59分紧随其后。这一共识由第三方评测机构、开发者社区和真实使用数据共同塑造,无需依赖企业发布会。

中国未能形成类似共识,并非没有答案,而是被公关宣传的声浪掩盖。为探寻事实真相,我们主要借助三类权威第三方验证数据——Arena全球盲测、Artificial Analysis智能指数与SuperCLUE中文测评进行交叉分析。

Artificial Analysis(AA)是国际开发者社区广泛引用的独立评测机构,其智能指数综合数学、推理、代码、知识等多维度标准化测试,全球189款模型同台竞技,测试口径统一且不收取厂商费用,是目前最接近“客观”的第三方标尺。截至2026年8月初,中国主要模型成绩如下:月之暗面Kimi K3(Max)得57分,在189款模型中排第四,是开源权重模型历史最高排名,超越Claude Opus 4.8(约56分),仅次于Claude Fable 5(约60分)、GPT - 5.6 Sol(约59分)和谷歌一款旗舰;智谱GLM - 5.2(Max)得51分,排名十名开外;深度求索DeepSeek V4 Flash 0731得50分,与谷歌Gemini 3.6 Flash持平;阿里Qwen3.8 - Max暂无成绩,其上一代Qwen3.7 - Max验证成绩为56.6分。这表明中国最强模型已接近全球第一梯队,且“官方最强”与“验证最强”存在差异。

Arena(arena.ai)采用人类盲测机制,两个匿名模型回答同一问题,用户投票,数百万张投票换算成ELO积分,衡量的是“真人觉得谁更好用”。2026年8月第33周榜单显示,综合榜中Anthropic的Claude系列包揽前五,国产模型里Qwen3.8 - Max排第8(ELO 1491),Kimi K3 Max排第12(1489),是仅有的两家进入前十五的中国模型,二者分差仅2分,在误差范围内基本并列,但Qwen3.8 - Max位置更靠前。代码榜中,Kimi K3 Max排第6(1544分),是排名最高的国产代码模型,Qwen3.8 - Max排第13,小米Mimo排第25。前端开发榜上,Kimi K3 Max以1674分排第2,仅落后榜首的Claude Opus 5 Max(1692分)18分,Qwen3.8 - Max排第3(1667分),智谱GLM - 5.2 - Max排第9,DeepSeek V4 Pro新入榜即排第10,一个月前Kimi K3刚发布时曾以1679分短暂登顶该榜单。智能体榜中,Kimi K3 Max以10.60%的净提升度排第5,与Claude Opus系列同处全球第一梯队,Qwen3.8 Max新入榜排第11,GLM 5.2 Max排第14,DeepSeek V4 Flash排第19。综合来看,Kimi K3 Max覆盖面广、位置高,Qwen3.8 - Max综合榜位置高但在代码、智能体实战榜单上落后。

SuperCLUE是中文场景下极具公信力的第三方基准之一。2026年7月榜单上,12款国产主流模型综合总分排名为:Qwen3.8 - Max、Kimi - K3、豆包Doubao - Seed - 2.1 - Pro与DeepSeek - V4 - Flash,第一和第二分差小但顺序明确,Qwen3.8 - Max在中文综合能力上排第一,与Arena综合榜表现相互印证。值得注意的是,字节豆包2.1 - Pro在中文综合测评中排第三,是“五强”中唯一未参加Arena国际盲测的模型,能力在国内榜单可见,国际坐标系里缺失;DeepSeek排在第四,曾经的领跑者位置已被后来者取代。编程专项上,SuperCLUE给出不同答案,GLM - 5.2以64.13分断层领先,Kimi K2.7 - Code得55.43分,智谱是典型的“偏科生”,单项编程全球第一,综合能力却排不进国内前四。

2026年夏天,五家大模型在六周内密集发布前沿模型。6月中旬智谱GLM - 5.2发布,7月16日Kimi K3发布,7月19日Qwen3.8 - Max预览,7月27日Kimi K3开源,7月31日DeepSeek V4 Flash 0731发布,8月3日Qwen3.8 - Max正式版发布。此时出现三个事实:百万token上下文成旗舰标配,五家全部支持;2万亿参数级模型全部选择开源(MIT协议),这是中国公司对全球开源社区的贡献,也是对美国闭源路线的差异化竞争;同为旗舰,输出价格差50倍,Kimi K3输出定价100元/百万token,是DeepSeek V4 Flash的50倍,这是商业模式的选择,Kimi K3用高价格匹配强推理密度,DeepSeek用低价换取Agent高频调用市场。

综合三条证据链,2026年8月中国大模型五强格局逐渐清晰。月之暗面Kimi K3是验证维度上的中国第一,7月16日发布,7月27日开源,2.8万亿参数、104B激活,是人类历史上参数规模最大的开源模型,也是全球第一个原生支持文本、图像、音频、视频四模态的万亿级开源模型。其第三方成绩单完整,AA智能指数57分(开源史上最高、全球第4、超过Claude Opus 4.8),Arena前端第2、代码第6、智能体第5,SuperCLUE中文第二,第三方评测机构FireworksAI在1030个真实Agent任务上的实测显示,Kimi K3表现接近Claude Fable 5,成本约为其1/50,短板是价格高。阿里Qwen3.8 - Max是中文综合与生态上的第一,2.4万亿参数、95B激活,8月3日正式版发布,是SuperCLUE中文综合第一、Arena综合榜国产最高(第8),但国际验证成绩单空白,AA智能指数未评测,官方基准全部来自阿里自己,其真正护城河在于Qwen开源家族数年积累的全球下载量第一、衍生模型生态最厚。深度求索DeepSeek V4是推理与性价比之王,但已被反超,2025年初DeepSeek R1以极低训练成本逼近当时OpenAI顶级模型,引发硅谷震动,此后节奏变慢,2026年8月中旬一项对8款主流模型的独立横评(API实测)中,DeepSeek V4 Pro以9.1分排在所有国产模型之首,全场仅次于Claude Opus 4.8(9.20),推理单项9.5分超过GPT - 5.6,“识别条件不足、知道何时不该下结论”的能力被评为全场最强,SWE - bench Verified约80.6%是国产模型中可查证的最高标准化跑分,V4 Flash(284B/13B激活)把输出价格压到2元/百万token,约为Claude Opus的1%,是Agent高频调用场景的默认选项,但AA智能指数是50分,综合排名已被Kimi K3和Qwen3.8 - Max甩开。智谱GLM - 5.2是编程特长生,约744B参数,MIT开源,基于华为昇腾训练,在Code Arena、Design Arena两个国际编程盲测榜上拿过全球第1,SuperCLUE编程专项断层领先,但综合能力(AA 51分、Arena智能体第14)与第一梯队有明显差距,独立横评中推理任务表现曾翻车。字节豆包2.1 - Pro是用户规模第一,国际验证缺位,SuperCLUE中文综合第三,响应速度全场最快(首字延迟约380毫秒),背靠豆包App国内最大的AI用户盘子,字节内部正在推进五万亿参数超大模型的前期论证,但它缺席Arena国际盲测,AA指数也查无此模型。

中国大模型“人人第一”乱象的背后,是各家选择对自己最有利的坐标系。阿里说“盲测仅次于Claude”,用的是Arena综合榜;月之暗面说“全球最强开源”,用的是参数规模和AA指数;智谱说“全球第一”,用的是Code Arena;DeepSeek说“SWE - bench 80.6%”,用的是单一标准化基准;字节说“金牌、全球领先”,用的是竞赛成绩和自建基准。美国行业虽也存在营销,但被Artificial Analysis、Arena等成熟第三方评测机构以及开发者社区的舆论场压制。在中国,评测基础设施正在补齐,但公关宣传音量仍大于榜单音量。判断“第一”宣称时,可先问三个问题:这个第一是在哪个坐标系里?这个坐标系是谁定义的?同一坐标系里排第二第三的是谁?

中国第一与世界第一的差距目前是3分(AA指数57对60),但背后差距比看起来大。Kimi K3超过的是Claude Opus 4.8,面对的Claude Fable 5、GPT - 5.6 Sol等仍在快速迭代,Arena第33周榜单上综合榜前五名全部是Anthropic的模型,集中度体现差距。不过,中国模型从“落后一个身位”到“3分之差”只用了一年半,2025年初DeepSeek R1让全球正视中国模型,2026年年中Kimi K3成为全球前五中唯一的非美国模型且开源,在开源半场格局已反转,全球最强开源权重模型、下载量最大开源家族、生态最活跃开源社区都在中国。这场追赶背后,算力是重要变量,GLM - 5.2基于华为昇腾训练,是首个在国际榜单登顶的国产芯片训练模型,DeepSeek从V3开始以“单位算力产出最大化”为第一原则,Kimi K3和Qwen3.8 - Max的万亿级训练也完成于国产算力占比持续提升的集群之上,在美国对高端GPU出口收紧背景下,中国大模型进步是在算力约束下取得的效率创新产物。商业模式与生态差距也常被忽略,Anthropic与OpenAI的领先不仅是模型分数,还有终端产品形成的真实数据飞轮,中国模型在API与开源生态上进展快,但全球级别终端产品尚未出现,豆包用户盘子主要在国内,Kimi和Qwen海外用户以开发者为主。按当下第三方验证,中国最强大模型是Kimi K3;按中文综合与产业生态,是Qwen3.8 - Max,而三个月后答案可能改变,Qwen3.8 - Max的AA评测、DeepSeek的下一代、字节的五万亿参数模型与智谱的下一版模型都在路上,能被全球第三方榜单反复验证的名字才是当下真正的第一。

iQOO 16新机外观抢先看:方形Deco加大R角,未来科幻风辨识度拉满
IT之家 9 月 1 日消息,博主 @数码闲聊站 今日分享了 iQOO 16 新机的外观超前瞻: 全新方形 Deco+ 大 R角设计,三颗摄像头被串联起来,真机在 Deco 外框和底层纹理都有一些设计小巧…

2026-09-01

苹果本周大动作:iPhone发布会定档,Mac新品与Apple TV涨价齐登场
Apple TV(年费):每年119美元(原价99美元)AppleOne(个人):每月21.95美元(原价19.95美元)苹果还表示,Apple TV在巴西、智利和墨西哥同样进行了本轮涨价,但其他国家未受…

2026-09-01

小米18 Fold或成首款破万起售机型 玄戒芯片助力预订量超预期
【太平洋科技】据 36 氪独家消息,来自小米渠道经销商的信息显示,小米已经向全渠道头部经销商同步定价信息:小米 18 Fold所有版本售价均跨过万元门槛,起售版本预计在 12000 元上下,将成为小米历…

2026-09-01

2026 vivo开发者大会9月16日启幕,OriginOS 7携蓝河系统4惊艳亮相
IT之家 9 月 1 日消息,vivo 今日官宣,2026 vivo 开发者大会定档 9 月 16 日,蓝心智能战略全面升级,全新OriginOS 7 与自研蓝河操作系统 4 同步登场。 此外,Origin…

2026-09-01

AI代码狂潮来袭:OpenClaw断更7周,人类评审如何应对1.6万PR挑战
官方说,团队自己造这一版时,越来越多的活是丢给各自的Claw干的,然后就撞上一个问题:想把同事拉进来一起弄,Claw之前知道的那些上下文就没了。 另一个是OpenAI和Codex的模型名改了,你配置里写的旧…

2026-09-01

华为2026半年报出炉:营收稳步增长 研发投入突破1200亿创新高
2026年上半年,华为研发投入高达1213.82亿元,同比大幅增长25.2%,金额创下企业上半年研发投入历史新高,较2025年同期969.50亿元的研发投入,净增约244亿元,增幅远超营收增速。 作为对比,…

2026-09-01

荣耀Magic9系列三箭齐发:续航影像防抖全拉满,哪款能成年度真香机?
当然了,这个技术和青海湖电池技术离不开关系,要知道这项技术已经被荣耀手机用了好几代,且迭代多次,因此新机的期待值也是非常高。 这意味着它不仅仅是硬件堆料,更是在AI交互和手机形态上有所突破,结合前面提到的主…

2026-09-01

华硕海外推出新款Zenbook A14笔记本:骁龙X处理器加持,续航最长30小时
IT之家 8 月 31 日消息,华硕现已在海外市场推出新款 Zenbook A14(UX3480QA)笔记本。新品搭载高通骁龙 X 处理器,配备OLED 屏幕和 50Wh 电池,最长续航可达 30 小时。 …

2026-09-01

海信JUOS重磅发布:首个家庭智能伴侣级AIOS,开启家庭AI新体验
与其他个人AIOS不同在于,海信JUOS服务于家庭,也是行业首个围绕“一家人”的AIOS,其搭载自研星海大模型与四大原生引擎,以“超级小聚”为系统级AI载体,重新定义了家庭AI的交互逻辑。 全域行动闭环引擎…

2026-09-01