在最新发布的Arena平台大模型排行榜中,国产大模型展现出了强劲的竞争力,多个模型在细分领域实现突破性进展。其中,Kimi K3的表现尤为亮眼,不仅在综合榜单中首次跻身前十,更在前端开发领域登顶全球榜首,成为本期榜单的最大亮点。
综合榜单的竞争依旧激烈,Anthropic旗下的claude-fable-5以1507分的ELO分数蝉联冠军,其多款思考版本模型占据了前五名的位置,分差均在15分以内,形成第一梯队。国产模型Kimi K3以1486分的成绩首次进入前十,与第8名的gemini-3-pro和第10名的gpt-5.6-sol-xhigh分数相同,稳居全球第一梯队的边缘位置。
在代码能力榜单中,Anthropic的模型继续保持统治力,其claude-opus-4-7-thinking以1553分超越此前排名第一的claude-fable-5,两者仅相差2分。Kimi K3同样首次进入代码榜前十,以1529分的成绩位列第十,与第九名仅差1分,显示出接近第一梯队的实力。
前端开发榜单的格局因Kimi K3的加入而发生重大变化。该模型以1679分的高分强势登顶,领先第二名claude-fable-5达48分。在品牌与营销、基于参考的设计、数据与分析、消费产品、模拟、内容创建工具等六个细分领域,Kimi K3均排名第一,仅在游戏领域位列第二。另一国产模型glm-5.2 (max)以1587分排名第四,超越了多款国际旗舰模型,进一步巩固了国产大模型在该领域的领先地位。
智能体榜单本周全部由新入榜模型构成。Claude Fable 5 (High)以13.94%的净提升度和30.65%的最高好评/差评比位居榜首,工具幻觉率仅1.33%。GPT 5.6 Sol (xHigh)凭借17.26%的可控性数值排名第二。国产模型GLM 5.2 (Max)首次入榜即位列第九,净提升度为6.24%,其Bash恢复速度仅4.45,远优于头部平均水平,在命令出错后能快速恢复。
在AI生图与视频领域,国产模型同样占据重要席位。AI生图榜中,OpenAI的gpt-image-2 (medium)以1385分稳居第一,字节跳动的seedream-5.0-pro以1231分排名第十一,紧随多款海外头部模型之后。AI视频榜方面,谷歌的gemini-omni-flash位列榜首,字节跳动的dreamina-seedance-2.0-720p以1482分稳居第二,阿里的happyhorse-1.0排名第四,国产力量在视频生成领域已占据第一梯队的重要位置。
本期榜单显示,国产大模型正在从通用能力的追赶转向特定场景的领先。Kimi K3在综合、代码和前端开发榜单中的集体突破,以及字节跳动、阿里巴巴、智谱AI等厂商在多个细分领域的前半区站稳脚跟,标志着国产大模型的技术积累和工程化能力已达到国际先进水平。随着用户评测数据的持续积累,部分新入榜模型的排名和分数可能在下周出现小幅调整,国产模型在细分榜单中的表现值得持续关注。

