虎科技
业界资讯 手机产品 数码产品 移动互联 软件产品 智能汽车 生活家电 关于我们 热点资讯

AI大模型“生死局”:性价比“毒圈”紧缩,“斩杀线”持续攀升

2026-08-05来源:快讯编辑:瑞雪

在人工智能大模型领域,一场激烈的竞争正以惊人的速度重塑行业格局。近日,DeepSeek发布的V4 Flash 0731成为焦点,这款新模型在Artificial Analysis的Intelligence Index评测中斩获50分,较上一版本提升10分。基于Intelligence Index v4.1的评测数据,若将各家模型绘制在散点图上,纵轴代表能力得分,横轴为每任务成本,V4 Flash 0731稳居左上角,形成一片“斩杀线”——区域内模型不仅成本更高,能力也明显逊色。

“斩杀线”这一概念源于电子游戏,如今在中英文AI圈广泛流传,成为大模型竞争白热化的标志。其核心逻辑在于:模型能力与成本的差距被智能体(Agent)的应用显著放大,导致市场分化加速。例如,Claude Opus 4.8(max)能力得分为56分,每任务成本1.78美元;而DeepSeek V4 Pro(max)仅得44分,成本却低至0.04美元。V4 Flash 0731以50分超越自家Pro版本,且与能力最接近的对手GPT-5.6 Luna(max)相比,在对方降价80%后,其每任务成本仍低约60%,凸显性价比优势。

智能体的崛起是这场竞争的关键变量。传统模型评测以单次对话或单轮任务为准,而智能体需连续执行多步骤、调用外部工具,并在出错后重试,最终交付完整任务结果。这一转变使得单次回答的准确性无法全面反映模型能力,而按token计价的成本模型也因任务复杂度提升而失效。美国国家标准与技术研究院下属的CAISI在2026年5月的评估中,对比DeepSeek V4 Pro与GPT-5.4 mini在7个基准上的表现,发现同一对模型的成本高低可能因任务不同而完全颠倒,进一步印证了“按任务评测”的必要性。

Intelligence Index v4.1的评测体系正是围绕任务设计:纵轴能力指数由9项评测加权构成,其中智能体任务占比34%,编程与科学推理各占24%,通用任务占18%;横轴每任务成本则综合输入、缓存、推理等五类token的计价,按权重加权得出。这种设计直接反映了智能体对模型能力与成本差距的放大效应。例如,在编码任务中,智能体的token消耗量是代码问答与推理的千倍,模型单价差距虽小,但最终支出可能相差数个数量级。Bai Longju等人在2026年4月的论文中分析,八个前沿模型在SWE-bench Verified上的执行轨迹显示,智能体任务的token消耗随步骤数增加而激增,进一步拉大了模型间的成本差距。

能力差距的放大同样显著。单轮问答中,模型准确率差异可能仅体现在个位数百分点;但在智能体任务中,二十步串联后,95%与90%的准确率对应的成功率分别为36%与12%,差距扩大至三倍。智能体的重试机制进一步加剧了这一效应——能力不足的模型需为失败任务重复支付成本,直接转化为额外支出。这种“双重放大”效应导致性价比落在斩杀线以内的模型迅速失去市场地位。

智能体的普及也引入了更多评测变数。例如,同一模型接入不同Agent框架时,任务执行效率可能差异显著。2026年7月,Reddit上的独立评测显示,DeepSeek V4 Flash在四个Agent框架中执行真实bug修复任务时,消耗的tokens与时间相差四倍。为统一标准,Artificial Analysis开源了测试框架Stirrup,所有模型的Intelligence Index跑分均在此框架内完成,但不同框架的差异仍提示:模型能力需在系统层级验证,单纯分数难以反映真实表现。

市场对性价比的敏感度极高。大模型切换成本低,API调用标准化,开发者可快速切换模型而不影响用户体验。与此同时,基础模型层的进步放缓,同质化竞争加剧,市场份额向性价比最优者集中。例如,2026年7月30日,OpenAI将GPT-5.6 Luna价格下调80%,次日DeepSeek即发布V4 Flash 0731,迫使竞争对手跟进降价。这种“毒圈”效应——即落后者被快速淘汰,幸存者需持续奔跑——使得价格战成为常态。OpenAI的算力投入从0.2吉瓦增至1.9吉瓦,收入增长10倍,但投入与产出几乎线性对应,未形成结构性优势,印证了这场竞赛的残酷性。

成本降低是唯一的喘息机会。2026年5月,DeepSeek将V4 Pro API价格降至原价的四分之一,创全球新低,其技术底气来自混合注意力架构与多token预测技术,使单token推理运算量降至前代的27%。国新证券研报指出,到2030年,大模型推理成本将较2025年降低超90%。路透社同年7月报道,DeepSeek正在研发专用于推理的自有芯片,OpenAI与Anthropic等头部厂商也已公布类似计划,通过技术迭代与硬件优化双管齐下,维持性价比优势。

在这场生死局中,“斩杀线”与“毒圈”的流行恰如其分地描述了行业现状:落后即出局,幸存者需不断突破。模型技术迭代与基础设施投入仍在推动“斩杀线”上移,而成本降低的耐力赛远未结束。大模型竞争已从技术比拼演变为综合实力的较量,唯有在能力、成本与执行效率上全面领先者,方能在这片开阔地上占据一席之地。

马斯克携手英伟达打造Starmind:太空AI大脑开启人类算力新纪元
这一次,马斯克要用铺天盖地的卫星矩阵,在地球的大气层之外,组建一个无限扩展、无限能源、绝对零度散热的「太空AI大脑」! 更厉害的是,SpaceX利用其在太空中运行飞行器的丰富经验,设计了面积高达160平方米…

2026-08-05

马斯克预言代码将成历史?AI直出二进制引行业教父激烈交锋
就在刚刚,马斯克在 X 上甩出一条暴论:代码正在变成下一个汇编,下一步是彻底摒弃它,让 AI 直接生成二进制! 而这正是 Douma 那个「半个世纪前的类比」最薄弱的地方:一个是翻译官,忠实、准确、零发挥;…

2026-08-05

小米Xiaomi-Robotics-1开源:高数据效率学习新任务,仿真测试达先进水平
据CNMO科技了解,Xiaomi-Robotics-1能够以高数据效率学习新任务。 结果表明,该模型在预训练期间随着数据量和模型规模的增加而平稳扩展,并且这种扩展行为直接转化为后训练阶段,即预训练模型越强,…

2026-08-05

于东来披露胖东来新规划:三年聚焦项目推进,2030年后暂停经营拓展
8月5日,胖东来创始人于东来在其社交平台发布胖东来未来三年要完成的计划,其中包括许昌梦之城项目、许昌物流二期三期项目、郑州东站超市项目等。 于东来表示,未来三年要专注完成计划,所以其他帮扶企业行为、行业会议暂…

2026-08-05

爱诗科技“山海叙事”内测,AI互动游戏赛道或迎新探索与挑战
爱诗科技创始人兼CEO王长虎拥有深厚的短视频视觉技术落地经验,曾任职字节跳动视觉技术负责人,全程参与抖音、TikTok等核心短视频产品从0到1的体系搭建与迭代升级,同时主导完成字节视觉大模型的从零建设,是短…

2026-08-05

南卡Wing深度评测:开放式耳机痛点终结者,佩戴音质智能全拿捏
对于开放式耳机,很多人心情复杂——理论上它保护听力、不耽误和人交流,是理想的通勤伴侣;但现实中踩过的坑却不少:戴久了夹耳朵、跑两步就担心掉、地铁上听歌旁边的人也跟着听。 小提醒:如果只是需要基础听音功能,南卡…

2026-08-05

开源大模型价格战来袭:技术狂飙下,人类社会面临未知链式反应?
而当价格战开打,大厂集团层面面临着难以调和的商业悖论:云计算当然希望DeepSeek、Kimi、智谱们过的越来越好,创业公司用量越大,采购需求就越强;但与此同时,大厂自研模型和模型产品部门,在 C 端和 …

2026-08-05

联想Googlebook 15渲染图亮相 谷歌新系统+高性能配置引期待
【太平洋科技】据 IT 之家报道,科技媒体 digitalcitizen 近日发布了一组联想 Googlebook 15笔记本外观渲染图,这款设备将预装谷歌正在研发的 Aluminium 系统。 外观设…

2026-08-04