文章通过Artificial Analysis智能指数、Arena全球盲测和SuperCLUE中文测评三大权威第三方数据交叉验证,指出中国大模型当前呈双雄格局:月之暗面Kimi K3在国际验证维度领先(AA指数57分、全球第4),阿里Qwen3.8-Max在中文综合能力与开源生态上占优(SuperCLUE第一、Arena国产综合榜第8);其余模型如DeepSeek、GLM-5.2、豆包各有所长但未达第一梯队。
一个较为诚实的表述是,中国大模型的第一梯队是Kimi K3与Qwen3.8-Max组成的双雄格局。前者赢在国际验证,后者赢在中文综合与生态。
当前,中国大模型行业出现了一个奇观,几乎每一家头部公司,都声称自己的模型是“中国第一”甚至“全球前三”。
阿里说Qwen3.8-Max“第三方盲测仅次于Claude”;月之暗面说
这些说法都“对”,但都不完整。它们有一个共同特征,每个“第一”前面都有一个精心挑选的定语。参数最大是第一,某个单项基准是第一,某个盲测榜是第一,某个价格档是第一。定语不同,结论自然互不冲突。就像智能手机年代每家厂商都说自己“跑分第一、拍照第一、续航第一”,也像新能源汽车每家都说“续航第一、智驾第一、安全第一”。
大洋彼岸的情况不同。美国大模型行业存在一个相对公认的格局,某个阶段OpenAI领先,某个阶段Anthropic的Claude领先,Google的Gemini在中间穿插反超,2026年年中的共识是Anthropic重新领跑,Claude Fable 5在Artificial Analysis智能指数上以约60分排第一,GPT-5.6 Sol以约59分排第二。这个共识由第三方评测机构、开发者社区和真实使用数据共同投票形成,不需要看任何一家公司的发布会。
中国没有形成这种共识。不是因为没有答案,而是因为答案被公关宣传的声浪盖住了。这促使我们抛开所有公司自己的说法,主要采用三类最权威的第三方验证数据,Arena全球盲测、Artificial Analysis智能指数与SuperCLUE中文测评来进行交叉对照,看事实到底支持什么结论。
Artificial Analysis(AA)是国际开发者社区引用最多的独立评测机构,它的智能指数综合了数学、推理、代码、知识等多个维度的标准化测试,全球189款模型同台排名。它不收厂商的钱,测试口径统一,是目前最接近“客观”的第三方标尺。
截至2026年8月初,中国主要模型在AA智能指数上的成绩是:
月之暗面
智谱GLM-5.2(Max):51分,排在十名开外。
深度求索
阿里Qwen3.8-Max:暂无成绩。 截至目前,AA尚未完成对它的评测。其上一代Qwen3.7-Max的验证成绩是56.6分——这是该家族唯一的第三方参照。
这张表透露了两件事。第一,中国最强的模型已经摸到了全球第一梯队的门槛:
Arena(arena.ai)的机制是人类盲测,两个匿名模型回答同一个问题,用户投给更好的那个,数百万张投票换算成ELO积分。它衡量的不是“考多少分”,而是“真人觉得谁更好用”。2026年8月第33周(8月10日-16日)的榜单,国产模型的成绩如下。
在综合榜中,Anthropic的Claude系列包揽前五。国产模型中,Qwen3.8-Max排第8(ELO 1491),
在代码榜中,
前端开发榜,是国产模型表现最突出的一个榜单。
智能体榜中,
把四张榜单放在一起看,结论清晰。在Arena的体系里,
SuperCLUE是中文场景下最具公信力的第三方基准之一。2026年7月的榜单上,12款国产主流模型的综合总分排名是:Qwen3.8-Max、
第一和第二的分差很小,但顺序明确。在中文综合能力上,阿里的Qwen3.8-Max排第一。 这与它在Arena综合榜(第8,高于
值得注意的是第三、第四名。字节
编程专项上,SuperCLUE给出了另一个答案。GLM-5.2以64.13分断层领先,
在逐一画像之前,先把五家旗舰的硬规格放在一起,因为2026年夏天是这五家在六周内密集发布前沿模型的第一个夏天:6月中旬智谱GLM-5.2,7月16日
三个事实值得注意。第一,百万token上下文已经是旗舰标配,不再是差异点——五家全部支持。第二,2万亿参数级的模型全部选择开源(MIT协议),这是中国公司对全球开源社区的集体贡献,也是对美国闭源路线的差异化竞争。第三,同为旗舰,输出价格差了50倍——这个价差本身就是商业模式的选择:
把三条证据链交叉对照,2026年8月中国大模型五强的真实位置,可以这样描述。
月之暗面
阿里Qwen3.8-Max,中文综合与生态上的第一。2.4万亿参数、95B激活,8月3日正式版发布。它是SuperCLUE中文综合第一、Arena综合榜国产最高(第8)。但必须指出,它的国际验证成绩单目前是空白的。AA智能指数未评测,官方基准(电商模拟4.16倍回报、16天自主编程265次提交等)全部来自阿里自己。它真正的护城河在别处,Qwen开源家族数年积累的全球下载量第一、衍生模型生态最厚,这是其他四家都没有的资产。
深度求索
智谱GLM-5.2,编程特长生。约744B参数,MIT开源,基于华为昇腾训练,这在2026年的语境里有特殊的战略意义。它在Code Arena、Design Arena两个国际编程盲测榜上拿过全球第1,SuperCLUE编程专项断层领先。但综合能力(AA 51分、Arena智能体第14)与第一梯队有明显差距,独立横评中它的推理任务表现甚至出现过翻车。
字节
三条证据链摆完,可以正面回答“中国最强的大模型到底是谁”了。
如果以第三方验证的完整性和强度为标准,答案是月之暗面的
如果以中文综合能力为标准,答案是阿里的Qwen3.8-Max。SuperCLUE总分第一,Arena综合榜国产最高。它在中文语境下的综合表现目前没有对手,加上Qwen家族全球第一的开源生态,它是产业渗透角度的隐形第一。但需要保留一个判断,它的国际标准化成绩单还空着,官方“仅次于Claude Fable 5”的说法目前属于“厂商主张”,等待第三方验证。
所以最诚实的表述是,中国大模型的第一梯队是一个双雄格局,
这像极了2026年全球格局的中国版,美国是Anthropic与OpenAI的双雄(60分与59分),中国是月之暗面与阿里的双雄(57分与待验证)。真正的差距在第三名之后,美国的第三名谷歌与国际前二的差距远小于中国第三名与前二的差距。
对普通使用者而言,这个结论可以再翻译得直白一些。按场景选,比按“谁最强”选更接近最优解。写代码、做前端、跑Agent,
回到开头的问题:为什么中国会出现“每家都第一”的乱象?拆开看,每家的说法在技术上都不算撒谎,它们只是选择了对自己最有利的坐标系。
阿里说“盲测仅次于Claude”,用的是Arena综合榜(第8,前面的7个里有5个是Anthropic和谷歌的模型,国产中确实是最高的);月之暗面说“全球最强开源”——用的是参数规模和AA指数(在开源这个类目里确实第一);智谱说“全球第一”,用的是Code Arena(编程单项确实第一过);
这套话术的完整公式是,换一个坐标系,就换出一个第一。坐标系可以按能力维度切(推理、代码、写作、多模态),按语言切(中文、英文),按规模切(开源、闭源、万亿级、百亿级激活),按价格切(同价位最强),甚至按硬件切(国产芯片训练的最强)。切法是无穷的,第一也是无穷的。
美国行业也存在营销,但压制营销的是两股力量。一是Artificial Analysis、Arena这类成熟第三方评测机构的存在,它们的榜单被投资人和企业采购方当作决策依据,厂商绕不过去;二是开发者社区的舆论场,一个模型发布后几小时内就会在开源社区和社交媒体上被真实任务检验,名不副实的宣称存活不了48小时。中国的评测基础设施(SuperCLUE、OpenCompass等)正在补齐,但公关宣传的音量仍然大于榜单的音量。
一个可以参考的判断习惯是,看任何一个“第一”的宣称,先问三个问题。这个第一是在哪个坐标系里?这个坐标系是谁定义的?同一坐标系里排第二第三的是谁?三个问题问完,大部分“第一”会自动现出原形。
最后说一个容易被发布会掩盖的事实,中国第一与世界第一的差距,目前是3分(AA指数57对60),但这个数字背后的差距比看起来大。
但另一面同样成立,中国模型从“落后一个身位”到“3分之差”,只用了一年半。2025年初
这场追赶背后还有一个不太出现在排行榜上、但决定长跑胜负的变量:算力。GLM-5.2基于华为昇腾训练,是首个在国际榜单登顶的国产芯片训练模型;DeepSeek的架构设计从V3开始就以“单位算力产出最大化”为第一原则,用稀疏激活和算法优化把成本压到同行难以理解的水平;Kimi K3和Qwen3.8-Max的万亿级训练同样完成于国产算力占比持续提升的集群之上。在美国对高端GPU出口持续收紧的背景下,中国大模型的这轮进步是在算力约束下取得的,这意味着它不是靠堆资源堆出来的峰值,而是效率创新的产物。效率优势的缺点是天花板可能更低,优点是可持续、可复制。
还有一个维度的差距常被忽略,商业模式与生态。Anthropic与OpenAI的领先不只是模型分数,还有Claude Code、ChatGPT这类被全球开发者每天高强度使用的终端产品形成的真实数据飞轮。中国模型在API与开源生态上进展极快,但全球级别的终端产品还没有出现,豆包的用户盘子主要在国内,Kimi和Qwen的海外用户仍以开发者为主。分数可以三个月追平,产品与生态的差距需要更长时间。
所以“中国最强的大模型是谁”这个问题的完整答案,还应该加上一层时间维度。按当下的第三方验证,是Kimi K3;按中文综合与产业生态,是Qwen3.8-Max;而三个月后这个答案可能就要重写,Qwen3.8-Max的AA评测、DeepSeek的下一代、字节的五万亿参数模型与智谱的下一版模型,都在路上。
这不是和稀泥。模型行业的一个基本事实是,领先窗口以月计算。2025年初是DeepSeek R1的时刻,2026年年中属于Kimi K3和Qwen3.8-Max。真正不变的结论只有一条,能被全球第三方榜单反复验证的那个名字,才是当下真正的第一。到今天为止,这个名字是Kimi K3。下一个是谁,让榜单说话,而非听各个大模型厂自说自话。
本文来自微信公众号“砺石商业评论”(ID:libusiness),作者:陈凯,编辑:平凡