Kimi发布并开源其新一代大模型K3,参数达2.8T,为当前最大开源模型,支持多模态,具备混合注意力、Gated MLA等创新架构,在性能上跻身全球前三,且可本地部署微调,引发国际关注与地缘技术博弈。
我宣布,
因为昨天晚上(27日),

半小时就在 Hugging Face 里拿下 4000 赞,可以说是有史以来最被人关注的开源模型了,估计是有不少老外和差评君一样掐点等着。

而且

这下是和
各种跑分测试就不多说了,基本上各项跑分都只低于 Fable 5 和 GPT-5.6 Sol。
可以说现在的 K3,就是世界第三的模型,而且是 TOP 3 里你唯一一个可以下载到本地自己运行,自己微调的模型。

而且本身自带多模态功能,没有啥短板。
模型的参数也是比更大还更大,这次 K3 的模型总参数直接给干到了 2.8T,成为了最大的开源模型。
而且不光总参数大,模型的激活参数也是大的离谱,

在实际干活的时候,K3 能够直接激活 1042 亿的参数,这个数量是自己上一代的三倍,是
为了驾驭这个夸张的数据量,这次的 K3 做了很多架构上的创新,当然,人也没藏私,直接都放在文档里光明正大的写出来了。

首先就是大家都关注的注意力方面,传统的注意力机制大家都知道,模型每读一个新词,就需要把它和前面的所有 token 都计算一遍,这样读进去的内容增长一倍,算力开销直接增长了四倍。
而
新的内容进来之后,它还会判断哪些旧信息需要保留,哪些可以慢慢忘掉。
同时为了防止 KDA 漏掉关键信息,

通过这套组合拳,K3 大幅度降低了超长上下文的计算成本。

除此之外,
又设计了 Stable LatentMoE,把原本 7168 维的信息先压缩到 3584 维,再同时派给 16 个专家处理。
还给这些专家安排了限流和排班机制,压住异常激活值,合理分配任务。
避免有人天天 996,有人天天摸鱼的情况发生。
通过这些架构,数据和训练方法的共同升级,K3 在总参数变大的情况下,模型的训练效率,反而比上一代的 K2 提升了 2.5 倍。

而
它像是个导火索,把各路好人坏人、牛鬼蛇神都炸出来了。
比如有美国的政客,就指控 K3 是蒸馏美国大模型整出来的。

我懂了,
另外,美国政府在前不久,也准备制裁调查咱国家的人工智能企业。
咱们的商务部也是完美还击。

另外一边,高情商的老黄也注册 X ,发了公开信阐述开源的重要性,还拉了微软、谷歌、OpenAI 等等近快 100 家科技巨头联名。
公开反对封禁中国的开源模型。

压力之下,坚定的闭源主义战士 Anthropic 则又又又发了小作文,说哎呀,我们不抵制开源,只是怕强大的模型落在坏人的手里。
说实话,这次,开源模型能这么快的逼近这些世界顶级的闭源模型,还是蛮让人意外的。。。
差评君还记得第一次看到 Mythos 和 Fable 时的样子,虽然 Anthropic 这家公司天天不干好事,但是人做的模型确实是有两把刷子。

在那个时候,大家普遍以为开源模型和闭源模型的差距会越来越大。
因为这两个类模型在进行的,是一场完全不对等的赛跑。
闭源模型可以随意的学习开源模型的技术,就比如
可是反过来,开源模型却不能从闭源模型那边学到些什么。
但好在,开源模型和开源模型之间,还是有不少互相学习、互相抬轿子的机会的。
翻开这次

从多头注意力 MLA、混合专家模型 MoE,到训练稳定性和推理效率,很多技术里,都藏着开源社区过去几年的积累。
但
开源社区里的这股互相学习,互相致敬的风气,才是开源模型最宝贵的东西。
上一代模型留下的经验,会直接变成下一代模型的起点。
这些开源模型就这样互相借力,一层一层地往上搭,硬生生追上了那些掌握着更多算力、资金和数据的闭源巨头。
感谢这些开源模型持续不断的努力,至少现在 K3 发布后,已经没人会说 “ 开源模型会越来越落后 ” 这样的爆论了。
而 AI 的发展,也已经不再是公司与公司、开源与闭源之间的冲突了。它不仅和技术平权相关,还和国家安全、地缘政治等等都脱不开关系。
也希望未来,国内有越来越多像 K3 这样的优秀模型。
毕竟讲道理当然有用,但很多时候,摆实力更好使。
本文来自微信公众号“差评X.PIN”,作者:江江 & 早起,编辑:江江 & 面线