Grok 4.6由马斯克团队推出,在AI性能上追平GPT-5.6 Sol Max等顶级模型,智能体工作能力显著提升,价格大幅降低(输入成本低80%、输出低88%),效率更高、任务成本仅0.84美元,成为当前综合能力与性价比最优的大模型。
最近,AI 圈确实够热闹的。
阿里开源了 Qwen3.8-2.4T-A95B,

测评博主们连轴转,社交媒体上刷屏的跑分图表看得人眼花。
但一圈看下来,最让人挪不开眼的确实是 Grok 4.6。毕竟三个月前它还在榜单第 17 名晃悠,这回直接冲到了第一梯队。

那 Grok 4.6 到底有多猛?
先看硬指标:Artificial Analysis 的智能指数 AAII 上,Grok 4.6 拿到了 61 分,跟OpenAI 的 GPT-5.6 Sol Max 平起平坐。
上一代 Grok 4.5 是 56 分,一个月涨了 5 分,而 Claude Fable 5 Max 也就62分。

简单说,Grok 从“追赶者”变成了“并驾齐驱者”,这个翻身仗打得确实漂亮。
马斯克当然不会放过这个嘚瑟的机会,模型上线两小时内,他在 X 上转了大概 10 条夸新模型的帖子。

老马还是那个老马,但这次他确实有底气这么喊。
不过真正让我觉得有意思的,不是跑分追平,而是 Grok 4.6 在“做事”层面的变化。
以前的 AI 大模型,你问一句它答一句,像个知识渊博但不太会来事儿的学霸,但 Grok 4.6 不一样。

给它一个模糊的产品想法,比如“帮我做个 App ”,它能自己研究陌生领域、设计架构、写代码、跑测试、发现问题、改代码,最后给你一个能跑的第一版。
整个过程不需要你每一步都下指令,SpaceXAI 管这叫“长时间运行的 AI 智能体”,通俗讲就是它学会了自己跟自己玩,而且能玩很久, 不怎么需要你再来回切换模型或进行人工干预。
在智能体知识工作测试 GDPVal-AA v2 里,Grok 4.6 拿了 1753 分,超过了 Claude Fable 5 的 1741 和 GPT-5.6 Sol 的 1728。

法律领域的 Harvey LAB 测试更夸张,15.8% 直接碾压 GPT-5.6 Sol 的 2.5%。
不过在软件工程 DeepSWE 测试里它只有 65.9%,落后于 GPT-5.6 Sol 的73%;终端操作 Terminal-Bench 只有 26%,而对手都在 34% 左右。

说明写代码干活它很在行,但操作终端这种活儿还得再练练。
那马斯克是怎么在三个月里把 Grok 从第 17 名拉到这个位置的?答案是没换底座,只磨后训练。
Grok 4.6 沿用了 4.5 的 1.5 万亿参数底座,所有提升都来自更长的补充训练、更精细的监督微调数据,以及在编程、知识工作、内核优化、网页开发、CAD 设计等领域的强化学习。
这就好比还是同一副身体,脑子练得更聪明了。

巧合的是,同一天发布的
价格方面,Grok 4.6 走的是加量不加价路线。
API 定价每百万输入 Token 两美元、输出六美元,而 GPT-5.6 Sol 是五美元输入、三十美元输出,Claude Opus 5 是五美元输入、二十五美元输出。

相比之下,Grok 便宜了六成以上。有投资人算过账,性能大致相当于 Fable 5 Max,但输入 Token 价格低 80%、输出 Token 价格低 88%。

更狠的是效率,Artificial Analysis 数据显示,Grok 4.6 完成一个长任务平均只要 53 轮交互和 5 亿输入 Token,而 Claude Opus 5 Max 要 103 轮和 20 亿Token。
省了一半多的步骤,四分之三的 Token 消耗。

每任务成本算下来只要 0.84 美元,跟
所以 Artificial Analysis 直接说,Grok 4.6 是目前综合能力与每任务成本的最优模型。

性能追平顶流、价格只有一半、干活还更快,这套组合拳打下来,难怪 SpaceX 股价当天涨了 9%。
目前 Grok 4.6 已经在 Cursor 和 Grok Build 上线,首周提供双倍使用额度。
API 也开放了,合作伙伴包括 OpenRouter、Vercel 和 Cloudflare。上下文窗口 50 万 Token,支持图文多模态输入,推理强度四档可调。
有意思的是,有不少人都把这次飞跃跟 SpaceX 收购 Cursor 联系起来。

今年 6 月 SpaceX 以 600 亿美元全股票交易收购了 Cursor,马斯克自己承认过 AI 业务在编程领域有差距,所以推动了人员调整。
据说 Grok 4.5 训练时引入了数万亿 Token 的 Cursor 真实开发数据,不得不感慨:有钱确实能为所欲为。
话说回来,如今 AI 圈迭代速度已经到了令人麻木的地步,今天你发一个追平,明天他发一个反超,跑分榜隔三差五就要重排。
对大多数普通用户来说,这些数字游戏其实没那么重要。
真正有意义的就两件事:第一,用同样甚至更少的钱,能不能拿到更好的结果;第二,这个工具能不能帮我搞定以前搞不定的事情。
Grok 4.6 在这两点上确实往前迈了一大步,性能不掉队,价格砍一半,还能自己跑完一整个任务,这才是实实在在感受到的进步。
不过,马斯克显然不打算就此停下参数竞赛的脚步,他已经预告 Grok 4.7 过不了多久就会上线,届时将换上 2.1 万亿参数的新底座。

他放话说“若有任何模型表现比 4.7 更出色,我会感到非常震惊”。这 flag 立得够高,能不能兑现,模型上线后见分晓。
本文来自微信公众号 “科技狐”(ID:kejihutv),作者:狐妹