马斯克的 Grok 4.6 来了:智能体实测全球第一,价格直接腰斩

马斯克的 Grok 4.6 来了:智能体实测全球第一,价格直接腰斩

马斯克又出手了。8 月 12 日,SpaceXAI 正式发布新一代大模型 Grok 4.6,直接把矛头对准了”AI 干活能力”和”价格”两件事:在真实世界专业任务评测中登顶第一,API 定价却只有其他前沿模型的一半。消息一出,AI 圈讨论度瞬间拉满——毕竟”性能第一 + 价格腰斩”的组合,在旗舰模型里并不常见。

Grok 4.6 强在哪?

Grok 4.6 的核心升级方向是三项:长时间运行的智能体(Agent)、复杂编程、知识工作。简单说,它不只是”会聊天”的模型,而是更擅长”连续干活”——多步骤任务、调用工具、写代码改代码、持续推进复杂工作。这恰恰是当前 AI 应用落地最需要的方向:用户真正要的不是一个能聊天的模型,而是一个能把活儿干完的”AI 员工”。

在 Artificial Analysis 推出的 GDPVal-AA v2 评测中——这是一项面向真实世界专业知识工作的 AI 智能体评估——Grok 4.6 拿下 1753 Elo,排名第一,超过 Claude Fable 5 Max 的 1741 分和 GPT-5.6 Sol Max 的 1728 分。换句话说,在”AI 干活”这件事上,Grok 4.6 暂时站在了最前面。

价格:直接腰斩

Grok 4.6 的 API 定价为:输入 2 美元/百万 Token、输出 6 美元/百万 Token。SpaceXAI 在公告中将其定位为”其他前沿模型的一半价格”,主打高性价比。值得注意的是,这个价格甚至比不少二线模型还便宜,却能提供第一梯队的智能体能力——这对开发者来说吸引力巨大。

而且它已经在 Cursor 等开发者入口直接提供服务:Cursor 官方与 SpaceXAI 联合宣布了集成。用 Cursor 写代码的人,很快就能在自己的工作流里切换到 Grok 4.6,实测长任务编程场景的表现。

和 DeepSeek 的”撞车”是巧合吗?

几乎同一时间,DeepSeek V4 Pro 正式版也悄然上线。两款高性价比旗舰同日发力,都押注智能体与长任务场景——这背后是 AI 行业竞争逻辑的变化:能力差距在缩小,价格和”能不能干活”成了新的胜负手。

过去两年,前沿模型的竞争是”谁跑分最高”;而从这两天的发布看,叙事已经变成了”性能接近的同时,谁更便宜、谁更好接入”。对开发者来说,选择变多了,成本在下降,这当然是好事;对 OpenAI、Anthropic 等传统高价厂商而言,压力则实实在在——如果性能已经足够接近,为什么还要为更贵的模型支付数倍成本?

值得注意的边界

需要说明的是,Elo 榜单数据来自 SpaceXAI 官方公布,第三方复现结果有待观察;不同基准的侧重点不同,单项第一不代表全面领先。另外,具体 API 价格、可用区域、以及国内开发者如何访问,都要以官方页面为准,不建议仅凭海外定价做判断。

还有一个现实问题:目前头部模型能力的差距已经缩小到”定价梯度”的层面,选模型越来越像选手机——参数之外,还要看生态、接口、成本和稳定性。这既是好事(选择更多),也是挑战(决策更复杂)。

一句话总结

Grok 4.6 告诉我们:前沿模型的门槛正在被”性价比”拉下来。AI 工具越来越强、越来越便宜,普通人能用的东西越来越多——这才是最实在的利好。对做 AI 应用和副业的人来说,这是一个信号:可以开始认真考虑把工作流切到更便宜的第一梯队模型上了。

对开发者的实操建议

如果你正在做 Agent 应用或编程工具,Grok 4.6 值得认真测一轮:一是长任务场景,看它能不能稳定跑完多步骤流程;二是工具调用,看它对 Function Calling 的支持是否顺手;三是成本账,按”每百万 Token 输出 6 美元”算,同等工作量相比高价模型的成本差距有多大。测试的时候建议带上自己的真实业务场景,而不是只看榜单——榜单衡量的是平均水平,你的业务要的是”够用 + 稳定 + 便宜”。

还要提醒一点:模型发布初期,服务稳定性、限流策略、开发者工具链都可能快速迭代,正式大规模接入前,建议先在非关键流程上跑一两周,观察实际表现。

你会用 Grok 4.6 做什么?写代码、做智能体还是研究?评论区聊聊。

游客头像

龙主编

龙主编,AI智习室官方媒体主编。 专注 AI 行业观察与实操分享,擅长将复杂技术转化为通俗易懂的实战指南。 坚信 AI 不是取代人类,而是赋能每个人。 内容风格: 真实案例 + 详细干货 + 可操作性 使命: 让普通人也能抓住 AI 时代的红利。

发表评论