ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

马斯克携Grok 4.6强势出击 能否在AI领域跻身新“御三家”?

时间:2026-08-14 12:53:32来源:天脉网编辑:快讯

马斯克近期在社交平台异常活跃,先是大力宣传 Grok Bot,紧接着又聚焦 Grok 4.6。他毫不掩饰野心,目标直指行业榜首,而非仅仅是前三。距离 Grok 4.5 发布仅 35 天,他便迫不及待地预告 Grok 4.7 将超越当前所有模型,引发广泛关注。

在众多目光聚焦下,xAI 官方对 Grok 4.6 的定位十分明确,它要能够胜任研究话题、分析信息、跨代码库协作以及将想法转化为可运行应用等任务。这类任务涉及多轮推理、状态保持和工具协调,与真实工作场景高度契合,旨在解决复杂难题。

在 Artificial Analysis Intelligence Index 的评测中,Grok 4.6 取得 61 分的成绩,位列全球第三,仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分),与 GPT-5.6 Sol 并列,身后紧跟着 Kimi K3。与上一代 Grok 4.5 相比,它提升了 5 分;与一个多月前的 Grok 4.3 相比,更是大幅提升了 23 分。Artificial Analysis 评价称,xAI 借此重回前沿梯队,仅落后于 Anthropic。

在知识工作维度,Grok 4.6 表现突出,获得 1753 分,小幅领先 Claude Fable 5 的 1741 分和 GPT-5.6 Sol 的 1728 分,在同级竞品中位居榜首。这表明在长文档分析、跨领域问答、多步推理等复杂知识任务中,它的综合表现最佳。在法律与复杂专业推理方向,Harvey LAB 的数据显示,Grok 4.6 得分 15.8%,大幅领先 Fable 5 Max 的 11.3%,而 GPT-5.6 仅 2.5%,展现出对专业领域的深度理解和多步推导能力优势。

在多轮工具调用方面,τ³-Banking 模拟客服结合工具调用的真实业务场景中,Grok 4.6 以 50.7%的得分获得全场第二,仅次于 Qwen3.8 Max 的 51.3%。在长程知识工作场景的 AA-Briefcase Elo 评测中,它得分为 1577,处于 Fable 5 档位,落后于 Opus 5 系列。Cursor CEO Michael Truell 在发布第一时间给予肯定,称该模型在高难度任务和知识工作上明显更强,兼具 Opus 级智能和低成本高速度的优点。

有开发者利用 Grok 4.6 的工具链,完成了河流演变过程的五阶段动态演练,涵盖从早期原始生态河流到最终生态恢复阶段的各个时期。在整个多步骤任务中,模型展现出强大的长程状态保持与工具链调度能力,未出现上下文漂移或工具调用中断的情况。

SpaceX 今年早些时候以约 600 亿美元收购 Cursor 后,此次模型迭代中,Cursor 的数据价值首次系统性地注入训练流程。Grok 4.6 的 SFT 阶段使用了 Grok 4.5 重新生成的轨迹数据,覆盖 STEM、软件工程和知识工作等多个领域,并通过模型自检机制过滤问题训练样本。这意味着 Cursor 积累的海量真实开发者调试数据正式进入训练管线,效果显著。在 DeepSWE v1.1 评测中,考察模型在真实软件工程任务中的代码生成与调试能力,Grok 4.6 从 4.5 的 54%大幅提升至 65.9%,提升近 12 个百分点;APEX-Agents 评测中,测试多步骤 Agent 任务完成率,它从 47.1%升至 57.5%,提升了 10 个百分点。

@matt_palmer 使用 Grok 4.6 构建《办公室》游戏的二维代理模拟时,最直观的感受是速度快,吞吐量约为 80 tokens/秒,延迟低,他认为其速度可与 Cursor 的 Composer 模式相媲美。在需要高频迭代的 Agent 编程场景中,响应速度直接影响工作节奏,这一点尤为重要。

价格方面,Grok 4.6 的 API 定价为每百万 input token 2 美元、output 6 美元。当 prompt 进入 xAI 的长上下文档(20 万 token 起)时,价格翻倍至 4 美元/12 美元,且整单所有 token 均按高价计费。即便如此,短上下文的定价仍比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)低 60%以上。Artificial Analysis 的数据显示,Grok 4.6 每任务成本约为 0.84 美元,是目前综合能力与单任务成本比最优的模型。Reddit /r/cursor 版块有开发者表示,在日常高负荷开发中,使用 Grok 4.6 的 High Reasoning 模式做前期架构规划,再将任务下发给轻量级 Agent 完成,性价比极高。还有人直接从 Claude Opus 4.8 转换过来,原因是“对我的 use case 能完成同样的事,但省了快 70%的钱”。在高度依赖上下文缓存的 Agent 编程中,调用同等能力的 Claude Opus 每次请求成本约 0.052 美元,DeepSeek V4 Pro 约 0.000875 美元,Grok 4.6 介于两者之间,但在响应速度和综合智能上优势明显。有测试者分别用 Grok 4.6 和 Claude Opus 5 处理来自马斯克 TERAFAB 大型工厂的三个 3D 场景,两个模型都在第一次尝试时成功交付了可运行的代码,但成本差距显著,Grok 4.6 花费 0.38 美元,Claude Opus 5 花费 2.06 美元,同等输出质量下成本差了 5.4 倍,且 Grok 使用的 token 数量更少。

目前行业共识中,2025 年底的御三家是 OpenAI、Anthropic、Google。但从 Artificial Analysis 的总榜前排来看,格局已发生变化,Claude Opus 5 (63)、Claude Fable 5 (62)、Grok 4.6 (61)、GPT-5.6 Sol (61)、Kimi K3 (约 59.7) 排名靠前,Google 不在其中。自 2 月发布 Gemini 3.1 Pro 后,Google 未再发布前沿模型,旗舰 Gemini 3.5 Pro 落后计划数月,至今仅在合作伙伴内测,最近发布的也是 3.6 Flash、3.5 Flash-Lite 和一个安全垂类的 Flash Cyber。随着 DeepMind 的 CEO 离任、强化学习团队流失,SemiAnalysis 认为 DeepMind 已不再是前沿实验室,第三把椅子空出了一半。

然而,Grok 能否坐稳这一位置仍存疑问。提到 Grok,人们也会联想到极端言论、对马斯克的过度赞美以及图像生成被用于非自愿性化内容等问题。对于合规和责任 AI 要求严格的企业来说,这些问题不会因模型分数提升而消失。一个月前,Grok Build CLI 在本地初始化和每次任务执行时,会隐蔽地将用户整个本地项目仓库打包并传输至 SpaceXAI 的云端服务器,这一行为引发担忧。因此,Grok 4.6 发布后,也有人质疑它是否会偷偷打包带走用户代码库。不过,对于处于 Grok 4.6 和 DeepSeek V4 Pro 之间的其他模型来说,此刻或许压力巨大。

更多热门内容
三一汽车金融高层变动:刘洋任董事长 甘思雨兼任总经理与董事
中国网财经8月14日讯昨日,湖南金融监管局公布相关批复,核准刘洋三一汽车金融有限公司(简称“三一汽车金融”)董事长的任职资格。以下是相关批复正文: 同时,湖南金融监管局核准甘思雨三一汽车金融总经理的任职资格…

2026-08-14

中坚科技信披虚假记载被罚390万 三名高管“知假犯假”遭点名
根据浙江证监局的告知书,中坚科技的三名高管对上述违规行为负有直接责任,均涉嫌违反《证券法》第八十二条第三款的规定,且三人均"知悉案涉企业合作备忘录未完成签署"。 戴勇斌作为时任董事会秘书、副总经理,负责公司…

2026-08-14

Grok 4.6跻身大模型第一梯队,马斯克AI征程仍需跨越“奥德赛”挑战
但真正值得关注的,并不是Grok能不能在五个月里生成几千个镜头,而是它是否已经拥有把一项复杂任务从头做到尾的能力。 综合来看,Grok 4.6已经坐上美国大模型的第一桌,而且在OpenAI和Anthropic…

2026-08-14

库克即将卸任CEO,苹果秋季发布会新品曝光,折叠iPhone等亮点抢先看
来源:环球网 【环球网科技综合报道】8月14日 ,据外媒MacRumors报道,多方供应链消息汇总显示,苹果9月秋季发布会新品阵容逐步清晰,除iPhone18 Pro系列之外,首款折叠 iPhone、新一…

2026-08-14

马斯克2025年薪酬达员工250多万倍 特斯拉同期营收利润双降
该报告来自AFL-CIO的年度“高管薪酬观察”,统计了标普500指数成分公司CEO的薪酬情况,并追踪CEO薪酬与普通员工工资之间的平均差距。通常,这一差距在300:1左右,即CEO薪酬是普通员工的300倍,…

2026-08-14

旺旺董事长蔡衍明直面危机:反思过往怠惰 明确淘汰无贡献人员
蔡衍明在信中表示,因为2026财年第一季度中国旺旺业绩及利润表现未达预期,公司于7月26日傍晚在香港联交所网站公布了一份自愿性公告,就经营现况及未来展望做了一次说明。“集团现在要的是能有贡献、有功劳的旺旺人…

2026-08-14

华为“天才少年”宁博宇离职后:回村体验卖玉米,将赴瑞典深耕科研
宁博宇:有离职的念头后我就找主管聊过,主管给了我不少信心,我也一直在调整自己的心态,决定再适应一下。 我对自己的判断是:我在科研上确实有一些长处,我愿意钻研深层的东西,喜欢刨根问底,擅长把复杂的问题简化,这…

2026-08-14

华为“天才少年”宁博宇离职后发声:做普通人,体验多样人生剧本
宁博宇:我做的是面向未来几年的研究,独立性较强,时间久了工作就变得枯燥,成就感也会下降。宁博宇:有离职的念头后我就找主管聊过,主管给了我不少信心,我也一直在调整自己的心态,决定再适应一下。 我对自己的判断…

2026-08-14

华为“天才少年”宁博宇离职:告别百万年薪,奔赴新学术征程与多元人生体验
他在华为共计工作1137天,于2026年8月正式离开公司。在他看来,自己从事的技术洞察、公式推导、专利撰写类工作,未来有可能被AI替代,时常陷入焦虑,反复思考“如果以后公司不再需要我,我到时候怎么办?” 对…

2026-08-14

《牛来》“隐身式上映”9天票房惨淡 制作粗糙难获观众认可成反面案例
2026 年暑期档院线大片云集,各类国产佳作与海外 IP 轮番登场,而一部名为《牛来》的动画电影却以截然不同的姿态进入公众视野 —— 上映 9天累计票房仅 7169 元,总观影人次 236 人,创下年度院线…

2026-08-14