1. 主页 > 社会焦点

SpaceXAI发布Grok 4.6:性能超越Kimi K3 并列全球第三

[CNMO科技消息]马斯克旗下的人工智能公司SpaceXAI日前发布了新一代前沿模型Grok4.6,重点面向长时间运行的智能体、编程和知识工作场景,并采用更具竞争力的定价策略来降低这些工作负载的运行成本。

Grok

在第三方评测机构ArtificialAnalysis的智能指数中,Grok4.6得分61,超越月之暗面的开源模型KimiK3,与OpenAI的GPT-5.6SolMax持平,相比上一代Grok4.5提升5分。目前榜单前两名分别由Anthropic的ClaudeOpus5和ClaudeFable5占据,Grok4.6与GPT-5.6SolMax并列全球第三。

编程和智能体能力是Grok4.6升级的重头戏。在DeepSWEv1.1基准测试中,其得分从54%跃升至65.9%;APEX-Agents智能体基准从47.1%升至57.5%,提升10.4个百分点,略超GPT-5.6SolMax的56.7%;Terminal-Benchv3.0也从15.7%提升至26%。不过在后两项测试中,ClaudeFable5Max仍保持领先,说明Grok4.6虽然进步明显,但尚未实现对竞争对手的全面压制。

定价方面,Grok4.6的API起步价为每百万输入token2美元、每百万输出token6美元,处于前沿模型的中档价位,不到GPT-5.6Sol标准模式价格的一半。模型支持50万token的上下文窗口,提示词低于20万token时按上述价格计费,达到20万token后费率将上调。据SpaceXAI介绍,Grok4.6今日起已在GrokBuild中上线,并同步登陆其收购的AI编程公司Cursor,合作方还包括OpenRouter、Vercel和Cloudflare等。

在训练层面,SpaceXAI表示,相比Grok4.5,Grok4.6进行了更长时间的训练,并针对通用编程、知识工作、内核优化、网页开发和计算机辅助设计等智能体环境强化了强化学习。测试中,Grok4.6在长序列任务中展现出更强的自我测试和验证能力。从成本效率看,ArtificialAnalysis数据显示,Grok4.6完成AA-Briefcase工作负载平均仅需约53轮交互和5亿输入token,而ClaudeOpus5Max约为103轮和20亿token,前者的效率优势相当明显。

本文内容由互联网用户自发贡献,该文观点仅代表作者本人。如发现本站有涉嫌抄袭侵权/违法违规的内容,请发送邮件至 203304862@qq.com

本文链接:https://www.jinnalai.com/jiaodian/848956.html

联系我们

在线咨询:点击这里给我发消息

微信号:

工作日:9:30-18:30,节假日休息