2026 / 08 / 23
今年会官网-SpaceXAI发布Grok 4.6:性能超越Kimi K3 并列全球第三

【CNMO科技动静】马斯克旗下的人工智能公司SpaceXAI日前发布了新一代前沿模子Grok 4.6,重点面向永劫间运行的智能体、编程及常识事情场景,并采用更具竞争力的订价计谋来降低这些事情负载的运行成本。

GrokGrok

于第三方评测机构Artificial Analysis的智能指数中,Grok 4.6患上分61,逾越月之暗面的开源模子Kimi K3,与OpenAI的GPT-5.6 Sol Max持平,比拟上一代Grok 4.5晋升5分。今朝榜单前两名别离由Anthropic的Claude Opus 5及Claude Fable 5盘踞,Grok 4.6与GPT-5.6 Sol Max并列全世界第三。

编程及智能体能力是Grok 4.6进级的重头戏。于DeepSWE v1.1基准测试中,其患上分从54%跃升至65.9%;APEX-Agents智能体基准从47.1%升至57.5%,晋升10.4个百分点,略超GPT-5.6 Sol Max的56.7%;Terminal-Bench v3.0也从15.7%晋升至26%。不外于后两项测试中,Claude Fable 5 Max仍连结领先,申明Grok 4.6虽然前进较着,但还没有实现对于竞争敌手的周全压抑。

订价方面,Grok 4.6的API起步价为每一百万输入token 2美元、每一百万输出token 6美元,处在前沿模子的中档价位,不到GPT-5.6 Sol尺度模式价格的一半。模子撑持50万token的上下文窗口,提醒词低在20万token时按上述价格计费,到达20万token后费率将上调。据SpaceXAI先容,Grok 4.6今日起已经于Grok Build中上线,并同步登岸其收购的AI编程公司Cursor,互助方还有包括OpenRouter、Vercel及Cloudflare等。

于练习层面,SpaceXAI暗示,比拟Grok 4.5,Grok 4.6举行了更永劫间的练习,并针对于通用编程、常识事情、内核优化、网页开发及计较机辅助设计等智能体情况强化了强化进修。测试中,Grok 4.6于长序列使命中揭示出更强的自我测试及验证能力。从成本效率看,Artificial Analysis数据显示,Grok 4.6完成AA-Briefcase事情负载平均仅需约53轮交互及5亿输入token,而Claude Opus 5 Max约为103轮及20亿token,前者的效率上风相称较着。

版权所有,未经许可不患上转载

-今年会官网