又一次旗舰换代之后,SpaceXAI把卖点从「聊天分数」拧向「能不能在长任务里自己查、自己改、自己验」。
SpaceXAI由原xAI体系演变而来,在SpaceX收购相关交易后以新品牌运营Grok模型家族。消费侧Grok以对话与生成见长;开发者侧则通过API、Grok Build(面向编程Agent的产品形态)以及Cursor等编辑器分发争夺「写代码、跑工具、改仓库」的默认模型位。所谓长时运行Agent,白话就是任务跨越多轮工具调用与自检,而不是一问一答结束。
8月12日发布的Grok 4.6被定位为面向长时Agent、编程与知识工作,同日可在Grok Build、Cursor及API使用,并与OpenRouter、Vercel、Cloudflare等分发伙伴对接。第三方Artificial Analysis Intelligence Index口径给出约61分,较Grok 4.5 High提升约5分,并与OpenAI GPT-5.6 Sol等处于同一竞争带;公司自测表显示CursorBench、DeepSWE、APEX-Agents等多项指标相对上一代明显抬升,但Terminal-Bench等仍落后部分对手。训练叙事强调更长的补充训练、用上一代模型再生轨迹,以及面向编程、知识工作与CAD等环境的强化学习。
定价与分发上可核验的要点:
把Grok 4.6放进企业Agent采购坐标:比的不只是领袖榜,而是完成同一工单的回合数与Token总账。第三方测试曾给出任务成本与回合效率的对照口径,但生产环境仍取决于编排、缓存与重试策略。同时,Grok品牌过往的内容安全与治理争议,会成为金融、政务与消费品牌采购中的独立评估项——技术分数与品牌风险不在同一张表上,却会一起进投标文件。
需要把边界读清楚。榜单与自测并非完全受控的四方同台评测;历史争议针对的是既往部署与平台治理,不能直接等同于断言新权重必然复现特定事故,但也无法从采购清单里抹掉。下一观察点是长时Agent在真实仓库与工单场景中的失败恢复率,以及企业是否愿意在合规审查后把它写进默认路由。