简介
2026年8月12日,xAI发布Grok 4.6,上下文窗口50万token,20万token以内定价为输入2美元、输出6美元,超过后价格翻倍,定位面向长时运行智能体与视觉工作。
2026年8月12日,xAI发布Grok 4.6,上下文窗口达50万token,并采用分段计价:20万token以内价格较低,超出之后翻倍。官方将其定位为面向长时运行智能体与交互式、视觉工作的前沿模型。同期Meta也在多模态侧连续出牌,从图像、视频一路走到可本地运行的开源模型。一个把上下文与运行时长做成可计价的商品,一个把模型压缩到能在本地跑起来,两条路线在同一时间窗口内并进。
一、事件速览
xAI于2026年8月12日推出Grok 4.6,采用按上下文长度分段的定价方式,并把长时运行智能体、交互式与视觉工作作为主攻方向。Meta的动作更早也更分散:7月7日推出Muse Image并在Meta AI中提供,同日预览Muse Video;7月9日,Meta Muse Spark 1.1通过Meta Model API公开预览;8月则开源了30B规模的本地智能体模型Muse Glimmer,可在消费级GPU上运行。一边是云端长上下文与长时运行,一边是本地轻量开源,两条路线在同期并行推进。对开发者来说,这意味着部署位置重新成为一个需要权衡的选项,而不必默认全部交给云端。
二、关键数据与技术细节
- Grok 4.6于2026年8月12日发布,上下文窗口为50万token。
- 20万token以内的定价为每百万token输入2美元、输出6美元、缓存输入0.50美元。
- 超过20万token之后,上述价格翻倍,长上下文按更高档位计费,成本需提前测算。
- 定位为面向长时运行智能体与交互式、视觉工作的前沿模型,任务可连续执行。
- Meta于7月7日推出Muse Image并在Meta AI中提供,同日预览Muse Video;7月9日Muse Spark 1.1通过Meta Model API公开预览,为第三方接入留出通道。
- 8月开源的Muse Glimmer为30B规模,可在消费级GPU上运行,适合本地与离线部署。
三、行业影响与解读
Grok 4.6的分段定价是个巧妙设计:常规请求维持低价,超长上下文则明显加价,把成本压力准确传导给真正消耗资源的一方,也让长上下文不再是宣传数字,而是明码标价的选项。对需要长时间自主运行的智能体来说,50万token的容量意味着一整段工作可以不被中途截断。Meta这边走的是另一条路,Muse Glimmer以30B规模开源并能在消费级GPU上运行,把智能体能力带到了本地与离线场景,隐私与成本控制由此有了新解法。行业观察给出的背景判断是,2026年多模态AI的核心变化在于生成行为从一次性输出进化为多步决策过程,前沿模型15秒视频的可用率已从约20%提升到90%左右,越过了进入生产流程的临界点。
四、值得关注的信号
- 按上下文长度分段计价会更常见,长上下文将回归其真实成本。
- 本地可运行的开源智能体模型会成为云服务的补充,尤其在隐私敏感场景。
- 视频生成的可用率跨过90%,意味着多模态内容可以进入批量生产流程。
- 生成从一次性输出转向多步决策,对过程可控性与中间态审核提出新要求。
小结:Grok 4.6与Meta Muse家族代表了2026年的两种取向:前者把长上下文与长时运行做成可计价的商品,后者把智能体能力压缩到能在本地跑的体量。对使用者而言,选择不再只是哪个模型更强,而是在云端能力、成本结构与数据边界之间做权衡,而这正是AI走向成熟产业的标志。
