xAI、Anthropic、OpenAI、Moonshot AI 于 7 月发布 4 款前沿模型

Key Takeaways
  • xAI、Anthropic、OpenAI 和 Moonshot AI 将分别在 2026 年 7 月发布面向多小时任务完成的前沿 AI 模型。
  • Grok 4.5 的每百万 tokens 成本为 2 美元(输入)和 6 美元(输出),比 Claude Opus 4.8 和 GPT-5.5 低 60% 以上。
  • Moonshot AI 承诺在 7 月 27 日之前发布 Kimi K3 的全量公开权重;此前其在 7 月 16 日发布了 2.8 万亿参数的模型。

7 月 2026,xAI、Anthropic、OpenAI 和 Moonshot AI 在三周内发布了四款前沿 AI 模型。xAI 于 7 月 8 日推出 Grok 4.5,Anthropic 于 7 月 24 日发布 Claude Opus 5,OpenAI 于 7 月 9 日将 GPT-5.6 上线并转为一般可用,Moonshot AI 于 7 月 16 日发布 Kimi K3。每个模型都面向跨数小时的任务完成——从研究到编程到结构化报告——同时不会丢失执行计划。四款模型的上下文窗口均为 500,000 tokens 或更多,其中三款达到 100 万 tokens,使单次会话能够处理完整代码仓库或文档集合。

xAI 使用 Cursor 训练数据发布 Grok 4.5

xAI 于 7 月 8 日发布 Grok 4.5。该模型基于 1.5 万亿参数,并在部分方面使用了来自 Cursor 的真实用法数据进行训练——Cursor 是 SpaceXAI 在今年早些时候收购的编程平台。定价为每 100 万输入 tokens 2 美元、每 100 万输出 tokens 6 美元,拥有 500,000 tokens 的上下文窗口。Elon Musk 将 Grok 4.5 描述为一款“Opus 级”模型,运行更快且成本更低。独立追踪数据显示,它在 Artificial Analysis Intelligence Index 上排名第 4,位于每一个开源权重模型之前,价格比 Claude Opus 4.8 和 GPT-5.5 低超过 60%。在 Terminal-Bench 2.1 上——这项测试用于衡量模型完成命令行工程任务的表现——Grok 4.5 得分 83.3%。xAI 表示,该模型完成类似任务所需的输出 tokens 大约只有 Opus 4.8 的五分之一。

Elon X post screenshot.

OpenAI 以三档定价结构推出 GPT-5.6

OpenAI 在 7 月 9 日将 GPT-5.6 上线并转为一般可用,此前其经历了为期两周的预览,预览范围限制在约 20 家被美国政府审查核验的组织内。该举措是在与前沿模型安全审查相关的行政令之后进行的。该系列以三档形式发布:Sol 为旗舰(GPT-5.6 Sol),定价为每 100 万 tokens 输入 5 美元、输出 30 美元;Terra 为中档模型(GPT-5.6 Terra),定价分别为 2.50 美元和 15 美元,OpenAI 表示其以一半成本匹配 GPT-5.5;以及 Luna,为快速且低成本档(GPT-5.6 Luna),输入 1 美元、输出 6 美元。OpenAI 表示 Sol 领先 Artificial Analysis Coding Agent Index,并在 Terminal-Bench 2.1 上达到 88.8%,当模型在新的超强模式下并行运行四个子智能体时,该数值上升至 91.9%。三档产品均采用 OpenAI 最高的内部风险评级,用于评估网络与生物误用潜力。

OpenAI X post screenshot.

Anthropic 将 Claude Opus 5 定位为默认最大模型

Anthropic 于 7 月 24 日发布 Claude Opus 5,将其定位为一款性能接近 Claude Fable 5、且定价为 Fable 的一半(输入 5 美元、输出 25 美元)的模型。Opus 5 的定价与其前代 Opus 4.8 相同:输入 5 美元、输出 25 美元。该模型配备 100 万 token 上下文窗口、128,000 最大输出 tokens,以及可调节的推理努力程度设置,范围从 low 到新的 xhigh 模式。Anthropic 表示,Opus 5 在 Frontier-Bench 和 GDPval-AA 上创下新纪录——这两项分别是编码与知识工作评估——尽管在网络安全任务上仍落后于被限制访问的 Claude Mythos 5 模型。Opus 5 现已成为 Claude Max 上的默认模型,也是 Claude Pro 上的最强选项。

Claude X post screenshot.

Moonshot AI 发布 Kimi K3 作为最大开源权重模型

Moonshot AI 于 7 月 16 日发布 Kimi K3,这是一款拥有 896 个总专家、每个任务 16 个激活专家的 2.8 万亿参数混合专家模型。该模型配备 100 万 token 上下文窗口,并原生支持多模态输入,其 API 定价为每 100 万 tokens 输入 3 美元、输出 15 美元。Moonshot 已承诺在 7 月 27 日之前发布完整的开源权重。K3 是截至目前发布的最大开源权重模型,规模约比此前广泛使用的最大开源模型大 75%。独立追踪数据显示,K3 在当前前沿系统中排名第 4,仅次于 Claude Fable 5 与 GPT-5.6 Sol,但领先于 Claude Opus 4.8。

Kimi Moonshot X post screenshot.

扩展上下文窗口支持完整仓库处理

200,000 tokens 以下的上下文窗口曾迫使开发者将大型代码库或研究数据包拆成碎片。该组中的每个模型现在都能运行在 500,000 tokens 或更高的水平,其中四款中的三款达到 100 万,让单次会话即可容纳完整仓库或一组主要源文档。来自 2023 和 2024 年期间的系统常常在仅经过少量工具调用后就丢失计划。本月发布的模型旨在维持数十步的协同执行,并在工具调用返回错误数据时进行恢复,而不是卡住不前。Opus 5 的努力控制、GPT-5.6 的分层定价,以及 Grok 4.5 背后的效率宣称,共同指向同一目标:让团队选择一个任务应获得多少计算资源,而不是为每一次请求都支付旗舰级价格。GPT-5.6 受政府把关的发布节奏表明,对最大模型的监管现在已内置于发布计划之中。Anthropic 在 6 月对 Fable 和 Mythos 访问进行的简短且由政府主导的暂停,是该模式的更早版本。

常见问题

7 月 2026 发布的四款 AI 模型有何共同点?

Grok 4.5、Claude Opus 5、GPT-5.6 和 Kimi K3 都面向跨数小时的任务完成——从研究到编程到结构化报告——同时不会丢失执行计划。每个模型的上下文窗口至少为 500,000 tokens,其中三款达到 100 万 tokens,从而使单次会话无需碎片化即可处理完整代码仓库或文档集合。

OpenAI 为什么通过受政府把关的预览发布 GPT-5.6?

OpenAI 在 7 月 9 日将 GPT-5.6 上线并转为一般可用,此前其经历了为期两周的预览,预览范围限制在约 20 家被美国政府审查核验的组织内。该举措是在与前沿模型安全审查相关的行政令之后进行的。三档 GPT-5.6 均采用 OpenAI 最高的内部风险评级,用于评估网络与生物误用潜力,从而触发了额外审查。

Grok 4.5 的定价与 Claude Opus 4.8 相比如何?

Grok 4.5 的定价为每 100 万输入 tokens 2 美元、每 100 万输出 tokens 6 美元,较 Claude Opus 4.8 和 GPT-5.5 低于 60% 以上。xAI 表示,该模型完成类似任务时所需的输出 tokens 大约只有 Opus 4.8 的五分之一,这将降低运行长时间智能体会话的成本。

免责声明:本页面信息可能来自第三方,仅供参考,不代表 Gate 的观点或意见,亦不构成任何财务、投资或法律建议。数字资产交易风险较高,请勿仅依赖本页面信息作出决策。具体内容详见声明
评论
0/400
暂无评论