xAI、Anthropic、OpenAI 和 Moonshot AI 於 2026 年 7 月的三週內發布四款前沿 AI 模型。xAI 於 7 月 8 日推出 Grok 4.5,Anthropic 於 7 月 24 日發布 Claude Opus 5,OpenAI 於 7 月 9 日將 GPT-5.6 推進到一般可用,而 Moonshot AI 於 7 月 16 日發布 Kimi K3。每個模型都瞄準可完成數小時任務的能力——從研究到程式碼撰寫到結構化報告——且不會失去執行計畫的追蹤。四款模型的上下文視窗皆達 500,000 tokens 或以上,其中三款達到 1 million tokens,讓單一會話即可處理完整程式碼儲存庫或文件集合。
xAI 釋出含 Cursor 訓練資料的 Grok 4.5
xAI 於 7 月 8 日發布 Grok 4.5。該模型以 1.5 兆(trillion)參數為基礎運作,並部分使用了來自 Cursor 的真實使用資料訓練;Cursor 是由 SpaceXAI 今年早些時候收購的程式碼平台。定價為每 100 萬(million)輸入 tokens 2 美元、每 100 萬輸出 tokens 6 美元,且上下文視窗為 500,000 tokens。Elon Musk 將 Grok 4.5 描述為一款「接近 Opus 等級」的模型,運行更快且成本更低。獨立追蹤者將其列為 Artificial Analysis Intelligence Index 第四名,且勝過所有開放權重模型;定價比 Claude Opus 4.8 與 GPT-5.5 低超過 60%。在 Terminal-Bench 2.1(一項評分模型完成指令列工程任務的測試)中,Grok 4.5 得分 83.3%。xAI 表示,該模型在可比任務上所需的輸出 tokens 約為 Opus 4.8 的五分之一。
![Elon X post screenshot.]()
OpenAI 以三階定價結構推出 GPT-5.6
OpenAI 於 7 月 9 日在為期兩週的預覽後,將 GPT-5.6 推進到一般可用;該次預覽限制於約 20 家獲美國政府審查核可的組織,且該作業是在一項與前沿模型安全審查相關的行政命令之後進行。該系列以三個等級供貨:Sol 為旗艦,定價為每 100 萬 tokens 的輸入 5 美元、輸出 30 美元;Terra 為中階模型,輸入為 2.50、輸出為 15。OpenAI 表示 Terra 的表現與 GPT-5.5 相當,但成本僅為其一半;以及 Luna 為快速、低成本等級,輸入為 1、輸出為 6。OpenAI 指出 Sol 在 Artificial Analysis Coding Agent Index 中位居第一,並在 Terminal-Bench 2.1 達到 88.8%;當模型以其新的超高速(ultra)模式同時並行執行四個子代理(sub-agents)時,該數字上升至 91.9%。三個等級都帶有 OpenAI 對於網路與生物濫用潛在風險的最高內部風險評級。
![OpenAI X post screenshot.]()
Anthropic 釋出作為預設最大模型的 Claude Opus 5
Anthropic 於 7 月 24 日發布 Claude Opus 5,並將其定位為一款能夠接近 Claude Fable 5 表現的模型;而 Fable 的輸入定價為 10 美元、輸出為 50 美元,Opus 5 的定價則是其一半。Opus 5 的定價與其前身 Opus 4.8 相同,輸入 5 美元、輸出 25 美元。該模型配備 1 million token 上下文視窗、128,000 最大輸出 tokens,並提供可調整的推理(reasoning effort)設定,範圍從低到全新的 xhigh 模式。Anthropic 表示 Opus 5 在 Frontier-Bench 與 GDPval-AA 兩項程式碼與知識工作評估上創下新紀錄,儘管它在網路安全任務上落後於受限制的 Claude Mythos 5 模型。Opus 5 現已成為 Claude Max 的預設模型,也是 Claude Pro 上最強的選項。
![Claude X post screenshot.]()
Moonshot AI 以最大開放權重模型身分發布 Kimi K3
Moonshot AI 於 7 月 16 日發布 Kimi K3;該模型是一款 2.8 兆(trillion)參數的混合專家(mixture of experts)模型,總計 896 位專家(experts),每個任務啟用 16 位。該模型配備 1 million token 上下文視窗,並原生支援多模態輸入;API 定價為每 100 萬 tokens 的輸入 3 美元、輸出 15 美元。Moonshot 已承諾在 7 月 27 日前發布完整開放權重。K3 是截至目前釋出的最大開放權重模型,規模約比先前廣泛使用的最大開放模型大 75%。獨立追蹤者將 K3 列為目前前沿系統中的第 4 名:落後於 Claude Fable 5 與 GPT-5.6 Sol,但領先於 Claude Opus 4.8。
![Kimi Moonshot X post screenshot.]()
延伸上下文視窗讓系統能處理完整儲存庫
先前在低於 200,000 tokens 的上下文視窗限制下,開發者常被迫將大型程式碼庫或研究封包拆成片段。本組中的每個模型現在都能在 500,000 tokens 或更高的設定下運作,其中四款中的三款可達 1 million,讓單一會話即可同時持有完整儲存庫或一疊主要來源文件。2023 與 2024 時期的系統常在經過少量工具呼叫(tool calls)後就會丟失計畫。這個月發布的模型旨在能夠維持數十個協調步驟,並在工具呼叫回傳錯誤資料時恢復,而不是卡住不動。Opus 5 的工作量控管、GPT-5.6 的階梯式定價,以及 Grok 4.5 背後的效率宣稱,指向相同目標:讓團隊可選擇一個任務究竟應投入多少運算(compute),而非為每一次請求都支付旗艦價格。GPT-5.6 由政府把關的推出(rollout)顯示:監管現在已被納入大型模型的發布時程安排。Anthropic 於 6 月對 Fable 與 Mythos 存取進行簡短、由政府主導的暫停,則是同一模式的先行版本。
常見問題
2026 年 7 月發布的四款 AI 模型有何共同點?
Grok 4.5、Claude Opus 5、GPT-5.6 與 Kimi K3 都瞄準可完成數小時任務的能力——從研究到程式碼撰寫到結構化報告——且不會失去執行計畫的追蹤。每個模型的上下文視窗皆至少為 500,000 tokens,其中三款達到 1 million tokens,讓單一會話可在不被切割的情況下處理完整程式碼儲存庫或文件集合。
為何 OpenAI 透過由政府把關的預覽發布 GPT-5.6?
OpenAI 於 7 月 9 日在為期兩週的預覽後將 GPT-5.6 推進到一般可用;該預覽限制於約 20 家獲美國政府審查核可的組織,並且是在一項與前沿模型安全審查相關的行政命令之後進行。三個 GPT-5.6 等級都具備 OpenAI 對於網路與生物濫用潛在風險的最高內部風險評級,這也是啟動額外審查的原因。
Grok 4.5 的定價如何與 Claude Opus 4.8 比較?
Grok 4.5 的定價為每 100 萬輸入 tokens 2 美元、每 100 萬輸出 tokens 6 美元,較 Claude Opus 4.8 與 GPT-5.5 低於 60% 以上。xAI 表示,該模型在可比任務上所需的輸出 tokens 約為 Opus 4.8 的五分之一,這降低了長時間代理(agent)會話的運行成本。