Claude Opus 5は、価格の半額でベンチマークにおいてFable 5を上回ります

BABA-1.64%
Key Takeaways
  • Anthropicは7月24日に、入力トークン100万あたり$5のClaude Opus 5をリリースした。Fable 5の半額。
  • Opus 5はFrontier-Bench v0.1で、Fable 5の33.7%およびGPT-5.6 Solの34.4%に対して43.3%を記録した。
  • Opus 5はClaude Maxのデフォルトとなり、運用上の混乱を受けてFable 5に代わった。

Anthropicは7月24日にClaude Opus 5をリリースしました。価格は入力トークン100万あたり$5で、先代モデルのClaude Fable 5の半額ですが、主要ベンチマークのほとんどでFable 5を上回っています。Opus 5はエージェントによるコーディング評価であるFrontier-Bench v0.1で43.3%を記録したのに対し、Fable 5は33.7%、OpenAIのGPT-5.6 Solは34.4%でした。新たな問題解決ベンチマークであるARC-AGI-3では、Opus 5は30.2%で、GPT-5.6 Solの7.8%を上回りました。新モデルはClaude Maxでデフォルトになり、Claude Proでも最も強力な選択肢となり、事実上、今年夏の初めにFable 5が運用上の混乱に見舞われた後、多くの有料サブスク向けの標準としてFable 5を置き換える形になりました。

Anthropicのラインナップは4つのティアで構成されています。Haikuは高速で安価、Sonnetは中間帯、Opusは本格的な主力作業担当、そしてこの春に導入されたMythosクラスには、一般向けとしてClaude Fable 5、Project Glasswingを通じて、審査済みのサイバーセキュリティ研究者および重要インフラ運用者向けにClaude Mythos 5が含まれます。

Claude Opus 5は主要ベンチマークでFable 5を上回る

AIコーディングエージェントが実際のソフトウェア開発タスクをエンドツーエンドで完了できるかをテストするFrontier-Bench v0.1では、Opus 5が43.3%を達成しました。Fable 5は33.7%、OpenAIのGPT-5.6 Solは34.4%でした。

最も差が大きかったのは、モデルが学習データから記憶しているはずのない新規パズルを中心に構成された問題解決テストであるARC-AGI-3です。Opus 5は30.2%で、GPT-5.6 Solは7.8%でした。Fable 5はまったくテストされていません。

知識労働ベンチマークであるGDPval-AA v2(実際のプロフェッショナル業務における相対的な性能を測るためにEloレーティングでスコア化)では、Opus 5は1,861を獲得しました。Fable 5は1,747、GPT-5.6 Solは1,736です。

法務および健康関連の評価においてのみ、Anthropicの公開ベンチマークによればFable 5がOpus 5をわずかに上回りました。

Anthropicは入力トークン100万あたり$5でOpus 5を提供

Opus 5はAPI経由で、入力トークン100万あたり$5、出力トークン100万あたり$25で利用可能です。デフォルト速度の約2.5倍で動くFastモードは、基準価格の2倍で提供されており、入力トークン100万あたり$10、出力トークン100万あたり$50です。

価格はOpus 4.8と一致しており、Anthropicが有料ユーザー向けの「日常的なフロンティア製品」として位置づけていたFable 5のコストのちょうど半分です。

Fable 5は輸出管理命令の影響でグローバルに停止

Fable 5は6月9日にリリースされましたが、米政府がジェイルブレイクの脆弱性を理由に緊急の輸出管理命令を出したため、その3日後にグローバルで回収され、6月30日に復帰しました。復帰後はすぐにクレジットのみのモデルに切り替わり、標準プランには含まれなくなりました。

Opus 5は、Fable 5が保持できなかったサブスクのフラッグシップ枠を埋める形になっています。

第三者プラットフォームがOpus 5の性能向上を裏付け

数百万人のユーザーを抱える開発者向けプラットフォームであるLovableは、社内評価でOpus 5を実行しました。Anthropicと共有された声明の中でFabian Hedinは、「最も難しいエージェントによるコーディングのタスクでは、Opus 4.7より22%も良いだけでなく、実行のばらつきが大幅に小さく、より安定しています」と述べました。

Zapierは、モデルが人の助けなしに開始から終了までの業務フロー全体を遂行できるかどうかを評価するAutomationBenchでOpus 5をテストしました。このモデルは「生のアカウント健全性ワークブックを使って、解約予防の一連の流れをエンドツーエンドで実行しました。リスクのあるアカウントをフラグ付けし、正しい担当者に通知し、リテンション運用向けに要約しました。従来のモデルでは合格しませんでしたが、Opus 5は100%でした」とされています。

DNAシーケンス企業のUltima Genomicsは、このモデルについて「これまでに私たちが使ったどのモデルよりも、注意深い科学者のように振る舞います。交絡要因を排除するために適切な統計テストを選び、独立した手法で自分の結果を相互確認し、長い多段階の分析を通して予定を維持します」と述べました。

このリリースは、北京拠点のスタートアップでAlibabaの支援を受けるMoonshot AIが、2.8兆パラメータのオープンウェイトモデルであるKimi K3を公開してから1週間後にあたります。MoonshotはKimi K3を「世界最大のオープンAIシステム」と説明していました。独立したベンチマークでは一貫してKimi K3が総合で3位に位置づけられ、Fable 5とGPT-5.6 Solの両方に次いだうえで、特定の領域ではこの2つを上回っていました。

よくある質問

Claude Opus 5はFable 5に比べて、どのベンチマークで上回りましたか?

Claude Opus 5は、Frontier-Bench v0.1で43.3%(Fable 5は33.7%)、ARC-AGI-3で30.2%(Fable 5は未テスト)、GDPval-AA v2で1,861(Fable 5は1,747)でした。Fable 5は法務および健康関連の評価においてのみ、わずかな差でOpus 5を上回りました。

Claude Opus 5はいくらで、Fable 5と比べてどうですか?

Claude Opus 5はAPI経由で入力トークン100万あたり$5、出力トークン100万あたり$25で、Fable 5の推定コストのちょうど半額です。Fastモードは入力トークン100万あたり$10、出力トークン100万あたり$50で利用可能です。

なぜClaude Fable 5はグローバルでの利用可能状態から外されたのですか?

Fable 5は6月9日にリリースされ、その3日後に米国政府がジェイルブレイクの脆弱性を理由に緊急の輸出管理命令を出したことで、グローバルで回収されました。6月30日に、クレジットのみのモデルとして復帰し、標準プランには含まれなくなりました。

免責事項:本ページの情報には第三者提供の内容が含まれる場合があり、参考目的のみで提供されています。これらはGateの見解や意見を示すものではなく、金融、投資、または法律上の助言を構成するものでもありません。暗号資産取引には高いリスクが伴います。意思決定を行う際には、本ページの情報のみに依存しないでください。詳細については、免責事項をご確認ください。
コメント
0/400
コメントなし