Grok 4.7 vs Claude Fable 5.1 徹底比較

grok-4-7-vs-claude-fable-5-1

Grok 4.7 と Claude Fable 5.1 は、非常にダイレクトな競合関係です。

Anthropic は Fable 5.1 について、要求の高い推論や長期ホライズンのエージェント業務向けのモデルだと説明しており、コーディング、マルチステップ調査、ドキュメント、スプレッドシート、プレゼンテーションでより強力な能力を備えています。

xAI は Grok 4.7 についても、非常に近い表現で説明しています。コーディング、エージェント的なタスク、より長時間にわたる作業、自動自己検証、そしてプロフェッショナルな知識業務です。

そのため「どちらのモデルがより印象的に聞こえるか」を比べるよりも、「どのような文脈で、どうコーディングし、どんな行動をするのか、ベンチマーク、そしてコストの違い」を比較するほうが実用的です。

まずは Grok の全仕様について、最初にこちらの Grok 4.7 レビュー をご覧ください。

Grok 4.7 vs Claude Fable 5.1 一目でわかる比較

Grok 4.7 Claude Fable 5.1
発売 2026年9月21日 2026年9月1日
コンテキストウィンドウ 500K 1M
最大出力 固定のテキスト出力上限なし 128K
知識のカットオフ 2026年5月 2026年6月
入力 テキスト、画像 テキスト、画像
推論 低〜XHigh アダプティブ・シンキング
開始入力価格 $2 / MTok $10 / MTok
開始出力価格 $6 / MTok $50 / MTok
主なポジショニング コーディング + 知識業務 長期ホライズン推論 + エージェント

Claude Fable 5.1 は 1M トークンのコンテキストウィンドウ、最大出力 128K、アダプティブ・シンキング、そして 2026年6月の信頼できる知識のカットオフを備えています。Grok 4.7 は 500K のコンテキストウィンドウで、推論の工数を Low から XHigh まで選択できます。

コーディング性能

コーディングは両モデルの中心です。

xAI の Grok 4.7 のリリースでは、両者を同じ表形式で比較するための最も分かりやすい例の1つが示されています。

ベンチマーク Grok 4.7 Fable 5.1
CursorBench 4.0 46.3% 51.8%
DeepSWE v1.1 71.0% 70.0%
AA Briefcase v1.1 1,657 1,678
Terminal-Bench 4.0 38.0% 57.9%
HealthBench Professional 56.7% 62.1%
EEBench 64.0% 56.4%

これらの数値は xAI の公開している評価セットアップに基づいています。このセットでは、タスクによってモデルの立ち位置が入れ替わり、どこでも一方が常にリードするわけではありません。

ここでのもう1つの重要な教訓は、ベンチマークの実装が効くということです。

OpenAI による Fable 5.1 の評価では Terminal-Bench 4.0 が 55.8%、DeepSWE v1.1 が 67.4% となっており、これは xAI の表にある値とわずかに異なります。そのため、小さなベンダー間のベンチマーク差は、慎重に解釈する必要があります。

長期に走るエージェント業務

Fable 5.1 は長期ホライズンのエージェント的タスクのために、明確に設計されています。

Anthropic は、長時間にわたるコーディングやマルチステップ調査、プロフェッショナルな成果物の作成がより強いと強調しています。アダプティブ・シンキングは常にオンですが、必要な工数は制御できます。

Grok 4.7 も長期にわたる作業を対象にしていますが、xAI は少し異なる改善を強調しています。難しいタスクにおけるより長い強化学習、より良い自己検証、改善されたコンテキスト管理、そして Grok Bot ハーネスのネイティブ理解です。

実運用では、反復的なツール呼び出し、修正、検証を含むタスクで、両者をテストする必要があります。単発のコーディング指示だけではありません。

コンテキストウィンドウ

Fable 5.1 は 100万トークン のコンテキストを提供します。

Grok 4.7 は 50万トークン を提供します。

この差は、非常に大規模なリポジトリ、研究論文のコレクション、長い法務ファイル、あるいはツール出力が大量に蓄積されるエージェントセッションなどでは重要になり得ます。

しかし、コンテキストウィンドウを2倍にしても、自動的に性能が2倍になるわけではありません。

長文コンテキストの品質は、モデルが適切な情報を取得できるか、依存関係に気づけるか、そしてワークフロー全体を通じて指示を維持できるかにも左右されます。

価格

ここで両モデルは大きく分かれます。

Grok 4.7 は以下から始まります:

$2 / 100万入力トークン$6 / 100万出力トークン

Claude Fable 5.1 は以下の費用です:

$10 / 100万入力トークン$50 / 100万出力トークン

Fable のキャッシュ読み取りは 1百万トークンあたり $0.25 とかなり安く、Anthropic は、大きなプロンプトを再利用したり、高度にエージェント的なセッションを実行したりするワークロードでは、コストを実質的に下げられる可能性があると述べています。

つまり、生のトークン単価だけでは全体は分かりません。

同じ大きなコンテキストを何度も使い回すなら、キャッシュの挙動が重要になります。多くの独立したリクエストを処理するなら、ベースとなる入力・出力のレートのほうがより重要になるかもしれません。

ドキュメントと知識業務

Fable 5.1 はプロフェッショナルな成果物への強いフォーカスがあります。

Anthropic は、ドキュメント、スプレッドシート、スライド、リサーチ、そしてコーディングを扱う作業を特に強調しています。

Grok 4.7 もドキュメントやプレゼンテーションの作成を改善しています。一方 xAI は、オフィス業務、法務タスク、ヘルスケアの推論、そしてエンジニアリングをカバーするプロフェッショナル・ベンチマークでの伸びを報告しています。

ソース中心の素材を扱うチームであれば、現実的なテストとしては、複数のドキュメントを読み込み、矛盾する証拠を特定し、レポートを下書きし、フィードバック後に修正し、最終的な主張を元のファイルと突き合わせて確認する、といった内容が考えられます。

まずはどちらをテストすべき?

選択肢を1つのベンチマークに絞るのではなく、ワークフローの要件で判断してください。

必要なこと 最も重要なのは
非常に大きい入力コンテキスト Fable 5.1 の 1M ウィンドウ
基本のトークン価格が低い Grok 4.7
長期ホライズンのエージェント 自分のタスクで両方をテスト
大きなプロンプトの使い回し キャッシュの経済性を比較
ターミナル中心のコーディング 実際のリポジトリとツールを比較
ドキュメントとプレゼンテーション 最終成果物の品質を評価
検索が多いワークフロー Grok の Web と X ツールを検討

実用上の違いは、ベンチマーク表が示唆するよりも大きくなったり小さくなったりします。

もし GPT-6 も評価対象に含めるなら、Grok 4.7 vs GPT-6 Astra をご覧ください。

最後に

Grok 4.7 と Claude Fable 5.1 は、多くの高価値な同種のタスクを対象にしていますが、異なるトレードオフを採用しています。

Fable 5.1 はコンテキストウィンドウが2倍であり、要求の高い長期ホライズンの推論とエージェント業務を中心に明確に設計されています。

Grok 4.7 は実質的にトークン価格がかなり低いところから始まり、選択可能な推論レベルと、xAI の検索、コード実行、そしてエージェントのエコシステムを組み合わせています。

したがって適切な比較は、「どのベンチマーク数値が大きいか?」ではありません。

それは、そのモデルがあなたのコーディング、調査、または知識業務を、正確に、安定して、そして納得できるコストで完了できるかどうかです。

もし Grok を直接テストしたいなら、こちらの Grok 4.7 の使い方 ガイドで、主要なアクセスオプションと設定を解説しています。