Grok 4.7 と Claude Fable 5.1 は、非常にダイレクトな競合関係です。
Anthropic は Fable 5.1 について、要求の高い推論や長期ホライズンのエージェント業務向けのモデルだと説明しており、コーディング、マルチステップ調査、ドキュメント、スプレッドシート、プレゼンテーションでより強力な能力を備えています。
xAI は Grok 4.7 についても、非常に近い表現で説明しています。コーディング、エージェント的なタスク、より長時間にわたる作業、自動自己検証、そしてプロフェッショナルな知識業務です。
そのため「どちらのモデルがより印象的に聞こえるか」を比べるよりも、「どのような文脈で、どうコーディングし、どんな行動をするのか、ベンチマーク、そしてコストの違い」を比較するほうが実用的です。
まずは Grok の全仕様について、最初にこちらの Grok 4.7 レビュー をご覧ください。
Grok 4.7 vs Claude Fable 5.1 一目でわかる比較
| Grok 4.7 | Claude Fable 5.1 | |
|---|---|---|
| 発売 | 2026年9月21日 | 2026年9月1日 |
| コンテキストウィンドウ | 500K | 1M |
| 最大出力 | 固定のテキスト出力上限なし | 128K |
| 知識のカットオフ | 2026年5月 | 2026年6月 |
| 入力 | テキスト、画像 | テキスト、画像 |
| 推論 | 低〜XHigh | アダプティブ・シンキング |
| 開始入力価格 | $2 / MTok | $10 / MTok |
| 開始出力価格 | $6 / MTok | $50 / MTok |
| 主なポジショニング | コーディング + 知識業務 | 長期ホライズン推論 + エージェント |
Claude Fable 5.1 は 1M トークンのコンテキストウィンドウ、最大出力 128K、アダプティブ・シンキング、そして 2026年6月の信頼できる知識のカットオフを備えています。Grok 4.7 は 500K のコンテキストウィンドウで、推論の工数を Low から XHigh まで選択できます。
コーディング性能
コーディングは両モデルの中心です。
xAI の Grok 4.7 のリリースでは、両者を同じ表形式で比較するための最も分かりやすい例の1つが示されています。
| ベンチマーク | Grok 4.7 | Fable 5.1 |
|---|---|---|
| CursorBench 4.0 | 46.3% | 51.8% |
| DeepSWE v1.1 | 71.0% | 70.0% |
| AA Briefcase v1.1 | 1,657 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 57.9% |
| HealthBench Professional | 56.7% | 62.1% |
| EEBench | 64.0% | 56.4% |
これらの数値は xAI の公開している評価セットアップに基づいています。このセットでは、タスクによってモデルの立ち位置が入れ替わり、どこでも一方が常にリードするわけではありません。
ここでのもう1つの重要な教訓は、ベンチマークの実装が効くということです。
OpenAI による Fable 5.1 の評価では Terminal-Bench 4.0 が 55.8%、DeepSWE v1.1 が 67.4% となっており、これは xAI の表にある値とわずかに異なります。そのため、小さなベンダー間のベンチマーク差は、慎重に解釈する必要があります。
長期に走るエージェント業務
Fable 5.1 は長期ホライズンのエージェント的タスクのために、明確に設計されています。
Anthropic は、長時間にわたるコーディングやマルチステップ調査、プロフェッショナルな成果物の作成がより強いと強調しています。アダプティブ・シンキングは常にオンですが、必要な工数は制御できます。
Grok 4.7 も長期にわたる作業を対象にしていますが、xAI は少し異なる改善を強調しています。難しいタスクにおけるより長い強化学習、より良い自己検証、改善されたコンテキスト管理、そして Grok Bot ハーネスのネイティブ理解です。
実運用では、反復的なツール呼び出し、修正、検証を含むタスクで、両者をテストする必要があります。単発のコーディング指示だけではありません。
コンテキストウィンドウ
Fable 5.1 は 100万トークン のコンテキストを提供します。
Grok 4.7 は 50万トークン を提供します。
この差は、非常に大規模なリポジトリ、研究論文のコレクション、長い法務ファイル、あるいはツール出力が大量に蓄積されるエージェントセッションなどでは重要になり得ます。
しかし、コンテキストウィンドウを2倍にしても、自動的に性能が2倍になるわけではありません。
長文コンテキストの品質は、モデルが適切な情報を取得できるか、依存関係に気づけるか、そしてワークフロー全体を通じて指示を維持できるかにも左右されます。
価格
ここで両モデルは大きく分かれます。
Grok 4.7 は以下から始まります:
$2 / 100万入力トークン と $6 / 100万出力トークン。
Claude Fable 5.1 は以下の費用です:
$10 / 100万入力トークン と $50 / 100万出力トークン。
Fable のキャッシュ読み取りは 1百万トークンあたり $0.25 とかなり安く、Anthropic は、大きなプロンプトを再利用したり、高度にエージェント的なセッションを実行したりするワークロードでは、コストを実質的に下げられる可能性があると述べています。
つまり、生のトークン単価だけでは全体は分かりません。
同じ大きなコンテキストを何度も使い回すなら、キャッシュの挙動が重要になります。多くの独立したリクエストを処理するなら、ベースとなる入力・出力のレートのほうがより重要になるかもしれません。
ドキュメントと知識業務
Fable 5.1 はプロフェッショナルな成果物への強いフォーカスがあります。
Anthropic は、ドキュメント、スプレッドシート、スライド、リサーチ、そしてコーディングを扱う作業を特に強調しています。
Grok 4.7 もドキュメントやプレゼンテーションの作成を改善しています。一方 xAI は、オフィス業務、法務タスク、ヘルスケアの推論、そしてエンジニアリングをカバーするプロフェッショナル・ベンチマークでの伸びを報告しています。
ソース中心の素材を扱うチームであれば、現実的なテストとしては、複数のドキュメントを読み込み、矛盾する証拠を特定し、レポートを下書きし、フィードバック後に修正し、最終的な主張を元のファイルと突き合わせて確認する、といった内容が考えられます。
まずはどちらをテストすべき?
選択肢を1つのベンチマークに絞るのではなく、ワークフローの要件で判断してください。
| 必要なこと | 最も重要なのは |
|---|---|
| 非常に大きい入力コンテキスト | Fable 5.1 の 1M ウィンドウ |
| 基本のトークン価格が低い | Grok 4.7 |
| 長期ホライズンのエージェント | 自分のタスクで両方をテスト |
| 大きなプロンプトの使い回し | キャッシュの経済性を比較 |
| ターミナル中心のコーディング | 実際のリポジトリとツールを比較 |
| ドキュメントとプレゼンテーション | 最終成果物の品質を評価 |
| 検索が多いワークフロー | Grok の Web と X ツールを検討 |
実用上の違いは、ベンチマーク表が示唆するよりも大きくなったり小さくなったりします。
もし GPT-6 も評価対象に含めるなら、Grok 4.7 vs GPT-6 Astra をご覧ください。
最後に
Grok 4.7 と Claude Fable 5.1 は、多くの高価値な同種のタスクを対象にしていますが、異なるトレードオフを採用しています。
Fable 5.1 はコンテキストウィンドウが2倍であり、要求の高い長期ホライズンの推論とエージェント業務を中心に明確に設計されています。
Grok 4.7 は実質的にトークン価格がかなり低いところから始まり、選択可能な推論レベルと、xAI の検索、コード実行、そしてエージェントのエコシステムを組み合わせています。
したがって適切な比較は、「どのベンチマーク数値が大きいか?」ではありません。
それは、そのモデルがあなたのコーディング、調査、または知識業務を、正確に、安定して、そして納得できるコストで完了できるかどうかです。
もし Grok を直接テストしたいなら、こちらの Grok 4.7 の使い方 ガイドで、主要なアクセスオプションと設定を解説しています。
