Claude Sonnet 5.5: ベンチマーク、料金、機能&新たに何が追加されたか

claude-sonnet-5-5

Claude Sonnet 5.5 は、日々のプロフェッショナル作業のための効率重視モデルとして Anthropic が提供するモデルです。2026年9月28日にリリースされ、最も難しいオープンエンドの課題では Opus 5.5 の下に位置付けられていますが、コーディング、ドキュメント作成、画像理解、長時間にわたるタスクで確かな向上をもたらします。最も実用的な変更はシンプルです。Anthropic によると、Sonnet 5 より出力が 30% 以上速くなり、API トークンの価格は同じで、使用するトークンが少ないことが多いため、完了タスクあたりのコストが最大 30% 低くなる可能性があります。

これは、あらゆるリクエストで Opus に支払うのではなく、明確に定義された作業に適した“能力のあるモデル”を求める人のために設計されています。モデル選びは、最も高いベンチマークスコアだけで決められることはほとんどありません。レイテンシ、リトライ回数、トークン使用量、そして人によるレビューが、実際のワークフローコストに大きく影響することがあります。

Claude Sonnet 5.5 概要

詳細 Claude Sonnet 5.5
リリース日 2026年9月28日
API モデル名 claude-sonnet-5-5
標準入力価格 1M トークンあたり $2
標準出力価格 1M トークンあたり $10
キャッシュ読み取り価格 1M トークンあたり $0.20
キャッシュ書き込み価格 1M トークンあたり $2.50
最適用途 明確に絞ったコーディングとプロフェッショナルなタスク
利用可能 Claude 製品、Claude Platform、AWS、Google Cloud、Microsoft Azure

これらの数値は Anthropic の Sonnet 5.5 アナウンス に基づきます。クラウド事業者ごとの価格やアクセス条件は異なり得るため、チームは本番コストを見積もる前に、実際に利用するプラットフォームを確認してください。

Sonnet 5 から何が変わった?

このアップデートが最も強いのは、モデルが“質問に答える”だけでなく“作業を行う”必要がある場面です。Anthropic は、バグ修正、仕上がりの良いドキュメント、プレゼンテーション、スプレッドシート、ビジュアルデザイン、そしてより長いタスクを強調しています。Sonnet 5.5 には調整可能な努力度も搭載されています。低い設定では速度とトークン使用量の削減を優先し、高い設定ではより深い推論と確認を可能にします。Claude Code と各アプリではデフォルトを Medium に設定し、Claude Platform ではデフォルトを High に設定します。

見出しの速度・コストに関する主張は、慎重に読み解く必要があります。「30%+ faster」は Sonnet 5 と比べた出力生成速度のことです。「Up to 30% less」は、トークン1つあたりの割引ではなく、Anthropic が観測したタスクあたりのコストのことを指します。API 価格としては入力が 1,000,000 トークンあたり $2、出力が 1,000,000 トークンあたり $10 のままなので、実際の節約は、新しいモデルがより短い回答で仕事を完了できるか、リトライが減るか、ツール呼び出しが減るかといった条件に左右されます。

claude-sonnet-5-5-benchmarks-features

Claude Sonnet 5.5 ベンチマーク

Anthropic はエージェント型のコーディングやナレッジワークにまたがる複数の評価を公開しました。いくつかの環境では Sonnet 5 に対して大きな改善が見られ、別の環境では Opus に近い結果が示されています。

ベンチマーク Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4% 報告なし
FrontierCode 1.1 Main Max で 46.2% 42.4% 54.4% 49.3%; Xhigh で 52.1%
CursorBench 4.0 55.5% 34.1% 57.8% 報告なし
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483

この表は参考になりますが、普遍的な順位付けではありません。努力度の設定、エージェントのハーネス、ツール、セーフガード、採点方法はそれぞれ異なります。Anthropic も、より多くの推論が常に結果を改善するとは限らないと述べています。FrontierCode では、Max の Sonnet 5.5 が、要求されたスコープ外の変更をしてしまうことがあるとのことです。最良の構成は、最も計算量(compute)を使うものとは限らず、管理された編集で許容できる結果を生み出します。

コーディングとエージェント作業

Terminal-Bench 4.0 での Sonnet 5.5 の 70.6% という結果は、リリースの中でも最も目を引く数字ですが、重要なのは見出しの数字よりも、その周辺のワークフローです。開発者にとって役立つコーディングモデルは、リポジトリを理解し、狙いを定めて変更を行い、適切なチェックを実行し、タスクを拡大する前に止められる必要があります。出力がレビューしやすい状態に保たれる場合にだけ、速度は価値を持ちます。

そのため Sonnet 5.5 は、バグの診断、明確に指定された機能の実装、プルリクエストのレビュー、既知のコンポーネントのリファクタリングのように“範囲が限定された作業”にとって、筋の良い候補になります。一方で、大規模な移行や曖昧なアーキテクチャ判断は、Anthropic が「継続的な判断」に向けて明確に位置付けている Opus 5.5 のほうが引き続き有利な場合があります。公平な評価には、実際のリポジトリ課題を使い、正確性、不要な編集、経過時間、総トークン数、そして人のレビュー時間を測定するべきです。

ドキュメント、スプレッドシート、ナレッジワーク

このリリースの価値は、ソフトウェア開発の外でも同様に高いです。Anthropic は、Sonnet 5.5 がドキュメント、スライド、スプレッドシートの作成に強いと説明しています。また GDPval-AA と AA-Briefcase の結果は、プロフェッショナルなナレッジワークを反映することを意図しています。これらのスコアは、すべてのレポートが正確になることを証明するわけではありませんが、明確なソース資料と検証可能な成果物を伴う“構造化されたタスク”でモデルを試す裏付けにはなります。

実用的なワークフローは、複数のレポート、会議メモ、そしてスプレッドシートから始め、モデルに対して、合意点と矛盾を特定し、ソース参照付きで数値を抽出し、エグゼクティブ向けのブリーフを下書きさせる、といった形が考えられます。重要なセーフガードは検証です。数値の主張は必ずソースに照らして確認し、その後の結論も、引き続き適切に資格のある人のレビューが必要です。最初の課題が、混在するソース資料の整理である場合には、iWeaver の AI Summarizer が、PDF、ドキュメント、Webページ、音声、画像、動画を、より深い分析の前に要約や構造化されたメモへ変換するのに役立ちます。

文脈としての料金

Sonnet 5.5 と GPT-6 Sol は、入力が 1,000,000 トークンあたり $2、出力が 1,000,000 トークンあたり $10 という同じ標準のリスト価格を共有しています。Opus 5.5 はそれぞれ $4 と $20 です。これらの数値により Sonnet は、繰り返し発生する明確に定義されたタスクでは魅力的に映りますが、トークン単価の比較だけでは不十分です。コンテキストサイズ、キャッシュ、ツール課金、推論にかける努力、失敗した実行、そして出力の長さが、最終的な請求額に影響します。

本番での評価では、代表的なタスク群を選び、トークン単価だけでなくタスクあたりの総コストを記録してください。何度も修正が必要な低価格モデルは、見込みより高くつくことがあります。一方で、高価格モデルでも、価値の高いタスクを1回のパスで完了できれば経済的になり得ます。同じテストセットは、モデルのアップデート後にも再実行すべきです。提供側の挙動や提供設定は変わり得るためです。

Claude Sonnet 5.5 は使う価値がある?

Sonnet 5.5 は、作業の多くが明確に範囲が定義されていて、応答性、予測可能な API 料金、そして強力なコーディングまたはドキュメント性能を重視するなら、ぜひ試す価値があります。課題が曖昧である場合、微妙な誤りのコストが大きい場合、またはタスクが多段階にわたって持続的な判断を必要とする場合は、必ずしも最適なデフォルトとは言いにくく、そのようなケースは Opus 5.5 が掲げる役割により近いでしょう。

最も強い結論は、Sonnet 5.5 が“あらゆる代替案を上回る”ということではありません。Anthropic が、日常向けとプレミアム層のギャップを縮めつつ、意味のある価格差を維持したという点にあります。ベンチマークを使って“試す価値があるもの”を判断し、その後は、ご自身のソース、プロンプト、レビュー基準、そしてタスク総コストに基づいて選んでください。階層(ティア)の直接比較なら Claude Sonnet 5.5 vs Opus 5.5 を、セットアップのアイデアなら How to Use Claude Sonnet 5.5 をご覧ください。