Muse Spark 1.3登場:AIエージェント、コーディング、長文脈処理が大幅強化

muse-spark-1-3

今回のアップデートは、単にチャットAIを少し賢くするためのものではありません。

より大きなテーマは、AIが実際の仕事を最後まで完了できるようにすることです。

9月2日に公開されたMuse Spark 1.3では、長時間動作するAIエージェント、コーディング、ツール利用、長文脈処理、複雑なワークフローが重点的に強化されています。

Metaによると、Muse Spark 1.2と比べて効率も向上しており、社内テストではツール呼び出しが約20%減少し、トークン使用量も約25%削減されました。

今回のアップデートの中でも、特に実用的な改善点と言えそうです。

Muse Spark 1.3とは?

Muse Spark 1.3は、MetaのMuse Sparkシリーズにおける最新モデルです。

1回のプロンプトと回答だけでは完結しない、次のようなタスクを想定して設計されています。

  • 長時間動作するAIエージェント
  • ソフトウェア開発
  • リサーチとWebブラウジング
  • Computer Use
  • 業務自動化
  • 長文脈からの情報検索
  • 複雑なドキュメントワークフロー

Muse Spark 1.3は現在、Muse CodeMeta Model API から利用できます。

また、100万トークンのコンテキストウィンドウにも対応しています。

これにより、大規模なコードベース、長い文書、複数ファイル、長時間にわたるエージェントセッションなどを扱えるようになります。

ただし、本当に重要なのは「どれだけ多くの情報を保持できるか」だけではありません。

長時間にわたって、その情報をどれだけ正しく使い続けられるかです。

Muse Spark 1.3は長時間のAIワークフローに強い

AIエージェントでよく起きる問題の1つが、タスクの途中で目的からずれてしまうことです。

最初は正しく目標を理解していても、複数のステップを進めるうちに重要な条件を忘れてしまうことがあります。

Muse Spark 1.3は、この問題を減らすことを目指しています。

Metaによると、新モデルは長いタスクでも詳細な指示を維持しやすく、整理されていない情報や矛盾した情報も扱いやすくなりました。

さらに、自分の計画の抜けを修正し、すでに得た情報を追跡する能力も向上しています。

同じ長い会話の中で複数のワークフローを扱う場合でも、新しい依頼と過去のタスクを混同しにくくなっています。

元ファイルから最終成果物まで作成

Metaが公開した例を見ると、この能力が通常のチャットとはかなり違うことが分かります。

あるテストでは、Muse Spark 1.3に住民からのフィードバックをまとめたExcelファイルが渡されました。

そして、そのデータを委員会の会議でスタッフがそのまま使える資料に変換するよう指示されています。

最終結果は、単なるチャット内の要約ではありませんでした。

重要な数字、話すべきポイント、地域別のガイダンス、実際に使える表現、約束すべきでない内容などを整理したPDFを生成しています。

ecid-talking-points

Muse Spark 1.3が元データから構造化されたスタッフ向け資料を作成した例。出典:Meta AI Research。

これは、AIエージェントが向かっている方向をよく表しています。

これまでのような、

プロンプト → 回答

ではなく、

ファイル → 理解 → 分析 → 整理 → 作成 → 納品

という流れです。

実務では、この違いが非常に重要になります。

Muse Spark 1.3は複雑なマルチモーダルタスクにも対応

長いワークフローは、表計算や文書だけに限りません。

Metaの別の例では、Muse Spark 1.3が実験用航空機の組み立てに取り組む機械エンジニアとして動作します。

モデルには、初期段階のCFDシミュレーション結果と、CADモデルを含むSTEPファイルが渡されます。

その上で、内容を解釈し、シミュレーション環境を説明し、エンジニアリング指標を抽出し、表や図を作成し、空力上の意味を分析して、最終的なPDFレポートを作成します。

完成したレポートには、技術的な説明、可視化、表、グラフ、エンジニアリング上の背景情報がまとめられています。

x-wing-flow-simulation

エンジニアリングファイルをもとにMuse Spark 1.3が作成した流体シミュレーションレポートの例。出典:Meta AI Research。

この例は、「マルチモーダルエージェント」という言葉の意味が変わりつつあることも示しています。

単に画像を認識したり、PDFを要約したりするだけでは十分ではありません。

実用的なエージェントには、複数種類の入力を理解し、重要な情報を保持し、それらを横断して推論し、他の人がそのまま使える成果物にまとめる能力が必要です。

Muse Spark 1.3のベンチマーク

MetaはMuse Spark 1.3を主に3つの領域で評価しています。

  • AIエージェント
  • 長文脈
  • コーディング

全体的に強い結果ですが、すべてのベンチマークで1位というわけではありません。

muse-spark-1-3-benchmark

Muse Spark 1.3のAIエージェント、長文脈、コーディングに関するベンチマーク結果。出典:Meta AI Research。

AIエージェント性能

長時間のComputer Useワークフローを評価する OSWorld 2.0 では、Muse Spark 1.3は次のスコアを記録しています。

66.9

Muse Spark 1.2の 47.6 から大きく向上し、GPT-5.6 Solの 62.7 も上回りました。

一方、Claude Opus 5は 68.3 でわずかに上回っています。

その他のスコアは以下の通りです。

  • JobBench:64.9
  • DeepSearchQA:89.4
  • Meta Agentic IF Index:57.8
  • AutomationBench:49.4

重要なのは、Muse Spark 1.3がすべての項目でトップになっていることではありません。

注目すべきなのは、複数の異なるAIエージェント系タスクで、Muse Spark 1.2から一貫して改善している点です。

長文脈性能は大幅に向上

特に目立つのが長文脈の結果です。

MRCRでは以下のスコアとなっています。

Benchmark Muse Spark 1.3 Muse Spark 1.2 GPT-5.6 Sol
MRCR 256K–512K 98.5 66.3 91.5
MRCR 512K–1M 98.1 55.5 73.8

Muse Spark 1.2から非常に大きく改善しています。

100万トークンのコンテキストウィンドウがあっても、その中に埋もれた情報を正確に取り出せなければ意味がありません。

この結果を見る限り、Metaは単に最大コンテキスト長を増やしただけでなく、長い文脈からの情報検索にもかなり力を入れていると考えられます。

大規模コードベース、研究資料、長い会話、文書中心のAIエージェントでは、大きな強みになりそうです。

コーディング性能も向上

Muse Spark 1.3は複数のコーディング評価でも良好な結果を出しています。

長時間のソフトウェア開発タスクを評価する DeepSWE v1.1 では 75.4 を記録しました。

比較すると、

  • Muse Spark 1.2:55.0
  • GPT-5.6 Sol:73.0
  • Claude Opus 5:74.0

となっています。

SWEAtlas CodeBase QnAでは 59.4 を記録し、Metaが比較した他のモデルを上回っています。

Terminal-Bench 2.1では、Muse Spark 1.3とGPT-5.6 Solがともに 88.8、Claude Opus 5は86.7でした。

これらの結果は、今回のアップデートの方向性とも一致しています。

単発のコード生成ではなく、複数ステップを必要とする開発タスクで、Muse Spark 1.3は大きく強化されています。

ただし、注意したい点があります。

Metaが公開したベンチマークでは、Muse Spark 1.3に Max Reasoning 設定が使用されています。

ローンチ時点では既存の推論モードが利用可能で、Max Reasoningは追加の安全テスト後に提供される予定です。

そのため、公開されたベンチマーク結果が、現在利用可能なすべての設定でそのまま再現されるとは限りません。

Muse Spark 1.3はツール呼び出しも削減

ベンチマークは重要ですが、今回の最も実用的な改善はランキングには表れないかもしれません。

Metaによると、Muse Spark 1.3はMuse Spark 1.2と比べて約:

  • 20%少ないツール呼び出し
  • 25%少ないトークン使用量

でタスクを進められます。

また、不必要なステップが減り、生成するコードもより簡潔になる傾向があります。

なぜこれが重要なのでしょうか?

例えば、コーディングエージェントがバグを修正するとします。

効率の悪いワークフローでは、

検索 → 確認 → 再検索 → 編集 → 確認 → 元に戻す → 検索 → 編集 → テスト → 再編集

のように何度も行き来する可能性があります。

より優れたエージェントなら、問題を早い段階で特定し、少ない操作で同じ結果に到達できます。

不要なツール呼び出しは、そのたびに時間とコストがかかります。

さらに、失敗する可能性も増えます。

これはコーディングだけの話ではありません。

リサーチエージェント、ブラウザエージェント、業務自動化ツール、AIアシスタントなどでも、早い段階で正しい行動を選べることには大きな価値があります。

Muse Spark 1.3の料金

Meta Model APIでは、Muse Spark 1.3に2種類の料金プランがあります。

どちらも 100万トークンのコンテキスト に対応しています。

muse-spark-1-3-modesl-pricing

Meta Model APIにおけるMuse Spark 1.3の料金。出典:Meta。

通常版 Muse Spark 1.3

muse-spark-1.3 の料金は以下の通りです。

使用量 100万トークンあたりの料金
入力 $1.25
キャッシュ入力 $0.15
出力 $4.25

Metaはこのバージョンについて、同社製品の改善には使用しないとしています。

Muse Spark 1.3 Contributor

さらに、かなり安価なモデルとして、

muse-spark-1.3-contributor

も用意されています。

使用量 100万トークンあたりの料金
入力 $0.10
キャッシュ入力 $0.002
出力 $0.20

ただし、重要な違いがあります。

Contributor版についてMetaは、製品改善に使用されると明記しています。

非常に低価格ですが、データの取り扱いやプライバシー要件が重要な用途には適さない場合があります。

開発者は、トークン単価だけでなくデータポリシーも確認した上で選ぶ必要があります。

Muse Spark 1.3とMuse Spark 1.2の違い

今回のアップデートは、1つの派手な新機能というより、ワークフロー全体の改善が中心です。

機能 Muse Spark 1.2 Muse Spark 1.3
長時間AIエージェント 強い より安定
長い指示への追従 良好 改善
マルチタスク 対応 タスク分離が改善
ツール利用 強い より効率的
ツール呼び出し 基準 Metaテストで約20%減
トークン使用量 基準 Metaテストで約25%減
長文脈検索 良好 大幅改善
コーディング 強い 長時間タスクで改善
確認質問 対応 より積極的

一言でまとめるなら、

Muse Spark 1.3は、無駄な操作を減らしながら、より複雑な仕事をこなせるようになったモデルです。

「何もしない方がいい場面」も判断しやすくなった

もう1つ、派手ではありませんが実運用では重要な改善があります。

Muse Spark 1.3は、ユーザーとより積極的に協力するようトレーニングされています。

指示が曖昧なら、確認質問を行えます。

タスクの途中で行き詰まった場合は、ユーザーに助けを求めることもできます。

重要な操作を行う前に、本当にその操作を実行してよいか確認する可能性も高くなっています。

Metaによると、自分が何を知っていて何を知らないのか、どこが能力の限界なのかを判断する能力も向上しています。

結果を無理に作るのではなく、必要な場面で止まれるエージェントの方が、実際の仕事では信頼しやすい場合があります。

Muse Spark 1.3はオープンソース?

現時点では違います。

Muse Spark 1.3はMetaのサービス経由で提供されており、Open Weightsモデルとしては公開されていません。

ただしMetaは、Muse SparkのOpen Weights版を今後公開する計画があるとしています。

具体的な公開日は発表されていません。

MetaのAPI以外で実行したい開発者や、独自にカスタマイズ・ファインチューニングしたい開発者にとっては、今後注目すべきポイントです。

Muse Spark 1.3はどこで使える?

現在、Muse Spark 1.3は以下から利用できます。

  • Muse Code
  • Meta Model API

Muse Codeは、AIエージェントを使ったコーディング体験を求める開発者に向いています。

Meta Model APIは、自社製品やワークフローにMuse Sparkを組み込みたい開発者向けです。

現時点では、次のような用途との相性が良さそうです。

  • コーディングエージェント
  • リサーチエージェント
  • Computer Useエージェント
  • 業務自動化
  • 大規模ドキュメント処理
  • 長時間タスク
  • マルチモーダル分析
  • 100万トークンのコンテキストが必要なアプリケーション

Muse Spark 1.3は普段のAI活用をどう変える?

Muse Spark 1.3は、AI業界全体で起きている大きな変化を表しています。

これまでモデルを評価するときは、

回答の質は高いか?

という点が中心でした。

AIエージェントでは、さらに次のようなことが重要になります。

ファイルを正しく理解できるか?

要件を覚えていられるか?

適切なツールを選べるか?

問題が起きたときに立て直せるか?

最終成果物まで作れるか?

だからこそ、エンジニアリングレポートやスタッフ向け資料の例には意味があります。

AIが単に文章を生成する段階から、ワークフローそのものを完了する段階へ移行していることが分かります。

PDF、レポート、Webページ、動画などを日常的に扱う場合、iWeaver も同じようにワークフローを重視したアプローチを採用しています。散らばった情報を要約、構造化ノート、マインドマップ、再利用できる知識へ整理できます。

より自由なブレインストーミング、ストーリー作成、クリエイティブな会話を重視するなら、XPT はより柔軟な会話と、不要な中断の少ないAI体験を提供しています。

モデルが進化するほど、「どのモデルを使うか」と同じくらい「どんなワークフローで使うか」が重要になっています。

Muse Spark 1.3は試す価値がある?

Muse Spark 1.3は特に次の用途で注目できます。

  • ソフトウェア開発
  • 長文脈を使ったリサーチ
  • 複雑な文書処理
  • AIエージェント
  • 自動化
  • Computer Use
  • 複数ツールを使うワークフロー

ベンチマークでは、特に長文脈とコーディングで大きな改善が見られます。

ただし、実際にはより地味な改善の方が重要かもしれません。

不要なツール呼び出しの削減、トークン使用量の削減、長い指示の保持、そしてユーザーに助けを求めるべきタイミングの判断です。

こうした改善によって、AIエージェントはより信頼しやすく、規模を拡大して運用しやすくなります。

まとめ

Muse Spark 1.3は、AIモデル競争がどこへ向かっているのかを分かりやすく示しています。

次世代モデルは、単発の回答がどれだけ印象的かだけでは評価されません。

今後は、

  • タスクから逸れないか
  • 複数ファイルを扱えるか
  • ツールを効率よく使えるか
  • 長い指示を覚えていられるか
  • ミスを認識できるか
  • 最後に実用的な成果物を届けられるか

といった点が重要になります。

Muse Spark 1.3は、これらすべての領域で明確な進歩を見せています。

すべてのベンチマークで首位というわけではなく、Metaの比較で使用されたMax Reasoning設定も、現時点ではすべてのユーザーが利用できる標準設定ではありません。

それでもMuse Spark 1.2と比べれば、方向性は明確です。

MetaはMuse Sparkを、単に高性能なAIモデルから、実際の仕事を任せられるより実用的なAIエージェントへ進化させています。