project
Muse Spark - Metaのネイティブなマルチモーダル大規模モデル
Muse Sparkは、Meta AI Labsが発表した初のネイティブマルチモーダル大規模モデルです。Meta AIの再編における主力製品として、このモデルは人工知能分析ベンチマークで18ポイントから52ポイントに飛躍的に向上し、そのマルチモーダル性能を実証しました。
Muse Sparkとは何ですか?
Muse Sparkは、Meta AI Labsが発表した初のネイティブマルチモーダル大規模モデルです。Meta AIの再編における主力製品として、このモデルは人工知能分析ベンチマークで18ポイントから52ポイントへと飛躍的に向上し、マルチモーダル理解と健康に関する質問への回答能力においてGPT-5.4を凌駕しました。このモデルは、視覚的な思考連鎖、マルチエージェント連携、そして「熟考モード」をサポートしており、事前学習効率はLlama 4の10倍です。MetaおよびMeta AIアプリで利用可能で、一部のユーザーにはAPIプレビュー版が提供されています。
Muse Sparkの主な機能
-
ネイティブなマルチモーダル理解視覚的思考の連鎖や画像からコードへの変換をサポートし、複雑なグラフを直接分析したり、画面要素を特定したり、UIデザイン図を実行可能なHTML/CSS/JSアプリケーションに変換したりできます。
-
マルチエージェントコラボレーション複数のサブエージェントを「検討中」モードに設定し、並行して協調的に思考・作業させることで、複雑なタスクを分解、計画、実行することが可能になります。
-
垂直的専門化医療分野では、1,000人以上の臨床医からのデータに基づいて、正確な質疑応答と画像分析を提供し、ショッピングの場面では、ソーシャルグラフを組み合わせてパーソナライズされた商品のおすすめを提供します。
-
効率的な推論メカニズムこのシステムは自動思考圧縮技術を採用しており、同様のモデルと比較してトークン消費量を3分の1に削減しながら高いパフォーマンスを維持し、推論効率を大幅に向上させています。
Muse Sparkの使い方
- ウェブ上で直接使用するMetaのウェブサイトにアクセスすれば、登録不要で基本機能を無料で体験できます。
- モバイルアプリMuse Sparkモデルを完全に統合した公式Meta AIアプリをダウンロードしてください。
- APIアクセス開発者は、現在一部のパートナー企業のみが利用できるAPIのプライベートプレビュー版へのアクセスを申請できます。
- ソーシャルプラットフォームとの連携今後数週間以内に、Facebook、Instagram、WhatsAppと直接統合され、ユーザーはチャットインターフェースから直接アクセスできるようになる予定です。
Muse Sparkの重要な情報と使用要件
- 製品ポジショニングMeta Superintelligence Labs(MSL)は、設立から9か月後に最初のモデル(コードネーム「アボカド」)を発表した。このモデルは「パーソナル・スーパーインテリジェンス」として位置づけられ、30億人のユーザーからなるエコシステムを対象としている。
- コアパフォーマンス人工知能分析の総合スコアは52点(Llama 4はわずか18点)。マルチモーダルグラフ理解(86.4点)と健康に関するQ&A(42.8点)はGPT-5.4を上回る。プログラミングタスク(ARC AGI 2、SWE-Bench)は依然として劣勢。
- 技術的なハイライトネイティブなマルチモーダル推論+視覚的思考チェーン。マルチエージェントの「熟考モード」における並列思考。事前学習に必要な計算能力はLlama 4の1/10に削減され、トークン消費量はOpusのわずか1/3です。
- チーム紹介Scale AIの元創設者であるアレクサンドル・ワンが率いるこの中核チームには、OpenAIやDeepMind出身の中国人研究者が複数名含まれている。
- アクセスチャネルMeta.aiウェブプラットフォーム(登録不要)、Meta AIアプリ(iOS/Android)。APIプレビューはパートナー企業のみが利用可能です。
- 場所と費用現在、このサービスはまず米国地域、特に個人ユーザー向けに完全に開放されています。無料、無制限使用。
Muse Sparkの主な利点
-
ネイティブなマルチモーダル理解チャートの理解(CharXiv 86.4ポイント)やスクリーンショットのローカライズ(ScreenSpot Pro 84.1ポイント)といった視覚的なタスクにおいて非常に優れた性能を発揮し、GPT-5.4やGemini 3.1 Proを大きく上回っています。
-
医療および健康分野の専門化1,000人以上の臨床医との協力のもと構築された専門的なデータシステムに基づき、オープンヘルスQ&A(HealthBench Hardスコア42.8)と医用画像解析において業界トップレベルの性能を達成しています。
-
マルチエージェント協調推論独自の「熟考」モードは、複数のエージェントによる並列思考とタスク分解をサポートし、サブエージェントに調査、計画、実行などの複雑なプロセスを処理させるようにスケジュール設定できます。
-
究極の効率最適化事前学習技術スタックを再構築することで、計算能力の要件をLlama 4の10分の1に削減し、自動マインド圧縮技術を用いることで、トークン消費量を同カテゴリーのトップモデルのわずか3分の1に抑えています。
Muse Sparkと類似製品の比較
| 比較対象寸法 | Muse Spark | GPT-5.4 | Gemini 3.1 Pro |
|---|---|---|---|
| 人工分析総合スコア | 52 | 約51 | 約57 |
| CharXivチャートの理解 | 86.4 | 82.8 | 80.2 |
| ScreenSpot Proのスクリーンショット位置調整 | 84.1 | 85.4 | 84.4 |
| ARC AGI 2 抽象推論 | 42.5 | 76.1 | 76.5 |
| LiveCodeBench Pro プログラミング | 80.0 | 87.5 | 82.9 |
| SWE-Bench Proのコード修正 | 52.4 | 57.7 | 54.2 |
| HealthBench ハードヘルスQ&A | 42.8 | 40.1 | 20.6 |
| MedXpertQA マルチモーダル医療 | 78.4 | 77.1 | 81.3 |
| HLE(ツール付き)ディープシンキング | 58.4 | 58.7 | 53.4 |
| 事前学習に必要な計算能力 | ラマ4の1/10 | 標準レベル | 標準レベル |
| トークン消費効率 | 作品の1/3 | ベンチマークレベル | ベンチマークレベル |
Muse Sparkの応用事例
-
ビジュアル制作と開発このモデルは、アプリケーションのスクリーンショットを直接実行可能なフロントエンドコードに変換する機能をサポートしており、複雑な学術的な図表やエンジニアリング図面を解析したり、静止画像をインタラクティブなウェブゲームやトラブルシューティングツールに生成したりすることができます。
-
健康および医療相談数千人の臨床医からの専門データに基づき、自由形式の健康に関する質疑応答や医療画像の解釈を提供するとともに、ユーザーの食事制限に基づいたインタラクティブな栄養表示や個別化された健康管理プランを作成することもできます。
-
インテリジェントな計画とコラボレーション文化的なルートの調整、親子のアクティビティ、家族旅行の計画におけるロジスティクスなど、複数のエージェントを通じて複雑なタスクを並列処理したり、ソーシャルネットワークデータを組み合わせてパーソナライズされたショッピングのおすすめを提供したり、複数の情報源から情報を自律的に検索・統合して詳細な調査を完了したりすることができる。
-
オフィスと生産性文書解析、表分析、メール作成といったオフィス業務をサポートするだけでなく、スクリーンショット認識に基づく画面自動化機能も備えており、インターフェース操作やフォーム入力などを実行できます。