project
Muse Glimmer - Metaのオープンソース言語モデル、300億個のパラメータを持つ
Muse Glimmerは、Meta社が開発したオープンソースの言語モデルで、300億個のパラメータを持ち、24時間365日稼働するローカルエージェントのワークフロー向けに高度に最適化されています。このモデルは4ビット量子化技術を採用しており、24GBのVRAMを搭載した単一のGPUでも動作可能です。
ミューズグリマーとは何ですか?
Muse Glimmerは、Meta社製の300億個のパラメータを持つオープンソースの言語モデルで、24時間365日稼働するローカルエージェントのワークフロー向けに最適化されています。4ビット量子化を採用することで、24GBのVRAMを搭載したシングルGPUまたはApple Silicon上で、推論性能の低下を最小限に抑えながらスムーズに動作します。RTX 5090およびM4/M5 Maxプラットフォームでの実環境テストでは、リアルタイム対話とエージェントインタラクションにおけるその性能が実証されています。DFlashの推論デコード技術と組み合わせることで、最大3.1倍の高速化を実現し、MCP AtlasやSWE-Bench Proなどの複数のベンチマークにおいて、同規模の競合製品を凌駕する性能を発揮します。
Muse Glimmerの主な機能
-
ローカルエージェント推論24時間365日バックグラウンドでの動作をサポートし、インテリジェントエージェントのワークフローに高度に最適化されているため、インターネット接続なしで複雑なタスクスケジューリングを完了できます。
-
低メモリ、高効率な展開4ビット量子化技術を用いることで、30ビットのパラメータモデルは、24GBのグラフィックカード1枚、または32GBの統合メモリを搭載したMac上でローカルに実行できる。
-
リアルタイムの対話型対話M4 Max、M5 Max、およびハイエンドPC上でスムーズな対話とリアルタイムのエージェント応答を実現し、低遅延環境のニーズを満たします。
-
マルチモーダルおよびツールコールMCP Atlasなどのインテリジェントエージェントベンチマークをサポートし、ツールの使用、コード生成、および多段階推論の機能を備えています。
Muse Glimmerの技術原理
- モデルアーキテクチャとスケールMuse GlimmerはTransformerアーキテクチャに基づいており、合計300億個のパラメータを持っています。エージェントタスク向けの事後学習と指示の微調整を通じて、ツール呼び出し、コード生成、および多段階推論における機能を強化します。
- 4ビット量子化圧縮低ビット量子化技術を用いることでモデルサイズが大幅に圧縮され、24GBのグラフィックカード1枚または32GBの統合メモリを搭載したMac上で30Bのパラメータをローカルで実行することが可能になり、実際のテストではエージェントタスクのパフォーマンス低下はごくわずかであることが示されています。
- DFlashの投機的デコード統合された投機的デコード機構は、ドラフトモデルを利用して候補トークンを迅速に生成し、それらをメインモデルで並行して検証します。これにより、RTX 5090では最大3.1倍の高速化を実現し、デコード速度は233トークン/秒となります。
- クロスプラットフォーム推論フレームワークApple Silicon の場合、ExecuTorch を介して適応され、NVIDIA GPU の場合、llama.cpp を介して適応されるため、モデルはさまざまなハードウェアプラットフォーム間で一貫性のある効率的なローカル推論エクスペリエンスを実現できます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Muse Glimmerの使い方
-
環境準備お使いのデバイスに、少なくとも24GBのビデオメモリを搭載したNVIDIA GPU、または32GBの統合メモリを搭載したApple Silicon Mac(M4/M5 Max推奨)が搭載されていることを確認してください。
-
ダウンロード重量ハギングフェイスのリポジトリにアクセスする
meta-models/Muse-Glimmer-30B4ビット量子化モデルファイルと設定ファイルをダウンロードしてください。 -
フレーム選択NVIDIAユーザーはllama.cpp経由でモデルをロードし、Apple Siliconユーザーは最適なパフォーマンスを得るためにExecuTorch経由で実行します。
-
推論を開始する互換性のあるローカル推論UIを使用してモデルをロードし、推論速度を最大化するためにDFlashの投機的デコードを有効にしてください。
-
アクセスエージェントのワークフローMCPプロトコルまたはローカルAPIを介してモデルを個人の知識ベース、コードリポジトリ、ツールチェーンに接続することで、バックグラウンドで実行される自動タスク処理を実現できます。
ミューズ・グリマーの主な利点
-
究極のローカルパフォーマンス4ビット量子化後の性能低下はごくわずかであり、SWE-Bench ProやDeepSearch QAなどのタスクにおいて、Gemma4-31BやQwen3.6-27Bを大幅に上回る性能を発揮します。
-
アクセス可能なハードウェア要件大規模モデルのローカル展開におけるメモリの制約を打破し、24GBのビデオメモリで30Bパラメータのモデルを実行できるため、個人開発者や中小企業の利用コストを削減できます。
-
推論速度の飛躍的向上統合されたDFlashの投機的デコードにより、RTX 5090のデコード速度が74.9 tok/sから233 tok/sに向上し、3.1倍の高速化を実現しました。
-
安全性と制御性100%ローカル計算で、データはデバイスから外部に流出せず、Siren AgentDojoセキュリティテストにおける攻撃成功率は競合他社よりも低く、パフォーマンスとプライバシーのバランスが取れています。
ミューズ・グリマーのプロジェクトアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/meta-models/Muse-Glimmer-30B
Muse Glimmerと類似製品の比較
| 比較対象寸法 | Muse Glimmer-30B | Qwen3.6-27B |
|---|---|---|
| パラメータサイズ | 30B | 27B |
| オープンソースライセンス | Apache 2.0 | Apache 2.0 |
| 定量的サポート | 公式には、4ビットグラフィックスと24GBのビデオメモリで動作可能です。 | 第三者による定量的なソリューションが必要です。 |
| MCP Atlas | 75.5 | 62.5 |
| SWE-Bench Pro | 51.2 | 50.2 |
| SWE-Bench Verified | 76.0 | 77.2 |
| DeepSearch QA | 74.6 | 71.1 |
| OSWorld-Verified | 65.9 | 75.6 |
| AIME 2026 | 94.7 | 94.1 |
| セキュリティ攻撃の成功率 | 28.4%(低価格でより安全) | 40.3% |
| ローカルエージェント最適化 | 常駐エージェントのワークフロー向けに特別に設計されています | 一般的な対話と推論モデル |
Muse Glimmerの応用事例
-
ローカルAIアシスタントバックグラウンドで動作するパーソナルインテリジェントエージェントとして、クラウドAPIに頼ることなく、スケジュール管理、メール作成、コードレビューといった日常的なタスクを処理します。
-
プライバシーに敏感な業界医療、金融、法律など、データコンプライアンス要件が極めて高い分野に適しており、コアデータが100%ローカルデバイス上に保持されることを保証します。
-
開発者ツールチェーンIDEや端末に統合され、オフラインでのコード補完、自動テスト生成、リポジトリレベルのコード理解機能を提供し、SWE-Benchレベルのソフトウェアエンジニアリングタスクをサポートします。
-
エッジデバイスの展開24GB以上のビデオメモリを搭載したワークステーション、または高性能Mac上で動作し、中小規模チーム向けに低コストでエンタープライズグレードのAI機能を提供します。