project
FreeToken - フルキャパシティ運用をサポートする、オープンソースのクライアントサイドMoE大規模モデル推論システム。
FreeTokenは、UCバークレー校、MIT、およびその他の機関が共同開発した、大規模モデル向けのオープンソースのエッジサイドMoE(モデルベース推論)システムです。このシステムは、フルレイヤーダブルバッファリング、帯域幅適応型ハイブリッドスケジューリング、エージェント状態の再利用、弾性メモリのホットスケーリング/スケーリングなどの機能を活用しています。
FreeTokenとは何ですか?
FreeTokenは、UCバークレー校、MIT、およびその他の機関が共同開発した、大規模モデル向けのオープンソースのエッジMoE(モデルベース推論)システムです。フルレイヤーダブルバッファリング、帯域幅適応型ハイブリッドスケジューリング、エージェント状態の再利用、GPUメモリの弾力的なホットスケーリングといった技術により、パーソナルコンピュータのCPU、メモリ、PCIe、GPUを統合し、弾力的なコンピューティングプラットフォームを実現します。これにより、単一のコンシューマーグレードのカードで、Qwen3.6-35BやDeepSeek-V4-Flash 284Bといった超大規模MoEモデルをフル稼働させることが可能になり、最先端AIのローカル展開が現実のものとなります。
FreeTokenの主な機能
-
エンドサイドの完全健康控除RTX 4060/5090などのコンシューマー向けシングルカードにおいて、Qwen3.6-35BやDeepSeek-V4-Flash 284Bといった大型MoEモデルのフルパワー動作をサポートします。
-
フルレイヤーダブルバッファリングプリフェッチGPUが現在のレイヤーを計算する際、バックグラウンド処理はPCIeストリーミングを介して次のレイヤーのエキスパートウェイトをプリフェッチし、I/O待機バブルを完全に排除します。
-
帯域幅適応型スケジューリングPCIe帯域幅とCPU演算能力をリアルタイムで検出し、不足したエキスパートデータをGPUキャッシュまたはCPUオンサイト演算に動的に割り当て、ハードウェアのスループットを限界まで引き上げます。
-
エージェント状態の再利用軽量チェックポイントは特別なトークン境界に設定されており、コンテキスト編集では最新のアンカーからのみ事前入力されるため、完全な履歴の重複計算が回避されます。
-
柔軟なメモリ熱膨張バックグラウンドアプリケーションがビデオメモリをプリエンプトすると、GPUキャッシュはシームレスに縮小され、計算処理はCPUに引き継がれるため、ダウンタイムやOOM(メモリ不足)エラーが発生することなく、スムーズなパフォーマンス低下が実現します。
-
非常に高速で低遅延最初のトークンのレイテンシは42~58%短縮され、エージェントの複数ターンのインタラクションのTTFTは65~80%短縮され、全体としてOllamaよりも2~4倍高速です。
FreeTokenの技術原則
- フルレイヤーダブルバッファリングプリフェッチ:プロンプト処理フェーズにおいて、FreeTokenは計算とデータ転送の完全なオーバーラップを実現します。GPUがレイヤーlを計算している間に、レイヤーl+1のエキスパート重みは既にプリフェッチされ、PCIeバックエンドを介してストリーミングされるため、基本的にI/O待機バブルが解消され、システムメモリからレイヤーごとにエキスパートをフェッチすることでプリフィル処理が深刻なブロックを受けるのを防ぎます。
- 帯域幅適応型ハイブリッドスケジューリング:ランタイムシステムは、マシンの実際のPCIe帯域幅とCPUの瞬時演算能力をリアルタイムで検出し、最適なトラフィック分割比率を動的に計算します。エキスパートの一部はGPUのLRUキャッシュにヒットし、ヒットしなかった部分はリアルタイムの帯域幅に応じてインテリジェントに分割されます。データの一部はPCIe経由でGPUに送信され、一部はCPU上で直接並列処理されるため、ハードウェアのスループットはこのトポロジーの理論上の限界まで押し上げられます。
- エージェント指向のインテリジェントな状態再利用:コーディングエージェントやツール呼び出しモデルがコンテキストを頻繁に微調整するシナリオでは、FreeTokenは特別なトークン境界に軽量なチェックポイントを設定します。コンテキストが編集されると、システムは最新の有効なアンカーポイントから復元し、追加されたサフィックスを段階的に事前入力するだけで済み、コンテキスト全体を再計算する必要はありません。これにより、ツール呼び出しと思考連鎖の反復処理を複数回繰り返す際の冗長な計算オーバーヘッドが大幅に削減されます。
- 動的な熱膨張・収縮に対応するフレキシブルメモリ:パーソナルコンピュータ上の他のアプリケーションがビデオメモリを優先的に使用するという現実に対応するため、FreeTokenはサービングサービスを再起動することなく、GPU内のエキスパートキャッシュを動的にホットリサイズする機能をサポートしています。利用可能なビデオメモリが急激に減少した場合、キャッシュはシームレスに縮小され、不足していたエキスパートがCPUに転送されて計算が行われるため、CUDAメモリ不足クラッシュを引き起こすことなく、推論サービスがスムーズに劣化することが保証されます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
FreeTokenの使い方
- デスクトップアプリのインストールWindowsまたはLinuxデスクトップアプリをダウンロードするには、FreeTokenのウェブサイト(https://www.flashml.ai/)にアクセスしてください。インストール後、GUIインターフェースから推論サービスを開始できます。
- コマンドラインによるクイックインストールコマンドラインから実行する
uv pip install "freetoken[accel]"ワンクリックでCLIツールをインストールできます。 - モデルの読み込みと自動スケジューリングサポートされているMoEモデルの重みを読み込むと、システムはCPU-GPU異種スケジューリングと帯域幅適応構成を自動的に完了します。
- ハードウェア構成に関する推奨事項DeepSeek-V4-Flashのような大容量モデルを実行する場合、安定したスムーズなパフォーマンスを確保するために、32GBのビデオメモリと少なくとも192GBのRAMを搭載することをお勧めします。
- フレキシブルビデオメモリ自動管理ゲームやレンダリング処理がバックグラウンドでビデオメモリを占有している場合、FreeTokenは手動操作やサービスの再起動なしに、自動的にホットスワップでメモリを拡張および縮小します。
FreeTokenの主な利点
-
ハードウェアの障壁を打ち破るコンシューマー向けシングルカード(RTX 4060/5090など)は、データセンターのクラスタを必要とせずに、35B~753Bのパラメータを持つ超大規模なMoEモデルをフルパワーで実行できます。
-
推論速度でトップOllamaよりも2~4倍、llama.cppよりも1.46倍高速です。ノートパソコンのRTX 4060では、Qwen3.6-35Bを最大39.3 tok/sの速度で実行できます。
-
最初のトークンは極めて低遅延です。フルレイヤーダブルバッファリングと帯域幅適応型スケジューリングを使用することで、ロングプロンプトのTTFTが42~58%短縮されます。
-
エージェント間の相互作用の最適化軽量なチェックポイントとトークン境界での状態再利用に基づき、複数ターンにわたるツール呼び出しシナリオにおけるTTFT(ターンタイム・トゥ・ファンクション)は65~80%短縮されます。
-
フレキシブルメモリはクラッシュしないバックグラウンドアプリケーションがビデオメモリをプリエンプトする場合、GPUキャッシュはホットスワップで拡張または縮小でき、計算処理はCPUに引き継がれるため、ダウンタイムやOOM(メモリ不足)エラーなしでスムーズなパフォーマンス低下を実現できます。
-
フルスタックの異種コラボレーションCPU、システムメモリ、PCIeバス、GPUを統合して柔軟な推論プラットフォームを構築し、ハードウェアトポロジーの理論上の最大スループットに自動的に収束させる。
FreeTokenのプロジェクトアドレス
- プロジェクト公式サイト:https://www.flashml.ai/
- GitHubリポジトリ:https://github.com/FlashML-org/FreeToken
- arXiv技術論文:https://arxiv.org/pdf/2608.16157
FreeTokenとその競合製品の比較
| 比較対象寸法 | FreeToken | Ollama |
|---|---|---|
| 位置 | エッジサイドMoE専用のフルスタック推論システム | 汎用ローカル大規模モデルランタイムフレームワーク |
| MoEモデルのサポート | ネイティブかつ徹底的に最適化されており、20種類以上のMoEモデルのフルパフォーマンス動作をサポートします。 | 一部のMoEモデルはサポート対象外であったり、起動できなかったりします(DSV4-Flashなど)。 |
| 推論速度 | オラマより速い 2~4回(RTX 4060はQwen3.6-35Bで39.3tok/sを達成) | ベースライン速度、特にPCIe帯域幅のボトルネックは明らかです。 |
| 最初のトークンの遅延 | ダブルバッファプリフェッチによりTTFTを短縮 42–58% | 長いプロンプトの下でエキスパートをレイヤーごとに取得すると、レイテンシが高くなります。 |
| エージェントの複数ターンにわたる相互作用 | 状態の再利用によりTTFTが短縮されます 65–80% | コンテキストの変更は再計算を必要とし、結果として遅延が累積する。 |
| メモリの柔軟性 | システムは、バックグラウンドでビデオメモリをプリエンプトする際に、メモリをホットスワップまたはホットスワップすることができます。ダウンタイムなし、メモリ不足なし | ビデオメモリ不足は、CUDAメモリ不足によるクラッシュを直接引き起こします。 |
| ハードウェアコラボレーション | CPU + メモリ + PCIe + GPU の統一された柔軟なスケジューリング | これは主にGPUに依存しており、CPUの負荷軽減効率は限られている。 |
| インストール方法 | GUI App / CLI uv pip install "freetoken[accel]" |
ollama run コマンドラインワンクリックプル |
FreeTokenのアプリケーションシナリオ
-
ローカルAIコーディングエージェントClaude CodeやOpenClawなどのプログラミングエージェントをノートパソコンやゲーミングPC上でローカルに実行することで、複数回のツール呼び出しや思考連鎖の反復をサポートし、インターネット接続なしでインテリジェントなコード補完とデバッグが可能になります。
-
エンドサイド超大規模MoEモデル推論個人ユーザーは、DeepSeek-V4-Flash(284B)やGLM-5.2(753B)といった最先端のモデルを、RTX 4060/5090などの一般消費者向けシングルカード上でフルスピードで実行できるため、データセンターへの依存から解放されます。
-
高並行性マルチターン対話サービス顧客サービスや質疑応答など、頻繁なコンテキスト変更が必要となる対話シナリオでは、トークン境界チェックポイントと状態の再利用を利用することで、冗長な計算を回避し、複数ラウンドにわたる応答遅延を大幅に削減できます。
-
ゲームも仕事もこなせる、柔軟性の高いAIアシスタント。FreeTokenは、バックグラウンドで3Dレンダリング、ゲーム、開発ツールなどを実行している場合、GPUキャッシュを自動的に縮小し、計算処理をCPUに移行することで、AI推論サービスが中断されず、クラッシュしないようにします。
-
エッジデバイスの研究とプロトタイプの検証研究者は、サーバーリソースを申請することなく、研究室の一般的なワークステーション上で最新のオープンソースMoEモデルを迅速に展開およびテストできるため、大規模なモデル研究の敷居が低くなる。