project
DeepSpeed-MII - Microsoft の DeepSpeed 用オープンソースモデル推論ライブラリ
DeepSpeed-MIIは、DeepSpeedチームが開発したオープンソースのPythonライブラリで、効率的なモデル推論を実現します。DeepSpeed-MIIは、ブロッキングキーバリューキャッシュ、シーケンシャルバッチ処理、動的SplitFuseなどの革新的な技術を用いて、推論パフォーマンスを大幅に向上させます。
DeepSpeed-MIIとは何ですか?
DeepSpeed-MIIは、DeepSpeedチームが開発したオープンソースのPythonライブラリで、効率的なモデル推論を実現します。DeepSpeed-MIIは、ブロッキングキーバリューキャッシュ、シーケンシャルバッチ処理、動的SplitFuseなどの革新的な技術を用いて推論スループットを大幅に向上させ、レイテンシを削減することで、大規模な言語モデルの処理において卓越したパフォーマンスを発揮します。DeepSpeed-MIIは、Llama、Falcon、Phi-2など、幅広いモデルアーキテクチャをサポートし、高性能CUDAカーネルによるGPUアクセラレーションを実現します。また、マルチGPU並列処理とRESTful APIをサポートしているため、他のシステムとの統合が容易で、高性能な推論シナリオに最適な選択肢となります。
DeepSpeed-MIIの主な機能
-
高性能推論最適化ブロッキングキーバリューキャッシング、連続バッチ処理、動的スプリットフューズ、高性能CUDAカーネルなどの技術を採用することで、高スループットかつ低遅延の推論性能を実現し、大規模言語モデルの推論効率を大幅に向上させます。
-
幅広いモデルサポート37,000種類以上のモデルをサポートしており、Llama、Falcon、Phi-2など、さまざまな人気アーキテクチャを網羅しています。また、Hugging Faceのエコシステムとの統合もサポートしているため、ユーザーは事前学習済みモデルをすばやくロードして使用できます。
-
柔軟な導入方法非永続的なパイプライン(迅速なテストに適している)と永続的なデプロイメント(本番環境に適している)を提供し、RESTful API を介した推論をサポートし、他のシステムとの統合を容易にします。
-
並列化とスケーラビリティテンソル並列処理と複数のGPU間でのモデル複製をサポートし、負荷分散技術によってスループットと可用性をさらに向上させ、ハードウェアリソースを最大限に活用します。
-
豊富なカスタマイズオプションユーザーは推論中に生成パラメータ(最大長、サンプリング戦略など)を柔軟に調整でき、多様なビジネスニーズに対応するためにカスタムのデプロイメント名とポート番号をサポートしています。
-
使いやすさと統合性PyPI を介した迅速なインストールを可能にすることで導入プロセスを簡素化し、DeepSpeed エコシステムとシームレスに統合することで、テクノロジー スタックの一貫性を維持します。
DeepSpeed-MIIの使い方
-
DeepSpeed-MIIをインストールしてくださいPyPI経由でインストールして実行
pip install deepspeed-miiインストールが完了しました。 -
非永続的なデプロイメント:使用
mii.pipeline()モデル名またはパスを渡すことで推論パイプラインを作成し、モデル推論を迅速にテストできます。 -
永続的なデプロイメント:合格
mii.serve()永続的なサービスを可能にし、本番環境に適しています。また、複数のクライアントからの同時クエリをサポートします。 -
マルチGPU並列処理:設定
tensor_parallelパラメータ設定、複数のGPUを使用して推論性能を向上させる。 -
モデルの複製と負荷分散:設定
replica_numパラメータは、複数のモデルレプリカを起動し、負荷分散を組み合わせることでスループットを向上させるように設定されています。 -
RESTful APIを有効にする:合格
enable_restful_api=True他のシステムとの容易な統合とHTTPリクエストのサポートのために、RESTful APIを有効にしてください。 - サービス停止: 電話
pipe.destroy()非永続的なパイプを閉じるか、client.terminate_server()永続的なサービスを無効にします。
DeepSpeed-MIIプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/deepspeedai/DeepSpeed-MII
DeepSpeed-MIIの応用シナリオ
-
大規模言語モデル推論LlamaやFalconといった大規模な言語モデルを用いてテキスト生成タスクを効率的に処理するため、高いスループットと低いレイテンシが求められるシナリオに適しています。
-
コンテンツの作成と生成これにより、コンテンツ制作、コピーライティング、クリエイティブライティングなどの分野において、高品質なテキストコンテンツを迅速に生成することが可能になります。
-
インテリジェントな顧客サービスおよび対話システムこれは、インテリジェントな顧客サービスやチャットボット向けに、リアルタイムで効率的なテキスト応答機能を提供し、ユーザーエクスペリエンスを向上させます。
-
マルチモーダルアプリケーション画像や音声などのマルチモーダル入力を組み合わせて、関連するテキストによる説明や解説を生成するため、インテリジェントアシスタントやマルチメディアコンテンツの生成に適しています。
-
エンタープライズアプリケーション企業内では、レポート作成、データ分析、解釈などを自動化するために使用され、それによって業務効率と意思決定支援を向上させる。