project
Bamba-9B - Mamba2アーキテクチャに基づいたデコード専用言語モデル
Bamba-9Bは、IBM、プリンストン大学、カーネギーメロン大学、イリノイ大学アーバナ・シャンペーン校が共同開発したMamba2アーキテクチャに基づく、デコード専用の言語モデルです。このモデルは完全にオープンなデータセットで学習されており、…
Bamba-9Bとは何ですか?
Bamba-9Bは、IBM、プリンストン大学、カーネギーメロン大学、イリノイ大学アーバナ・シャンペーン校が共同開発したMamba2アーキテクチャに基づく、デコード専用の言語モデルです。完全にオープンなデータセットで学習されたこのモデルは、大規模言語モデルの推論効率を向上させ、特に長文テキスト処理時のメモリ帯域幅のボトルネックを解消します。Bamba-9Bは、推論時に標準的なトランスフォーマーモデルと比較して、スループットが2.5倍、レイテンシが2倍向上しています。このモデルは2.2兆トークンを使用して学習されており、この新しいアーキテクチャの可能性をさらに検証するとともに、最先端のトランスフォーマーモデルと同等の競争力を維持しながら、より高い推論効率を実現しています。
Bamba-9Bの主な機能
- 推論効率を向上させるBamba-9B設計の主な目的は、推論時の大規模言語モデルの効率を向上させることであり、特に長文処理時のメモリ帯域幅のボトルネックに対処することである。
- スループットとレイテンシの最適化標準コンバーターモデルと比較して、Bamba-9Bは推論時のスループットが2.5倍向上し、レイテンシが2倍高速化されます。
- オープンデータセットでのトレーニングBamba-9Bは完全にオープンデータセットで学習されているため、コミュニティは透明性と再現性を確保しながら実験を行うことができます。
- マルチプラットフォーム対応Bamba-9Bは、以下のような複数のオープンソースプラットフォームでの使用をサポートしています。
transformers、vLLM、TRLそしてllama.cpp。
Bamba-9Bの技術原理
- ハイブリッドMamba2アーキテクチャMamba2アーキテクチャをベースにした、メモリ帯域幅のボトルネックを解消するために一定のKVキャッシュサイズを可能にする、新興アーキテクチャ。
- 定数KVキャッシュKVキャッシュに必要なメモリ量はコンテキスト長とともに増加するが、Mamba2アーキテクチャはKVキャッシュのサイズを一定に保つことでこの問題を解決している。
- 2段階トレーニング方法2段階の学習方法を採用する。第1段階ではDolma v1.7データセットを用いて学習を行い、第2段階ではFineweb-eduやCosmopediaなどの高品質なデータセットを用いて学習を行う。
- データローダー大規模な分散トレーニングをサポートし、Torch Titanと統合する、分散型で状態に依存しないデータローダーを紹介します。
- 定量的技術LLM圧縮器に基づいてモデルを量子化するモデル量子化をサポートします。
fp8これにより、モデルサイズが縮小し、推論速度が向上し、精度も維持されます。 - コンテキスト長拡張Bamba-9Bは、長いコンテキストの長さを拡張するための方法を模索しており、例えば、より長いコンテキストを処理するために、アテンションレイヤー全体にLongRopeを適用するなどの方法を検討している。
バンバ9Bプロジェクトの住所
- GitHubリポジトリ:https://github.com/foundation-model-stack/bamba
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/ibm-fms/bamba
Bamba-9Bの応用事例
- 機械翻訳これにより、即時言語翻訳サービスが可能になり、ユーザーは言語の壁を克服し、異なる言語のコンテンツを理解したり、コミュニケーションをとったりできるようになります。
- インテリジェントな顧客サービスチャットボットの基盤技術として、迅速かつ自然な会話応答を提供し、顧客サービス体験を向上させます。
- コンテンツのおすすめコンテンツプラットフォームでは、ユーザーの過去の行動履歴や好みに基づいて、パーソナライズされたコンテンツのおすすめリストが生成されます。
- 自動要約長文の記事やレポートを読み込み、重要な情報を自動的に抽出し、ユーザーの読書時間を節約するために短い要約を生成します。
- ソーシャルメディアのモニタリングソーシャルメディア上の多数の投稿やコメントを分析することで、ブランドが自社のイメージや市場動向を把握できるよう支援します。