project
Grok-1 - イーロン・マスク氏のxAIが開発した、3140億個のパラメータを持つ大規模なオープンソースモデル。
Grok-1は、イーロン・マスクが設立したAIスタートアップ企業xAIが開発した大規模言語モデルです。3140億個のパラメータを持つハイブリッドエキスパート(MoE)モデルであり、パラメータ数において最大のオープンソース言語モデルとなっています。
Grok-1とは何ですか?
Grok-1は、イーロン・マスク氏が設立したAIスタートアップ企業xAIが開発した大規模言語モデルです。3140億個のパラメータを持つハイブリッドエキスパート(MoE)モデルであり、パラメータ数において最大のオープンソース言語モデルとなっています。Grok-1の開発とトレーニングはオープンソースの原則に基づいて行われ、その重みとネットワークアーキテクチャはApache 2.0ライセンスの下で公開されているため、ユーザーは個人利用および商用利用を問わず、自由に利用、変更、配布することができます。
Grok-1公式サイトへの入り口
- 公式記事の紹介:https://x.ai/blog/grok-os
- GitHubアドレス:https://github.com/xai-org/grok-1
- ハグの顔宛:https://huggingface.co/xai-org/grok-1
- モデル重量のダウンロード:
magnet:?xt=urn:btih:5f96d43576e3d386c9ba65b883210a393b68210e&tr=https%3A%2F%2Facademictorrents.com%2Fannounce.php&tr=udp%3A%2F%2Ftracker.coppersurfer.tk%3A6969&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce
Grok-1モデル情報
xAIの公式モデル紹介によると(https://x.ai/model-card/Grok-1に関する情報は以下のとおりです。
| プロジェクト | 詳細情報 |
|---|---|
| モデルの詳細 | Grok-1は、次のトークン予測用に事前学習されたTransformerベースの自己回帰モデルです。このモデルは、人間からの広範なフィードバックと、以前のGrok-0モデルを使用してファインチューニングされました。Grok-1の初期バージョンは、コンテキスト長が8192トークンで、2023年11月にリリースされました。 |
| 使用目的 | Grok-1は、質問への回答、情報検索、クリエイティブライティング、コーディング支援などの自然言語処理タスクを実行するGrokチャットボットのエンジンとして機能するように設計されています。 |
| 制限 | Grok-1は情報処理能力に優れていますが、その正確性を確保するためには人間のレビューが必要です。Grok-1の言語モデルは、ネットワークを独自に検索する機能を備えていません。Grok内で検索ツールやデータベースを導入することで、モデルの能力と正確性が向上します。外部の情報源にアクセスできたとしても、モデルが誤った情報を生成する可能性は依然としてあります。 |
| トレーニングデータ | Grok-1のリリースで使用されているトレーニングデータは、インターネット上のデータと、xAIのAIトレーナーが2023年第3四半期までに提供したデータに基づいています。 |
| 評価する | Grok-1は、さまざまな推論ベンチマークタスクと、厳選された海外の数学試験問題で評価されました。xAIは、敵対的テストを含むGrok-1バージョンの評価を行うため、早期アルファテスターに連絡を取りました。xAIは、クローズドベータテストの準備として、Grok早期アクセスを通じて早期導入者プールを拡大しています。 |
Grok-1の技術詳細
- 基本モデルとトレーニングGrok-1は、特定のタスクに合わせて微調整することなく、大量のテキストデータで学習されています。つまり、さまざまな自然言語処理タスクに適用できる汎用的な言語モデルです。学習は、JAXライブラリとRust言語からなる独自の学習スタックを使用して、ゼロから行われます。
- パラメータの数Grok-1は3140億個のパラメータを持ち、パラメータ数において最大のオープンソース言語モデルとなっています。これらのパラメータが特定のトークンに対して持つ活性化重みは25%であり、モデルの規模と複雑さを示しています。
- ハイブリッドエキスパートモデル(MoE)Grok-1は、複数のエキスパートネットワークを組み合わせることでモデルの効率とパフォーマンスを向上させるハイブリッドエキスパートシステム設計を採用しています。Grok-1では、各トークンは8つのエキスパートの中から2つのエキスパートを選択することによって処理されます。
- 活性化パラメータGrok-1は860億個の活性化パラメータを持ち、Llama-2の700億個を上回っており、言語タスクにおける潜在能力を示している。
- 埋め込みと位置埋め込みGrok-1は、固定位置埋め込みではなく回転埋め込みを使用します。これは、連続データを処理する手法であり、モデルの長文テキスト処理能力を向上させます。トークナイザーの語彙サイズは131,072で、GPT-4と同程度です。埋め込みサイズは6,144です。
- トランスフォーマー層このモデルは64個のTransformer層で構成されており、各層にはデコーダー層があり、マルチヘッドアテンションブロックと密結合ブロックからなります。マルチヘッドアテンションブロックは、クエリ用に48個のヘッド、キー/値ペア(KV)用に8個のヘッドを持ち、KVのサイズは128です。密結合ブロック(密結合フィードフォワードブロック)の拡張係数は8で、隠れ層のサイズは32,768です。
- 定量化Grok-1は重みに対して8ビット量子化も提供しており、これによりモデルのストレージと計算要件が削減され、リソースが限られた環境での実行により適したものとなっている。
- 動作要件Grok-1は大規模なモデル(パラメータ数314B)であるため、実行には十分なGPUメモリを搭載したマシンが必要です。パラメータ1つあたり2バイト、合計628GBのGPUメモリを搭載したマシンが必要になると推定されます。