AB
AiBoss
project

オープンソースのマルチモーダルAIモデルシリーズであるLlama 4 - Metaが、オープンソースの王座を奪還する。

Llama 4は、オープンソース開発者であるMetaによるマルチモーダルAIモデルシリーズです。ハイブリッドエキスパート(MoE)アーキテクチャを初めて採用し、トレーニングと推論時の計算効率が向上しました。Llama 4には現在、ScoutとMaverickの2つのバージョンがあります。Scout...

ラマ4とは何ですか?

Llama 4 は Meta がオープンソース化したマルチモーダル AI モデルシリーズです。ハイブリッドエキスパート (MoE) アーキテクチャを初めて採用し、トレーニングと推論時の計算効率が向上しました。Llama 4 には現在 Scout と Maverick の 2 つのバージョンがあります。Scout は 170 億のアクティブ パラメータ、16 の「エキスパート」モデル、合計 1090 億のパラメータを持ち、1000 万のコンテキストをサポートし、20 時間以上のビデオを処理でき、単一の H100 GPU で実行でき、Gemma 3 などのモデルを凌駕します。Maverick は 170 億のアクティブ パラメータ、128 の「エキスパート」モデル、合計 4000 億のパラメータを持ち、正確な画像認識とクリエイティブ ライティングに優れており、一般的なアシスタントやチャット アプリケーションに適しており、大規模モデルの LMSYS リーダーボードで 2 位にランクされています。Llama 4 Behemoth はまだトレーニング中のプレビュー バージョンで、2 兆のパラメータを持ち、STEM ベンチマーク テストで優れたパフォーマンスを発揮します。 Llama 4は、200言語にわたる30兆トークン以上の学習データを用いた事前学習によるオープンソースのファインチューニングをサポートしています。

Llama 4の主な特徴

  • 強力な言語理解および生成機能大量のテキストデータで学習されたこのシステムは、高い言語理解能力を誇ります。創作、記事執筆、対話など、様々な用途に適した、一貫性のある論理的なテキストを生成できます。例えば、物語作成においては、与えられたテーマや筋書きの手がかりに基づいて、豊かで生き生きとした物語コンテンツを生成できます。対話シナリオにおいては、ユーザーの意図を理解し、適切な応答を提供できます。
  • マルチモーダル処理機能画像データで学習されたこのシステムは、画像理解能力を備えており、画像内の物体、シーン、色、その他の要素を認識し、画像コンテンツを記述・分析することができます。Scoutバージョンはコンテキストウィンドウで1,000万トークンをサポートし、数百万語のテキストを処理できるため、長文ドキュメントの要約や大規模なコードベースに基づく推論などのタスクに適しています。
  • 非常に効率的な推論能力と計算能力ハイブリッドエキスパート(MoE)アーキテクチャは、モデルを複数のタスク固有の「エキスパート」サブモデルに分割することで、トレーニングやユーザーからのクエリへの応答をより効率的に行い、モデルサービスのコストと遅延を削減し、推論効率を向上させます。
  • 多言語処理機能200の言語で事前学習を行うことで、複数の言語でテキストを処理・生成することができ、言語翻訳、分析、異なる言語でのテキスト生成といった異言語間のコミュニケーションや処理タスクをサポートし、ユーザーが言語の壁を克服するのに役立ちます。

Llama 4の技術原理

  • ハイブリッドエキスパート(MoE)アーキテクチャLlama 4 は、Llama シリーズで初めて MoE アーキテクチャを採用したモデルです。MoE モデルでは、単一のトークンでアクティブ化されるパラメータは全体のごく一部のみです。たとえば、Llama 4 Maverick モデルでは、合計 4,000 億個のパラメータのうち、アクティブなパラメータは 170 億個です。推論効率を向上させるため、Meta は高密度レイヤーと MoE レイヤーを交互に使用します。MoE レイヤーでは、128 個のルーティング エキスパートと 1 つの共有エキスパートを使用します。各トークンは共有エキスパートと 128 個のルーティング エキスパートのいずれかに送信されます。これにより、モデルの実行時にアクティブ化されるパラメータはごく一部のみとなり、推論効率が向上し、モデル サービスのコストとレイテンシが削減されます。
  • ネイティブマルチモーダルデザインLlama 4は、テキストとビジュアルトークンをシームレスに統合する早期融合技術を採用したネイティブなマルチモーダルモデルです。大量のラベルなしテキスト、画像、ビデオデータを使用して事前学習が可能です。Metaは、MetaCLIPをベースとし、固定されたLlamaモデルとは別に学習されたLlama 4のビジュアルエンコーダーをアップグレードしました。これにより、エンコーダーのチューニング精度が向上し、大規模言語モデル(LLM)への適応性も向上しました。
  • モデルのハイパーパラメータ最適化Meta社は、学習率やレイヤーごとの初期化サイズなど、主要なモデルハイパーパラメータをより確実に設定できるMetaPトレーニング手法を開発しました。これらのハイパーパラメータは、さまざまなバッチサイズ、モデルの幅、深さ、トレーニングトークン数に適切に適応します。
  • 効率的なモデルトレーニングFP8精度を採用することで、品質を損なうことなくモデルの高いFLOPs利用率を確保できます。例えば、Llama 4 BehemothモデルをFP8精度と32K個のGPUで事前学習させた場合、GPUあたり390TFLOPSのパフォーマンスが達成されました。学習データには、テキスト、画像、動画データセットを網羅した30兆トークン以上が含まれています。モデルは「中間学習」によってさらに学習され、特殊なデータセットで長いコンテキストを拡張してコア機能を強化し、Llama 4 Scoutで業界トップクラスの1000万の入力コンテキスト長を実現しました。
  • トレーニング後のプロセス最適化トレーニングプロセスは次のとおりです。軽量教師ありファインチューニング (SFT) > オンライン強化学習 (RL) > 軽量直接選好最適化 (DPO)。SFT と DPO がモデルを過度に制限する可能性があるという問題に対処するため、Meta では評価者として Llama モデルを使用し、「easy」とラベル付けされたデータの 50% 以上を削除し、残りのより難しいデータに対して軽量 SFT を実行し、マルチモーダルオンライン RL フェーズ中に、より難しいプロンプトを慎重に選択し、モデルのトレーニングとデータフィルタリングを交互に行う継続的なオンライン RL 戦略を実装し、中程度から高難易度のプロンプトを保持し、最後に軽量 DPO を実行してモデルの知能と会話能力のバランスを取ります。

ラマ4プロジェクトの住所

Llama 4の応用事例

  • 対話システムLlama 4は、Maverickのようなインテリジェントなチャットボットの構築に使用でき、一般的なAIアシスタントやチャットアプリケーションに適しています。ユーザーの質問を理解し、自然で流暢な回答を生成したり、情報を提供したり、質問に答えたり、チャットしたりできます。
  • テキスト生成物語、詩、脚本などの創作活動を行うことができ、ニュース記事、製品説明、コピーライティングなどにも使用でき、与えられたテーマや要件に基づいて高品質なテキストを生成します。
  • コード生成と支援これは、開発者が機能説明に基づいて対応するコードスニペットや完全なプログラムを生成するのに役立ちます。また、コードの説明、コメントの生成、コードスタイルのチェックなどの補助機能を提供し、開発効率を向上させることもできます。
  • コードの理解と分析Scoutは大規模なコードベースに基づいて推論を実行できるため、開発者が複雑なコードベースのロジックと機能を理解し、コードレビューや脆弱性検出などのタスクを実行するのに役立ちます。
  • 画像の理解と説明Maverickは、画像認識の精度に優れており、画像内の物体、シーン、色、その他の要素を認識し、画像内容を記述・分析することができます。例えば、写真の内容を説明したり、撮影場所を特定したりすることが可能です。
  • 情報検索と推薦言語理解能力と言語生成能力を組み合わせることで、情報検索システムにおいて、ユーザーの検索意図を理解し、より正確な検索結果を提供し、ユーザーの興味や行動に基づいてパーソナライズされた推奨事項を提供するのに活用できる。