AB
AiBoss
project

Nemotron-CC - NVIDIAによる大規模な事前学習済みデータセット

Nemotron-CCは、NVIDIAチームが公開した大規模な事前学習済みデータセットで、Common Crawlデータを長シーケンスの事前学習に適した高品質のコーパスに変換できます。Nemotron-CCデータセットは、分類器アンサンブル、合成データなどを組み合わせています。

Nemotron-CCとは何ですか?

Nemotron-CCは、NVIDIAチームが公開した大規模な事前学習データセットで、Common Crawlデータを長文シーケンスの事前学習に適した高品質のコーパスに変換します。Nemotron-CCデータセットは、分類器アンサンブル、合成データの再記述、ヒューリスティックフィルタの依存関係の削減を組み合わせることで、データ量と品質のバランスを改善しています。Nemotron-CCには6.3兆トークンが含まれており、そのうち4.4兆トークンはグローバルに重複排除された元のトークン、1.9兆トークンは合成生成されたトークンです。Nemotron-CCは、短期(1兆トークン)と長期(15兆トークン)の両方の学習において優れた性能を発揮し、特にMMLUなどのタスクでは、DCLMやLlama 3.1モデルと比較してモデル精度を大幅に向上させています。Nemotron-CCデータセットの開発により、大規模言語モデルの学習に、より豊富で多様なデータリソースが提供されます。

Nemotron-CCの主な機能

  • 高品質な事前学習済みデータセットを提供するNemotron-CCは、大規模言語モデル(LLM)向けの高品質で大規模な事前学習済みデータセットを提供します。特に、15Tトークンの学習要件など、長いシーケンスの学習に適しています。
  • データ量とデータ品質のバランスを取るこの手法は、データ品質を著しく損なうことなく、データセットのサイズを大幅に拡大し、より多くの固有かつ実際のトークンを含め、長文シーケンスの学習におけるモデルのパフォーマンスを向上させます。
  • モデルのパフォーマンス向上をサポートする実験結果によると、Nemotron-CCで学習させたモデルは、複数のベンチマークタスク、特にMMLUなどのタスクにおいて優れた性能を発揮し、既存の他のデータセットと比較してモデルの精度を大幅に向上させることができる。

ネモトロンCCの技術原理

  • テキスト抽出を最適化するJustextは、高品質なトークンを抽出する性能が優れており、データセットの初期品質を効果的に向上させるため、HTMLからテキストへの抽出ツールとして選ばれました。
  • モデルベースの品質ラベリング
    • 分類器アンサンブル私たちは、それぞれ異なる高品質基準を持つ3つの異なる品質分類器を構築します。これら3つの分類器の組み合わせに基づいて、すべての文書にスコアを付け、収集したコーパスをこれらのスコアに応じて異なる品質レベルに分類します。
    • 品質ラベルの割り当てさらに、詳細な品質スコアは、下流タスクの品質カテゴリ5つに分類されます。継続的な事前学習とタスクパフォーマンス評価に基づいて、実際のパフォーマンスにより近い品質ラベルが各カテゴリに割り当てられます。
  • 合成データ生成
    • 低品質データ修正質の低い文書の場合、書き直しによって不要な情報や誤りを減らしつつ、有用な情報を保持することができます。Wikipediaのようなプロンプトを用いて質の低い文書を書き直すことで、誤りや冗長性を効果的に削減し、書式を整えることができます。
    • 高品質データ拡張質の高い文書の場合、多様な質問と回答のペアを生成し、知識を抽出・洗練し、知識リストを作成することで、より多くの固有トークンを取得でき、それによってデータセットの内容と多様性を豊かにすることができる。
  • データセットの統合
    • 大規模データ合成Mistral NeMo 12Bモデルを使用して生成された合成トークンは1兆8000億個を超え、そのうち3363億個は低品質の文書から、1兆5000億個は高品質の文書から生成された。
    • データセットの構築上記の手法と方法をCommon Crawlの99個のスナップショット(CC-MAIN-2013-20からCC-MAIN-2024-30)に適用し、6.3兆トークンのデータセットを構築しました。そのうち4.4兆トークンはグローバルに重複排除された元のトークンであり、1.9兆トークンは合成的に生成されたトークンです。

Nemotron-CCプロジェクトの住所

Nemotron-CCの応用事例

  • 事前学習済みの大規模言語モデル15Tトークンなどの長いシーケンスの学習に適しており、複雑なタスクにおけるモデルのパフォーマンスを向上させます。
  • 微調整とタスク固有の適応これにより、モデルがマルチタスク学習やドメイン固有のタスクに迅速に適応できるようになり、タスクのパフォーマンスが向上します。
  • テキスト生成タスクニュースや物語などの高品質なテキストを生成するため、また対話システムの自然さを向上させるために使用されます。
  • 研究開発これは、モデルアーキテクチャとトレーニング方法の改善点を探るのに役立ち、ベンチマークテストのリソースを提供します。
  • 教育と訓練言語学習を支援し、教育コンテンツを充実させるための教育リソースを作成する。