project
CCI 3.0 - 人工知能研究院が公開した大規模な中国語インターネットコーパス。
CCI 3.0は、北京人工知能研究院(BAAI)が公開した大規模な中国語インターネットコーパスで、1000GBのデータセットと498GBの高品質サブセットであるCCI 3.0-HQが含まれています。このバージョンは、CCI 2.0と比較してデータ規模がほぼ1倍に拡大されています。
CCI 3.0とは何ですか?
CCI 3.0は、北京人工知能研究院(BAAI)が公開した大規模な中国語インターネットコーパスで、1000GBのデータセットと498GBの高品質サブセットであるCCI 3.0-HQが含まれています。このバージョンは、データ量でCCI 2.0のほぼ2倍のサイズであり、データソースの数は20以上に増加し、データの網羅性と代表性が向上しています。CCI 3.0には、ニュース、ソーシャルメディア、ブログなど複数の分野を網羅する2億6800万以上のウェブページが含まれています。CCI 3.0は、文法、構文、教育レベルなど10以上の次元を網羅する生データの綿密な分類とラベル付けを行い、価値の高いデータをフィルタリングしています。
CCI 3.0の主な機能
- データ規模とデータソースCCI 3.0は、1000GBのデータ量を誇り、2億6800万ページを超えるウェブページを網羅し、ニュース、ソーシャルメディア、ブログなど複数の分野をカバーしています。データソースとなる組織の数は20以上に拡大し、データの網羅性と代表性が向上しました。
- 細かい注釈CCI 3.0は、文法、構文、教育レベルなど10以上の側面を網羅し、生データを綿密に分類・ラベル付けし、価値の高いデータをフィルタリングします。
- 高品質なサブセットCCI 3.0には、70Bモデルに基づいてサンプルを自動的にラベル付けした後、小型の品質モデルをトレーニングすることで得られる、498GBの高品質サブセットであるCCI 3.0-HQが含まれています。これにより、さまざまな業界やアプリケーションシナリオのニーズをより的確に満たすことができます。
- データ処理ルール構築プロセスにおいて、CCI 3.0は、ルールベースのフィルタリング(キーワードフィルタリング、スパムフィルタリングなど)、モデルベースのフィルタリング(低品質コンテンツのフィルタリングなど)、データ重複排除(データセット内およびデータセット間の重複排除を含む)などの手法を用いて、データの品質とセキュリティを確保します。
CCI 3.0の技術的利点
- 顕著なトレーニング効果1000億のデータを用いて異なるデータセットでゼロから学習を行う実験を比較した結果、CCI 3.0は、中国語のみのコーパスでの学習と中国語と英語の混合コーパスでの学習の両方において、他のデータセットよりも優れた性能を示し、CCI 3.0 HQはさらに優れた性能を発揮することがわかった。
- 共同構築と共有の概念CCI 3.0のリリースは、データの共同構築と共有を促進し、大規模で高品質かつ知識密度の高い中国語データセットを構築し、中国の人工知能産業の発展に貢献する。
- 入手するための便利な方法CCI 3.0データセットは、Flopsera、Huggingface、Datahubなどのプラットフォームからダウンロードできるため、研究者や開発者にとって使いやすいものとなっている。
CCI 3.0プロジェクトの住所
- プロジェクト公式サイト:http://open.flopsera.com/flopsera-open/data-details/BAAI-CCI3
CCI 3.0の適用シナリオ
- 自然言語処理(NLP)研究CCI 3.0は、テキスト分類、感情分析、機械翻訳、質問応答システム、テキスト要約など、さまざまな自然言語処理タスクに使用できます。
- 大規模モデルトレーニングCCI 3.0の大規模データセットは、大規模な言語モデルの学習に適しており、中国語環境におけるモデルの性能と精度を向上させます。
- コンテンツ推薦システムCCI 3.0のコーパスデータに基づいて、パーソナライズされたコンテンツ推薦のための、より精度の高いユーザー行動予測モデルを訓練することができる。
- 知識グラフの構築CCI 3.0に含まれる大量のテキストを分析することで、重要な情報を抽出して知識グラフを構築することができ、これは検索エンジンの強化やインテリジェントアシスタントの知識ベースの改善などに活用できる。
- 教育と学術研究CCI 3.0は学術研究のための資料として活用でき、研究者が中国語の特徴や変化の傾向を研究するのに役立つ。