AB
AiBoss
project

smoltalk-chinese - 大規模な中国語モデル向けに特別に設計されたOpenCSGオープンソース合成データセット

smoltalk-chineseは、OpenCSGが提供するオープンソースの合成データセットで、大規模な中国語モデル(LLM)向けに特別に設計されています。このデータセットには、情報検索、推論、計画、編集など、70万件を超える合成データが含まれています。

smoltalk-chineseとは何ですか?

smoltalk-chineseは、OpenCSGが提供するオープンソースの合成データセットで、中国語の大規模言語モデル(LLM)向けに特別に設計されています。このデータセットには、情報検索、推論、計画、編集、プログラミング、数学、ロールプレイング、データ分析、クリエイティブライティング、相談、ブレインストーミングなど、さまざまなタスクタイプを網羅した70万を超える合成データポイントが含まれています。これらの多様なタスクは、モデルの汎用性と適応性を高めるように設計されており、さまざまなアプリケーションシナリオで優れたパフォーマンスを発揮します。データセットの生成プロセスは、高度な生成モデルと重複排除技術を採用し、データの品質と多様性を確保するために、厳格な基準に準拠しています。

smoltalk-chineseの主な機能

  • 言語モデルのパフォーマンスを向上させるこのデータセットは、大規模な中国語モデル(LLM)向けに特別に設計されており、高品質の合成データによるモデルの教師ありファインチューニング(SFT)をサポートすることで、さまざまなタスクにおけるモデルのパフォーマンスを向上させます。
  • 多様な業務範囲このデータセットは、情報検索、推論、計画立案、編集、プログラミング、数学、ロールプレイング、データ分析、クリエイティブライティング、コンサルティング、ブレインストーミングなど、さまざまなタスクタイプを網羅しており、モデルの汎用性と適応性を高めています。
  • 高品質なデータ生成高度な生成モデルと重複排除技術に基づき、データの品質と多様性を確保し、データの重複や冗長性を回避します。
  • 複数のアプリケーションシナリオに対応日常生活における会話スタイルをシミュレートし、数学的な問題を含むデータを取り入れることで、このモデルは現実世界の応用シナリオによりよく適応できるようになる。

smoltalk-chineseの技術的原理

  • データ生成元のデータはMagpieを用いて合成され、deepseek-v2.5やqwen2.5-72b-instructなどの生成モデル、およびデータ生成用のDistilabelライブラリと組み合わせて使用されました。これらのツールとモデルの組み合わせにより、生成されたデータの豊富さと多様性が確保されました。
  • データフィルタリングqwen2-7b-instructモデルに基づき、対話データにおける最初の指示の明瞭さと流暢さを採点し、データ品質を確保するために、スコアが2以上のデータのみを保持する。
  • 重複排除対話データの最初の指示はgte-large-zhモデルを使用してエンコードされ、データの一意性と多様性を確保するために、埋め込み類似度(閾値は0.8に設定)に基づいて重複排除が実行されます。
  • データ分類と統計生成されたデータは分類され、統計的に分析されることで、その分布と特性をより深く理解することができる。

smoltalk-chinese のプロジェクトアドレス

smoltalk-chineseの応用シナリオ

  • 言語モデルの微調整このデータセットは、大規模な中国語モデルの教師ありファインチューニング(SFT)のために特別に設計されており、高品質の合成データを通じて、さまざまなタスクにおけるモデル性能の向上をサポートします。
  • 多様な業務訓練このデータセットは、情報検索、推論、計画立案、編集、プログラミング、数学、ロールプレイング、データ分析、クリエイティブライティング、コンサルティング、ブレインストーミングなど、さまざまなタスクタイプを網羅しており、これらの分野におけるテキストの理解と生成をモデルがより効果的に行うのに役立ちます。
  • 対話システムの最適化smoltalk-chineseは、現実世界のユーザーインタラクションシナリオをシミュレートすることで、対話システムに豊富なトレーニング資料を提供し、自然言語による対話をより良く理解し、生成することを可能にします。
  • 数学的推論能力の向上このデータセットには、Math23Kの中国語版からの数学問題が含まれており、モデルの数学的推論能力と問題解決能力を高めるのに役立ちます。