AB
AiBoss
project

ChildMandarin - 智源と南開大学が共同開発した、幼児向け中国語音声データセット。

ChildMandarinは、北京人工知能研究院(BAAI)と南開大学コンピュータサイエンス学部人間言語技術研究所(HLT Lab)が共同開発した、3歳から5歳までの子供向け中国語音声データセットです。このデータセットには41.25時間分の音声データが含まれています。

ChildMandarinとは何ですか?

ChildMandarinは、北京人工知能研究院(BAAI)と南開大学コンピュータサイエンス学部人間言語技術研究所(HLT Lab)が共同開発した、3~5歳児向けの中国語音声データセットです。このデータセットには、中国の22の省級行政区に住む397人の子どもから収集した41.25時間分の音声データが含まれており、男女比は均等です。データはスマートフォンを使用して録音され、高音質を実現しています。ChildMandarinの特長は、親が誘導する対話を用いて自然なコミュニケーションシナリオをシミュレートすることで、自然でリアルな対話を実現している点です。このデータセットは、幼児期の音声研究におけるギャップを埋め、子どもの音声認識、言語発達研究、そしてインテリジェントな音声対話システムの開発を促進します。

ChildMandarinの主な機能

  • 音声認識このシステムは、3歳から5歳までの子供たちの自然な音声データを大量に提供することで、子供の音声認識の精度と安定性を向上させます。
  • 話者確認話者照合(SV)タスクをサポートし、異なる子供の声を識別・区別するのに役立ち、子供の身元確認などのシナリオで使用できます。
  • 言語研究子どもの言語発達に関する研究のためのデータ支援を提供し、子どもの言語学習ツールやインタラクティブな教育システムの開発を支援する。

ChildMandarinの技術原則

  • データ収集親が主導する対話方式を採用し、自然なコミュニケーションシナリオをシミュレートすることで、音声データの信憑性と自然さを確保しています。データ収集は中国の22の省級行政区を対象とし、地域ごとのアクセントの多様性を網羅しています。録音にはスマートフォン(AndroidおよびiPhone)を使用し、サンプリングレート16kHz、16ビット精度で高音質を実現しています。
  • データラベル付け専門の文字起こし担当者による手動注釈には、子供の発音、間、繰り返しといった自然言語現象が含まれます。話者の年齢、性別、出生地、録音機器、アクセントレベルなどの情報も注釈されます。
  • モデルのトレーニングと評価本システムは、CTC、AED、RNN-Tなどの手法に基づき、Transformer、Conformer、Paraformerといった様々なASRモデルを学習および評価に用います。HuBERTやWhisperなどの事前学習済みモデルは、大規模データで学習した特徴量を用いて微調整され、子供の音声認識性能を向上させます。話者埋め込み抽出モデル(x-vector、ECAPA-TDNN、ResNet-TDNNなど)は、話者照合タスクに使用され、子供の音声に対するモデルの性能を評価します。
  • データセット設計データセットは、モデルのトレーニングと評価の科学的厳密性と有効性を確保するために、トレーニングセット、検証セット、テストセットに分割されています。多様なデータ収集および注釈方法により、データセットは年齢、性別、地域、アクセントの異なる子どもたちの発話を網羅しています。

ChildMandarinのプロジェクトアドレス

ChildMandarinの応用事例

  • 子供向け言語学習ツール子どもたちが言語の発音、語彙、文法を学ぶのに役立つ、音声アシスタント機能を備えたインテリジェントなツールを開発し、それによって子どもたちの言語能力を向上させる。
  • インタラクティブ教育システム子供向け教育ソフトウェアやインタラクティブ学習プラットフォームに音声対話機能を提供し、学習プロセスをより鮮やかで興味深いものにします。
  • スマート玩具の開発スマート玩具の音声認識機能を強化し、子供たちの音声コマンドをより正確に理解し、インタラクティブな体験を向上させる。
  • 音声アシスタントの最適化音声アシスタント(スマートスピーカーや携帯電話の音声アシスタントなど)の子供の声に対する認識と応答性を向上させ、子供がより安全に利用できるようにすること。
  • 小児の健康管理子どもの言語発達と健康状態をモニタリングし、早期介入を支援するため。