project
Bee - 清華大学とテンセントが共同でオープンソース化した、フルスタック、マルチモーダル、大規模モデルソリューション。
Beeは、清華大学とテンセントのHunyuanチームが共同で立ち上げた、高品質なマルチモーダル大規模言語モデル(MLLM)プロジェクトであり、オープンソースモデルにおけるデータ品質の不足によって引き起こされるパフォーマンスのボトルネックに対処します。このプロジェクトの主な貢献には、Honey-Data-1...が含まれます。
Beeとは何ですか?
Beeは、清華大学とテンセントのHunyuanチームが共同で立ち上げた、高品質なマルチモーダル大規模言語モデル(MLLM)プロジェクトであり、オープンソースモデルにおけるデータ品質の不足によって引き起こされるパフォーマンスのボトルネックに対処します。このプロジェクトの主な貢献には、約1500万の質問と回答のペアを含む高品質な教師ありファインチューニングデータセットであるHoney-Data-15Mがあり、これは多段階のクリーニングと2層思考連鎖(CoT)拡張戦略によってデータ品質を向上させます。また、透明性と再現性のあるデータ処理方法を提供するオープンソースのデータ準備パイプラインとフレームワークであるHoneyPipeとDataStudio、そしてHoney-Data-15Mでトレーニングされた8BパラメータモデルであるBee-8Bモデルがあります。Bee-8Bモデルは、複数のベンチマークテストで完全オープンソースMLLMの最先端(SOTA)記録を更新し、一部のセミオープンソースモデルと同等またはそれ以上のパフォーマンスを達成しています。
ミツバチの主な機能
-
高品質なデータセットの構築Honey-Data-15Mがリリースされました。これは、1500万個のデータポイントからなる教師ありファインチューニングデータセットで、2層のCoT(CoT)フレームワークを用いて綿密にクリーニングおよび拡張されており、データ品質を大幅に向上させ、大規模なマルチモーダルモデルのトレーニングのための強固な基盤を提供します。
-
フルスタックデータ処理パイプラインHoneyPipeとDataStudioは、データ集約やノイズフィルタリングからCoT強化まで、包括的なデータ処理アプローチを提供するオープンソースツールであり、データ準備における透明性と再現性を確保し、従来の静的データセット公開モデルを凌駕します。
-
高性能モデルのトレーニングと検証Honey-Data-15Mで学習させたBee-8Bモデルは、複数のベンチマークテストにおいて、完全オープンソースのマルチモーダル大規模言語モデルの性能記録を更新し、モデルの性能向上における高品質データの重要な役割を実証しました。
-
オープンソースのエコシステムを構築する本プラットフォームは、データセット、データ処理パイプライン、トレーニングレシピ、評価ツール、モデル重みなど、完全なオープンソースリソースを提供し、オープンソースコミュニティの発展を促進するとともに、マルチモーダル大規模モデルの分野における研究および応用において、学術機関や開発者を支援します。
Beeの技術原理
-
データ集約と重複排除複数のデータソースから多数の画像とテキストのペアを収集し、厳密な重複排除によってデータの多様性と効率的な処理を確保する。
-
ノイズフィルタリングルールとモデルを組み合わせることで、書式が間違っているデータ、低品質の画像、または指示が一致していないデータなど、ノイズの多いデータを除去し、データ品質を向上させることができます。
-
マインドチェーン(CoT)拡張短いCoT戦略と長いCoT戦略の両方を用いることで、複雑さの異なる指示に対して詳細な推論プロセスが生成され、それによってモデルの推論能力が向上する。
-
誠実性検証生成されたCoT応答の正確性と一貫性を確保するために、検証モデル(LLM-as-a-Judge)を使用して意味的な比較が行われます。
-
モデルのトレーニングと最適化Bee-8Bモデルは、高品質なデータセットであるHoney-Data-15Mで学習され、教師ありファインチューニング(SFT)や強化学習(RL)などの手法によって性能が最適化されました。
Beeのプロジェクトアドレス
- プロジェクト公式サイト:https://open-bee.github.io/
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Open-Bee/bee
- arXiv技術論文:https://arxiv.org/pdf/2510.13795
- Honey-Data-15Mデータセット:https://huggingface.co/datasets/Open-Bee/Honey-Data-15M
Beeの応用シナリオ
-
マルチモーダルコンテンツ生成これは、高品質な画像説明文や動画キャプションなどを生成するために使用され、コンテンツ作成の効率と多様性を向上させます。
-
インテリジェントな質問応答システム複雑な問題を解決する際、強力な推論能力を活用して、ユーザーに正確かつ詳細な回答を提供する。
-
教育授業を支援し、教材を作成したり、学生の質問に答えたり、個別学習をサポートしたりする。
-
研究支援これは、研究者がデータを整理・分析し、研究報告書や実験計画案を作成するのに役立ちます。
-
ビジネスインテリジェンス市場動向とユーザーからのフィードバックを分析し、意思決定のためのデータサポートと予測を提供する。
-
健康管理医療診断を支援したり、医用画像解析レポートを作成したり、医療相談のアドバイスを提供したりする。