project
DCLM-7B - Appleとそのパートナーチームによって開発されたオープンソースのミニチュアモデル。
DCLM-7Bは、Appleの研究チームとの共同開発により開発された、70億個のパラメータを持つ小型のオープンソースモデルです。その性能はMistral-7Bを凌駕し、Llama 3やGemmaに匹敵します。最近、AppleはDataComp-LM(DCLM)プロジェクトの研究機関として…
DCLM-7Bとは何ですか?
DCLM-7Bは、Appleの研究チームが開発した70億パラメータのオープンソース小型モデルです。その性能はMistral-7Bを凌駕し、Llama 3やGemmaに匹敵します。最近、AppleはDataComp-LM(DCLM)プロジェクトの研究機関の一つとして、Hugging Face上でDCLM-7Bオープンソースモデルを公開しました。240TBのCommon Crawlデータに基づき、標準化されたDCLM-POOLおよびOpenLMフレームワークを使用して事前学習されたこのモデルは、5ショットMMLU精度で64%を達成し、優れた学習効率を示しました。DCLM-7Bのオープンソース公開には、重み、学習コード、データセットが含まれており、LLMオープンソースコミュニティの発展に貢献するとともに、データ駆動型モデル研究の新たなベンチマークとなる高品質データセットDCLM-BASELINEを提供します。
DCLM-7Bの技術原理
- 大規模データセットDCLM-7Bは、Common Crawlから抽出された240兆トークンからなる標準化されたコーパスを使用しており、モデルに豊富なトレーニングデータを提供している。
- データフィルタリング大規模データセットから高品質な訓練データを選択するためにモデルベースのフィルタリング手法を用いることは、DCLM-7Bを構築する上で重要なステップである。
- OpenLMフレームワークDCLM-7BはOpenLMフレームワークに基づき、効果的な事前学習スキームを採用し、標準化された学習プロセスとハイパーパラメータ設定を提供します。
- 標準化された評価DCLM-7Bは、53の下流タスクについて標準化された評価を受け、これによりトレーニングセットの利点と限界を定量化することが可能になった。
- モデルアーキテクチャDCLM-7Bは、デコーダーのみのTransformerモデルアーキテクチャを採用しています。これは、言語モデルで一般的に使用される深層学習アーキテクチャです。
- トレーニングの最適化トレーニング中、DCLM-7Bはz損失などの特定の最適化手法を使用して、出力ロジットの数値的安定性を維持します。
- マルチスケールトレーニングDCLM-7Bは、412Mから7Bパラメータまでのさまざまな計算規模で学習されており、これにより、異なる学習規模がモデルのパフォーマンスに与える影響を理解するのに役立ちます。
DCLM-7Bのプロジェクト住所
- プロジェクト公式サイト:https://huggingface.co/apple/DCLM-7B
- GitHubリポジトリ:https://github.com/mlfoundations/dclm
- arXiv技術論文:https://arxiv.org/pdf/2406.11794
DCLM-7Bはどのようなユーザーに適していますか?
- AI研究者自然言語処理と機械学習を専門とする科学者および研究者。
- ソフトウェア開発者高度な言語処理機能をアプリケーションに統合する技術者。
- データアナリスト大量のテキストデータを処理・分析し、知見を得る専門家。
- 教育技術の専門家教育ツールやインタラクティブな学習体験を開発する教育者。
- 企業の意思決定者ビジネスプロセスを最適化し、顧客サービスを向上させるためにAIを活用するビジネスリーダー。