project
Apertus - スイス初のオープンソース大規模言語モデル
Apertusは、スイス初の本格的なオープンな多言語言語モデルであり、EPFL、チューリッヒ工科大学、スイス国立スーパーコンピューティングセンター(CSCS)が共同開発しました。パラメータバージョンは70Bと8Bの2種類があります。
Apertusとは何ですか?
Apertusは、スイス初の大規模でオープンな多言語言語モデルであり、EPFL、ETHチューリッヒ、およびスイス国立スーパーコンピューティングセンター(CSCS)が共同開発しました。70Bおよび8Bパラメータバージョンが用意されており、スイスドイツ語やロマンシュ語など、これまでLLMで過小評価されてきた言語を含む、英語以外の言語を40%含む大規模な言語データを使用して学習されています。Apertusは、新しいxIELU活性化関数とAdEMAMixオプティマイザに基づくデコーダー専用のTransformerアーキテクチャを採用しています。このモデルは完全にオープンであり、ユーザーは自身のサーバー上でモデルの重み、データ、および学習の詳細にアクセスし、データの管理権を維持できます。
Apertusの主な機能
-
テキスト生成ユーザーの入力プロンプトに基づいて、一貫性があり関連性の高いテキストを生成します。
-
多言語対応1,811以上の言語をサポートしており、これまでLLMにおいて過小評価されてきた、あまり知られていない言語も多数含まれています。
-
透明性とオープン性モデルの重み、データ、およびトレーニングの詳細は完全に公開されており、ユーザーはそれらを自身のサーバーで使用することができます。
-
長時間のコンテキスト処理長時間のコンテキスト処理をサポートしているため、複雑なタスクに適しています。
Apertus の技術原則
- モデルアーキテクチャApertusは、デコーダのみの高密度Transformerアーキテクチャを採用しており、8Bと70Bの2種類のサイズでモデルが利用可能です。8Bモデルは32層/32アテンションヘッド、70Bモデルは80層/64アテンションヘッドを備えています。モデルの効率性と長文コンテキスト処理能力を向上させるため、xIELU活性化関数、RMSnorm正規化、RoPE位置エンコーディング、およびグループ化クエリアテンションメカニズムを採用しています。
- 事前研修の目標Goldfishの目的関数を用いることで、部分的なラベル付けをランダムにマスクし、モデルが正確な文脈マッピングを学習するのを防ぎ、単語ごとの想起を効果的に抑制しつつ、下流タスクのパフォーマンスを維持します。事前学習データは、コンテンツ所有者のオプトアウトの意思を尊重し、著作権で保護されたコンテンツ、ライセンスのないコンテンツ、有害なコンテンツ、または個人を特定できるコンテンツの使用を避けるため、すべて公開されている情報源から取得されます。
- 事前学習データApertusは、1,800以上の言語を網羅する15兆を超えるラベル付きデータセットで事前学習されています。データソースは多岐にわたり、高品質のWebクローリングデータ、コードデータ、数学データなどが含まれます。robots.txtファイル内のクローリング制限の遵守、個人識別情報や有害コンテンツの削除など、複数のフィルタリングメカニズムにより、データのコンプライアンスが確保されています。モデルの多言語対応能力とデータ多様性を向上させるため、事前学習データには英語以外のコンテンツが相当量割り当てられています。
- トレーニングプロセストレーニングは、AdEMAMixオプティマイザとWSD学習率スケジューリングを用いて実施し、トレーニングの安定性と効率性を確保しました。コンテキスト長を段階的に長くすることで、モデルはより長いテキストシーケンスを処理できるようになり、最大65,536トークンのコンテキストをサポートしました。
- トレーニング後QRPOアルゴリズムは、指示の微調整とアライメント学習を通じてモデルの動作を最適化し、テキスト生成時に安全性、有用性、そして人間の価値観との整合性を高めます。学習後の段階では、モデルは指示に沿ったテキストをより的確に理解し、生成できるようになります。
アペルタス・プロジェクトの住所
- プロジェクト公式サイト:https://www.swiss-ai.org/apertus
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/swiss-ai/apertus-llm-68b699e65415c231ace3b059
- 技術論文:https://github.com/swiss-ai/apertus-tech-report
Apertusの応用シナリオ
- 多言語対話システム多言語チャットボットやカスタマーサービスシステムなどを構築し、ユーザーに言語を越えたコミュニケーションや情報アクセスサービスを提供するのに適しています。
- コード生成と支援自然言語による記述に基づいてコードスニペットを生成することで、開発者がプログラミング作業を迅速に完了し、開発効率を向上させるのに役立ちます。ソフトウェア開発補助ツールとして最適です。
- 教育と学習支援このシステムは、教育コンテンツを生成し、学術的な質問に答え、オンライン教育プラットフォーム、インテリジェントチュータリングシステム、その他の教育シナリオで使用できる学習提案を提供する。
- コンテンツ作成記事、物語、ニュースレポートなどのテキストコンテンツの作成を支援し、コンテンツ制作者にインスピレーションを与えたり、執筆をサポートしたりする。
- 翻訳サービス翻訳業務において使用され、テキスト翻訳サービスを提供するとともに、異言語間の情報発信とコミュニケーションを支援する。