AB
AiBoss
project

Instella - 30億個のパラメータを持つAMDのオープンソース言語モデル

Instellaは、AMDが開発した30億個のパラメータを持つオープンソースの言語モデルシリーズです。このモデルは、自己回帰型Transformerアーキテクチャに基づいて、AMD Instinct™ MI300X GPU上で完全にゼロからトレーニングされ、36個のデコーダー層と3つの...

Instellaとは何ですか?

Instellaは、AMDが提供する30億個のパラメータを持つオープンソースの言語モデルシリーズです。このモデルは、AMD Instinct™ MI300X GPU上でゼロから完全にトレーニングされ、36個のデコーダー層と32個のアテンションヘッドを備え、最大4096文字のラベル付きシーケンスをサポートします。Instellaは、大規模な事前トレーニング、教師ありファインチューニング、および選好最適化を含む多段階トレーニングを経て、自然言語理解、指示の追従、および対話機能を向上させます。Instellaは、複数のベンチマークにおいて既存のオープンソースモデルを凌駕し、最先端のオープンソース加重モデルと同等の性能を発揮します。AMDは、Instellaのモデル重み、トレーニング構成、データセット、およびコードを完全にオープンソース化し、AIコミュニティ内でのコラボレーションとイノベーションを促進しています。

Instellaの主な機能

  • 自然言語理解複雑な自然言語テキストを理解し、質問応答、テキスト生成、意味解析など、さまざまな言語タスクを処理できます。
  • 指示に従ってください教師あり微調整(SFT)と直接選好最適化(DPO)に基づいて、ユーザーの指示を正確に理解して実行し、人間の好みに合致する回答を生成します。
  • 複数ターン対話機能複数ターンのやり取りをサポートし、文脈に基づいた一貫性のある対話を可能にします。
  • 問題解決能力彼らは、数学の問題、論理的推論、知識に基づく質問への回答といった課題において優れた能力を発揮する。
  • マルチドメイン適応性多様な学習データに基づいて、学術、プログラミング、数学、日常会話など、複数の分野に適応します。

インステラの技術原則

  • トランスフォーマーアーキテクチャ自己回帰型Transformerアーキテクチャに基づいており、36個のデコーダー層で構成され、各層には32個のアテンションヘッドがあり、最大4096ラベルのシーケンス長をサポートしています。
  • 高効率トレーニング技術:FlashAttention-2、Torch Compile、およびbfloat16混合精度トレーニングを使用して、メモリ使用量と計算効率を最適化します。
  • 多段階トレーニングこのシステムは、基本的な言語理解能力を確立するために、4兆650億個のタグを用いて大規模な事前学習を行います。その後、最初の段階に基づいて、さらに575億7500万個のタグを使用して、タスク固有の能力を強化するための追加学習が実施されます。
  • 監視型微調整(SFT)高品質なコマンド・レスポンスのペアを用いてデータを微調整し、コマンド追従能力を向上させる。
  • 直接選好最適化(DPO)このモデルは、人間の嗜好データに基づいて最適化されており、出力が人間の価値観により合致するように設計されている。
  • 分散型トレーニング完全シャーディングデータ並列処理(FSDP)技術に基づき、モデルパラメータ、勾配、およびオプティマイザの状態はノード内でシャーディングされ、ノード間でコピーされることで、大規模なクラスタトレーニングを実現します。
  • データセット学習は、学術データ、プログラミングデータ、数学データ、会話データ、合成データセットなど、多様で質の高いデータセットに基づいて行われ、モデルが幅広い知識と能力を備えることを保証します。

Instellaのプロジェクト住所

Instellaのアプリケーションシナリオ

  • インテリジェントな顧客サービス質問に自動的に回答し、パーソナライズされたサービスを提供し、顧客体験を向上させます。
  • コンテンツ作成コンテンツ制作者の効率向上を支援するため、コピーやストーリーなどを生成する。
  • 教育指導学業に関する質問に答えたり、学習に関するアドバイスを提供したり、学生の学習を支援したりする。
  • プログラミング支援ツールコードスニペットを生成し、プログラミングに関する提案を行い、開発者が問題を解決するのを支援します。
  • エンタープライズ知識管理企業知識を統合し、社内コンサルティングを提供し、コラボレーションの効率性を向上させる。