AB
AiBoss
project

Phi-3 - マイクロソフトの最新世代小型模型キット

Phi-3は、Microsoft Researchが開発した次世代の高度な小型言語モデルで、phi-3-mini、phi-3-small、phi-3-mediumの3つの異なるサイズがあります。これらのモデルは、小さなパラメータサイズを維持しながら、...

ファイ3とは何ですか?

Phi-3は、Microsoft Researchが開発した次世代の高度な小型言語モデルで、phi-3-mini、phi-3-small、phi-3-mediumの3つのサイズがあります。これらのモデルは、パラメータ数を抑えつつ、綿密に設計されたトレーニングデータセットと最適化されたアルゴリズムによって、大規模モデルに匹敵する言語理解力と推論能力を実現しています。特に、パラメータ数がわずか3億8000万のphi-3-miniモデルは、複数のベンチマークテストにおいて、より大きなパラメータセットを持つモデルを凌駕する性能を発揮し、その小型サイズのおかげでスマートフォンでも動作します。Phi-3シリーズの開発は、データエンジニアリングとモデル最適化における最新の進歩を示すものであり、将来の小型高性能AIモデル開発に新たな可能性をもたらします。

技術報告書:https://arxiv.org/abs/2404.14219

ハグフェイスPhi-3モデルの住所:https://huggingface.co/collections/microsoft/phi-3-6626e15e9585a200d2d761e3

Ollama Phi-3モデルのアドレス:https://ollama.com/library/phi3

Phi-3モデルシリーズ

  • phi-3-miniこれは3億8000万個のパラメータを持つ最小の言語モデルです。その小さなサイズにもかかわらず、複数の言語理解タスクのベンチマークテストにおいて、Mixtral 8x7BやGPT-3.5といったより大規模なモデルと同等の性能を発揮します。モバイルデバイスへの展開に適した設計となっており、iPhone 14 ProやiPhone 15に搭載されているA16チップ上では、毎秒12トークンの処理速度を実現できます。
  • phi-3-smallこのモデルは7億個のパラメータを持ち、TikTokトークナイザーを使用して多言語をサポートし、さらに10%の多言語データを追加しています。phi-3-smallはMMLUテストで75.3%のスコアを獲得し、非常に優れたパフォーマンスを発揮し、Metaが最近リリースしたLlama 3 8B Instructモデルを上回りました。
  • phi-3-medium14億個のパラメータを持つこの中規模モデルは、より多くのデータで学習され、ほとんどのテストでGPT-3.5とMixtral 8x7b MoEを上回る性能を発揮しました。MMLUテストでの78.2%というスコアは、その強力な言語処理能力を証明しています。

Phi-3トレーニング方法

  • 高品質なデータセットPhi-3モデルは、3兆3000億から4兆8000億トークンという膨大なデータセットを用いてトレーニングされました。このデータセットは、データの教育的価値と品質を確保するために、厳格なスクリーニングとフィルタリングを受けています。
  • 合成データ生成大規模言語モデル(LLM)を活用して合成データを生成し、それを用いてモデルベースの論理的推論や様々な専門スキルを教える。
  • 段階的訓練トレーニングプロセスは2つの段階に分かれています。第1段階では、主にネットワークデータを使用して、モデルが一般的な知識と言語理解を習得できるようにします。第2段階では、ネットワークデータをさらにフィルタリングし、合成データと組み合わせてトレーニングを行います。
  • データ最適化トレーニングデータは「データ最適性」に近い状態に調整されており、これはモデルの推論能力を向上させることができるウェブデータがデータ選択において優先されることを意味します。
  • トレーニング後の最適化事前学習後、モデルの安全性、堅牢性、および対話形式への適応性を向上させるため、教師あり指導による微調整と選好調整(DPO)、さらにレッドチームテストと自動テストが実施された。
  • セキュリティとアライメントPhi-3-miniの開発は、マイクロソフトの責任あるAI原則に準拠しており、トレーニング後の段階で安全性の整合性を確保し、無力感と無害感に関する選好データセットを用いてトレーニングを行い、独立したレッドチームによる反復的なレビューを通じて改善点を特定しています。
  • 定量化モデルを携帯電話で実行できるようにするため、Phi-3-Miniは4ビット量子化を実行でき、これによりモデルのメモリ使用量を大幅に削減できます。
  • 多言語対応Phi-3-Miniは主に英語向けに設計されていますが、マイクロソフトは小型言語モデルの多言語対応能力についても研究を進めています。Phi-3-Smallモデルは、より多くの多言語データを用いて学習されました。

Phi-3のパフォーマンス

  • ベンチマークスコアphi-3-mini MMLU(大規模マルチタスク言語理解)ベンチマークでは69%、MT-benchでは8.38のスコアを記録した。phi-3-small そして phi-3-medium MMLUではそれぞれ75.3%と78.2%のスコアが達成され、モデルサイズの増加によってもたらされたパフォーマンスの向上が実証された。
  • 他のモデルとの性能比較Phi-3シリーズは、Mixtral 8x7BやGPT-3.5など、より大きなパラメータセットを持つモデルに匹敵する性能を誇ります。特に…phi-3-miniパラメータ数がわずか3億8000万個であるにもかかわらず、複数のベンチマークテストで8-B Llama 3を上回る性能を発揮した。MetaのLlama-3-8B-Instructモデルと比較すると、phi-3-small(7Bパラメータ)はMMLUでより高いスコア(75.3%対66%)を獲得し、より小さなモデルサイズでのPhi-3シリーズの性能上の優位性を示しました。

  • モバイルデバイスで動作phi-3-mini モバイルデバイスでの動作を想定して特別に設計されており、4ビット量子化後、iPhone 14 ProおよびiPhone 15に搭載されているA16チップ上で毎秒12トークンの速度を実現できます。これは、従来の大型モデルでは達成が困難だった速度です。
  • 多言語能力phi-3-small TikTokのトークナイザーを使用し、多言語データを10%追加することで、モデルの多言語処理能力が向上し、これは比較すると大きな利点となる。

Phi-3の限界と欠点

  • 知識の保存に関する制限特にphi-3-miniのようなモデルのサイズ制限により、大量の事実知識を記憶する能力が限られており、これはTriviaQAテストでの低いスコアなど、広範な背景知識を必要とするテストで特に顕著に表れています。
  • 検索機能への依存知識蓄積の限界を緩和するため、マイクロソフトは検索エンジンとの統合を通じてモデルのパフォーマンスを向上させることを提案している。これは、外部検索のサポートがない場合、モデルが単独で最適な回答や情報を提供できない可能性があることを示唆している。
  • 多言語能力の限界phi-3-smallは多言語データを追加することで最適化されていますが、Phi-3シリーズモデルの主な言語機能は依然として英語に特化しています。これは、幅広い多言語サポートを必要とするアプリケーションにとっては制約となる可能性があります。
  • 特定のタスクの実行特定のタスクやデータセットにおいては、Phi-3モデルがまだ最適なパフォーマンスを発揮していない可能性があり、その場合は、さらなるトレーニングデータの最適化とモデルの調整が必要になる場合があります。
  • セキュリティ上の課題セキュリティ面での最適化にもかかわらず、ほとんどの大規模言語モデルと同様に、Phi-3シリーズのモデルは、錯覚の生成、不適切なコンテンツ、バイアスの増幅、セキュリティ問題などの課題に依然として直面する可能性があります。
  • ハードウェア展開の制限Phi-3-Miniはスマートフォン上で動作可能ですが、極めて高い計算能力を必要とする一部のタスクにおいては、小型化されたモデルであってもハードウェア性能の限界に直面する可能性があります。