AB
AiBoss
project

JoyAI-LLM-Flash - JD.comのオープンソースハイブリッドエキスパートアーキテクチャモデル

JoyAI-LLM-Flashは、JD.comがオープンソース化した中規模の命令モデルです。ハイブリッドエキスパート(MoE)アーキテクチャを採用し、パラメータ総数は48B、アクティベーションパラメータはわずか3Bで、128Kの超長コンテキストをサポートしています。このモデルは、FiberPOを革新的に導入しています。

JoyAI-LLM-Flashとは何ですか?

JoyAI-LLM-Flashは、JD.comがオープンソース化した中規模の命令モデルです。合計48バイトのパラメータとわずか3バイトのアクティベーションパラメータを持つハイブリッドエキスパート(MoE)アーキテクチャを採用し、128Kの超長文コンテキストをサポートしています。このモデルは、ファイバーバンドル理論を強化学習に初めて適用した革新的なFiberPO最適化フレームワークを導入し、SFT、DPO、およびRLトレーニング用のMuonオプティマイザと組み合わせています。また、高密度マルチトークン予測(MTP)技術も活用し、MTP非搭載バージョンと比較して1.3~1.7倍のスループット向上を実現しています。20兆トークンの事前学習済みデータに基づき、JoyAI-LLM-Flashは最先端の知識理解、論理推論、コード生成、エージェントインタラクションタスクにおいて優れた性能を発揮し、効率的なエッジサイド推論、エンタープライズレベルのエージェント開発、および長文テキスト処理シナリオに適しています。

JoyAI-LLM-Flashの主な機能

  • 長時間のコンテキスト処理128Kトークンのコンテキスト長をサポートしており、長い文書、長い会話、複雑な複数ターンのやり取りタスクを処理できます。
  • 高効率なMoE推論パラメータの総数は48Bで、そのうちアクティベーションパラメータはわずか3Bです。エキスパートによる動的ルートは256個あり、トークンごとに8個のエキスパートがアクティブ化され、パフォーマンスと推論コストの低さのバランスが取れています。
  • マルチトークン予測(MTP)高密度MTP技術を採用することで、スループットは非MTPバージョンと比較して1.3~1.7倍に向上し、生成効率が大幅に改善される。
  • コード生成機能20兆個のトークンを事前学習したデータに基づいており、論理的推論とコード生成に優れ、開発を支援するために複数のプログラミング言語をサポートしています。
  • インテリジェントエージェントの相互作用エージェントシナリオ向けに最適化されており、複雑なタスク計画、ツール呼び出し、および複数ステップの推論をサポートします。
  • 最先端の知識を理解する幅広い知識分野を網羅し、強力な意味理解能力と質問応答能力を備えている。
  • 指示遵守の最適化SFT、DPO、RLを用いた多段階トレーニングを通して、ユーザーコマンドを正確に理解し、実行します。

JoyAI-LLM-Flashの技術原理

  • ハイブリッドエキスパートアーキテクチャ(MoE)本手法は、合計480億個のパラメータを持つ疎な活性化MoE設計を採用していますが、トークンごとに活性化されるパラメータはわずか30億個です。256個のエキスパートモジュール(トークンごとに8個のエキスパートを選択)を動的にルーティングすることで、高いパフォーマンスを維持しながら推論コストを大幅に削減します。
  • 高密度マルチトークン予測(Dense MTP)このシステムは、単一の順伝播中に複数の将来のトークンを並行して予測する高密度MTPメカニズムを革新的に導入することで、従来モデルにおけるスケールアップ時の不安定性の問題を解決し、スループットを1.3~1.7倍向上させています。
  • FiberPO最適化フレームワーク本研究は、強化学習の最適化にファイバーバンドル理論を初めて導入し、それをMuonオプティマイザと組み合わせてパラメータを更新することで、トレーニングの安定性と収束効率を向上させたものである。
  • 多段階トレーニング戦略トレーニングプロセスでは、SFT(教師ありファインチューニング)、DPO(直接選好最適化)、RL(強化学習)の3段階のアプローチを採用し、モデルの指示への準拠性と出力品質を段階的に最適化します。
  • MLAの注意機構マルチヘッド潜在アテンションを使用し、2048の隠れ次元を持ち、32ヘッドアテンションをサポートし、長いシーケンス依存関係を効率的に処理します。
  • SwiGLU活性化機能SwiGLUは非線形活性化関数として使用され、129Kの語彙サイズと組み合わせることで、モデルの表現力と学習の安定性を向上させます。

JoyAI-LLM-Flashプロジェクトのアドレス

  • ハギングフェイスモデルライブラリ:https://huggingface.co/jdopensource/JoyAI-LLM-Flash

JoyAI-LLM-Flashの応用シナリオ

  • 効率的なエッジサイド推論わずか30億個のアクティベーションパラメータで済むため、携帯電話やIoTデバイスなどのリソース制約のあるエッジ環境への展開に適しており、ローカライズされたAIアシスタントを実現できます。
  • インテリジェントカスタマーサービスシステム128Kの超長文コンテキストをサポートし、複雑な複数ターン対話を処理できるため、eコマース、金融などの分野における大規模な顧客サービス自動化に適しています。
  • コード支援開発論理的思考力とコード生成能力に優れ、開発者に対しリアルタイムのコード補完、バグ修正、技術文書の解釈を提供する。
  • エンタープライズグレードのエージェントプラットフォームインテリジェントエージェントとのインタラクションに最適化されており、タスク計画、ツール呼び出し、多段階推論をサポートし、RPAや自動化されたオフィスなどのシナリオに適しています。
  • 長文文書処理128Kのコンテキスト機能は、論文分析、契約書審査、研究報告書の要約など、大量のテキスト処理を必要とする専門的なシナリオをサポートします。
  • コンテンツ作成支援20兆個のトークンを事前学習させたデータに基づいて、マーケティングコピー、製品説明、プレスリリース、その他のビジネスコンテンツの作成を支援できます。