AB
AiBoss
project

LongCat-Flash-Lite - Meituanが開発した、LongCatを使用したオープンソースの大規模言語モデル。

LongCat-Flash-Liteは、美団が発表した次世代の高効率大規模言語モデルです。このモデルは、革新的なハイブリッドエキスパート(MoE)+Nグラム埋め込みアーキテクチャを採用しており、合計685億個のパラメータを持ちながら、推論ステップごとに約29億~45億個のパラメータのみを有効化します。

LongCat-Flash-Liteとは何ですか?

LongCat-Flash-Liteは、美団が開発した次世代の高効率大規模言語モデルです。革新的なハイブリッドエキスパート(MoE)+Nグラム埋め込みアーキテクチャを採用し、パラメータ総数は685億個です。推論イテレーションごとにアクティブ化されるパラメータは約29億~45億個に抑えられており、強力な機能と極めて高い効率性を両立させています。最大25万6千文字の超長文コンテキストをサポートし、エージェントタスク、コード生成、数学的推論といったコア評価において卓越した性能を発揮します。ツール呼び出しやプログラミングの分野では、同様のアクティブ化規模を持つモデルの中でトップレベルの性能を実現しています。専用のシステム最適化により、推論速度が大幅に向上しました。

LongCat-Flash-Liteの主な機能

  • テキスト生成このモデルは複数ターンの対話に対応しており、流暢で一貫性のある自然言語による応答を生成できます。
  • ツール呼び出しこのモデルは関数呼び出し機能を備えており、外部ツールを自律的に使用して複雑なタスクを完了することができる。
  • コード生成プログラミング作業に精通しており、複数のプログラミング言語でコードの記述、理解、デバッグが可能である。
  • 長時間のコンテキスト処理このモデルは256Kの超長文コンテキストをサポートしており、長文文書の分析などのタスクを処理することが可能です。

LongCat-Flash-Liteの技術原理

  • MoE + Nグラム埋め込みアーキテクチャLongCat-Flash-Liteは、合計685億個のパラメータを持つハイブリッドエキスパート(MoE)アーキテクチャを採用しており、実際に使用されるパラメータは29億~45億個のみです。従来のエキスパートとしてFFNを使用するMoEとは異なり、このモデルは革新的な方法でNグラム埋め込みテーブル(NE)を導入し、一部のエキスパートを置き換え、「MoE + NE」というハイブリッドアーキテクチャを形成しています。
  • Nグラム埋め込みテーブルメカニズムNグラム埋め込みテーブルは、Nグラムの組み合わせで構成される埋め込みベクトルを事前に計算して保存することで、計算負荷の高い操作の一部をテーブル検索操作に変換します。このメカニズムの主な利点は、埋め込み検索時のメモリアクセスパターンがより規則的になり、レイテンシが低くなるため、FFN順伝播と比較してデータ移動のオーバーヘッドが大幅に削減される点にあります。研究チームは、体系的な拡張実験を通じて、埋め込みテーブルの最適な統合タイミング、パラメータ予算の割り当て、ハッシュ衝突軽減戦略、ハイパーパラメータ構成、埋め込み初期化方法などの重要な要素を特定しました。
  • 推論効率最適化システムNグラム埋め込みテーブルのパフォーマンス上の利点を最大限に活用するために、チームは専用の推論最適化システムを導入しました。このシステムは、2つの主要コンポーネントで構成されています。1つは、インテリジェントなキャッシング戦略によって冗長な埋め込み検索のオーバーヘッドを削減するNグラムキャッシュ、もう1つは、埋め込み検索と他の計算との間でパイプライン並列処理を可能にするカスタム設計されたCUDAカーネルである同期カーネルです。
  • 長文コンテキスト拡張技術このモデルは、YaRN(Yet another RoPE extension method)を用いてコンテキスト長を256Kに拡張します。YaRNは、位置エンコーディングの回転角度と温度スケーリング係数を動的に調整することで、Rotary Position Embedding(RoPE)を改善します。これにより、トレーニング中に使用される短いコンテキスト(通常4K~8K)に基づいて、追加のトレーニングなしでより長い入力シーケンスを効果的に処理できると同時に、相対的な位置関係に対する感度と安定性を維持できます。

LongCat-Flash-Liteプロジェクトのアドレス

  • ハギングフェイスモデルライブラリ:https://huggingface.co/meituan-longcat/LongCat-Flash-Lite

LongCat-Flash-Liteの応用事例

  • インテリジェントな顧客サービスおよび対話システムこのモデルは複数ターンの対話とツール呼び出しに対応しており、航空、小売、通信などの業界におけるインテリジェントな顧客サービスシナリオに適しています。情報の照会、注文処理、ユーザーの問題解決を自律的に行うことができます。
  • コード開発およびプログラミング支援SWE-Benchなどのコードベンチマークにおいて優れた性能を発揮し、コード生成、バグ修正、コードレビュー、自動プログラミングなどのタスクに利用することで、開発効率を向上させることができます。
  • 長文文書の処理と分析このモデルは、法律契約の分析、学術論文の読解、財務諸表の一括処理、長編動画スクリプトの理解など、大量のテキスト処理を必要とするシナリオに適用可能です。
  • インテリジェントエージェントと自動化されたワークフローこのモデルの強力なエージェント機能は、自動化されたワークフローを推進し、データ収集、レポート生成、システム保守などの複数ステップのタスクを実行するためのコアエンジンとして機能します。
  • 多言語コンテンツ処理このモデルは中国語や英語を含む複数の言語で優れた性能を発揮し、多言語コンテンツ生成、ローカライズ翻訳、多言語知識質問応答といったグローバルなビジネスシナリオに適しています。