project
Kimi Linear - 月の裏側からオープンソース化された斬新なハイブリッド線形アテンションアーキテクチャ
Kimi Linear は、Dark Side of the Moon によって導入された新しいハイブリッド線形アテンションアーキテクチャであり、長文シーケンスタスクにおける大規模言語モデル (LLM) の効率とパフォーマンスを向上させるように設計されています。そのコアコンポーネントは、Kimi Delta Attention (KDA...
キミリニアとは何ですか?
ダークサイド・オブ・ザ・ムーンが発表したKimi Linearは、長文シーケンスタスクにおける大規模言語モデル(LLM)の効率とパフォーマンスを向上させるために設計された、斬新なハイブリッド線形アテンションアーキテクチャです。そのコアコンポーネントであるKimi Delta Attention(KDA)は、洗練されたチャネルレベルのゲーティングメカニズムと効率的なブロック処理アルゴリズムにより、モデルの表現力とハードウェア効率を大幅に向上させます。Kimi Linearは、KDAとフルアテンションレイヤー(MLA)の3:1ハイブリッド設計を採用し、キーバリューキャッシュの使用量を75%削減することで、数百万のテキストのデコード処理を6.3倍高速化します。Kimi Linearアーキテクチャは、短文シーケンスタスクと長文シーケンスタスクの両方において従来のフルアテンションメカニズムを凌駕し、強化学習タスクにおいて特に優れた性能を発揮します。
Kimi Linearの主な機能
- 長いシーケンスタスクを効率的に処理するKimi Linearは、ハイブリッド線形アテンションアーキテクチャによりキーバリューキャッシュの使用量を大幅に削減(75%削減)し、1MBの長文テキストのデコードにおいて6.3倍のスループット向上を実現しています。
- 精密情報管理Kimi Delta Attention (KDA) は、チャネルレベルのゲーティングメカニズムを採用しており、モデルが重要な情報を正確かつ選択的に保持し、無関係なコンテンツを忘れることを可能にすることで、長いシーケンスを処理する能力を向上させています。
- 推論能力を強化するKimi Linearは、複雑な推論を必要とする強化学習タスクにおいて非常に優れた性能を発揮し、トレーニング精度の向上速度が速く、テストセットではフルアテンションモデルを凌駕する。
- ハードウェアに優しい設計効率的なブロック処理アルゴリズムを採用し、最新のGPUのテンソルコアを最大限に活用することで、高い行列乗算スループットを実現し、計算時間とリソース消費量を大幅に削減します。
- 様々なタスクシナリオに適応可能Kimi Linearは、短いシーケンス処理と長いシーケンス処理の両方で優れた性能を発揮し、言語理解、コード生成、数学的推論など、さまざまなアプリケーションシナリオに適しており、優れた汎化能力を備えています。
キミ・リニアの技術原則
- ハイブリッド線形アテンションアーキテクチャKimi Linearは3:1のハイブリッド設計に基づいており、3つのKimi Delta Attention(KDA)層の後にフルアテンション層(MLA)が挿入されます。この設計は、線形アテンションの効率性とフルアテンションの強力な表現力を組み合わせ、使用するキーバリューキャッシュの量を削減し、モデルのデコード速度を向上させます。
- Kimi Delta Attention(KDA)KDAはKimi Linearの中核モジュールであり、以下のメカニズムを通じて効率的な処理を実現します。
- 洗練されたゲート機構チャネルレベルのゲーティングを導入することで、各特徴次元に独立した忘却率が設定され、RoPEの位置エンコーディングと同様に、モデルの位置情報認識能力が向上します。
- ハードウェア効率の高いブロック処理アルゴリズム計算量を削減し、ハードウェア利用率を向上させるために、ブロック処理並列アルゴリズムを採用した。KDAの状態遷移は特殊な対角低ランク(DPLR)行列とみなすことができ、制約構造によって計算複雑度を低減できる。
- 位置エンコーディングなし(NoPE)Kimi LinearのMLA層は、RoPEなどの明示的な位置情報エンコーディングを使用せず、位置情報のエンコーディングはすべてKDA層に任せています。この設計により、モデルアーキテクチャが簡素化され、長文テキスト処理における堅牢性と外挿能力が向上します。
- 専門家によるブレンド技術(MoE)と組み合わせるKimi Linearは、Mixture-of-Experts(MoE)技術を組み合わせ、疎な活性化パターンによってモデルパラメータの規模を拡大することで、学習と推論の効率をさらに向上させています。このモデルは合計480億個のパラメータを持ち、各順伝播で活性化されるパラメータはわずか30億個です。
キミ・リニアのプロジェクト住所
- ハギングフェイスモデルライブラリ:https://huggingface.co/moonshotai/Kimi-Linear-48B-A3B-Instruct
- 技術論文:https://github.com/MoonshotAI/Kimi-Linear/blob/master/tech_report.pdf
Kimi Linearの応用シナリオ
-
長文生成Kimi Linearは、数百万語規模のテキスト処理において非常に優れた性能を発揮し、デコード速度は6.3倍向上するため、長編小説や研究報告書などの生成に適しています。
-
コード生成と理解その効率的な長文シーケンス処理能力により、コード生成やコード理解のタスクにおいて優れた性能を発揮し、より複雑なコードロジックや長文コードスニペットの生成をサポートします。
-
数学的推論と問題解決数学的タスクの強化学習トレーニングにおいて、Kimi Linearのトレーニング精度はより速く向上し、テストセットでの性能はフルアテンションモデルよりも優れているため、複雑な数学的問題を解決するのに適している。
-
言語理解と質問応答Kimi Linearは、短いシーケンス処理と長いシーケンス処理の両方で優れた性能を発揮し、言語理解、質問応答システムなど、より長い文脈の理解と生成をサポートする用途に適しています。
-
マルチモーダルタスクKimi Linearは、画像の説明生成や動画コンテンツの理解といったマルチモーダルなタスクに使用でき、長文の説明や複雑な論理推論にも対応しています。