AB
AiBoss
project

Keye-VL-2.0-30B-A3B - Kuaishouが独自開発したオープンソースのマルチモーダル大型モデル

Keye-VL-2.0-30B-A3Bは、Kuaishouが独自開発したマルチモーダル大規模モデルで、オープンソース化されており、30Bレベルモデルの主要な基盤となっています。このモデルは、マルチモーダルシナリオにDSAスパースアテンションを初めて導入し、最大256Kの超長尺コンテキストをサポートすることで、1時間レベルのビデオ処理を可能にします。

Keye-VL-2.0-30B-A3Bとは何ですか?

Keye-VL-2.0-30B-A3Bは、Kuaishouが独自開発したマルチモーダル大規模モデルで、オープンソース化されており、30Bレベルモデルの主要な基盤となっています。このモデルは、マルチモーダルシナリオにDSAスパースアテンションを初めて導入し、最大256Kの超ロングコンテキストをサポートすることで、1時間レベルの動画に対してミリ秒レベルの時間推論を可能にします。TimeLensベンチマークテストではGemini-2.5-ProとGemini 3 Flashを凌駕し、コード、ツール、検索などのエージェントコラボレーションメカニズムを初めて実現することで、モデルをオブザーバーからアクターへと進化させました。

Keye-VL-2.0-30B-A3Bの主な機能

  • 長尺動画を理解する256Kの超長尺コンテキストをサポートし、1時間にも及ぶビデオシーケンスを処理でき、ほぼロスレスの深層時間推論を実現します。
  • 時間的因果推論: シーンの背後にある因果関係を連続的な時間の流れの中で捉え、「シーンを見る」ことから「論理を理解する」ことへの飛躍を実現する。
  • ミリ秒レベルのフレームレベルの位置決め外科手術レベルの微細な解像度を備えており、複雑なプロセスや試合のハイライトをタイムスタンプまで正確に分析することが可能です。
  • 異種モダリティ深部融合視覚情報、音声情報、テキスト情報を同時に処理することで、複数のモダリティにわたる協調的な理解と深い意味的整合性を実現します。
  • エージェント協調実行これにより、コード生成、ツール呼び出し、検索といった複雑なシナリオにおいて、システムレベルでの自律的なコラボレーションとタスク実行機能が初めて実現します。
  • 高ノイズ情報浄化複雑なシーンにおいて、キーフレームを正確に捉え、動的なパターンを明確にすることで、冗長な情報を効果的に除去し、コアコンテンツを保持します。

Keye-VL-2.0-30B-A3Bの技術原理

  • DSAスパースアテンションメカニズムDeepSeek Sparse Attentionがマルチモーダル理解に導入されたのは今回が初めてであり、スパースアテンションとターゲット特徴集約の組み合わせにより、超長尺の視覚コンテキストにおける指数関数的な計算能力のボトルネックを打破した。
  • 超長コンテキストアーキテクチャ256Kトークンレベルのエンドツーエンドアーキテクチャを採用することで、分割や切り捨てを行うことなく、長尺のビデオシーケンスの一貫した奥行き知覚を実現します。
  • きめ細かなタイミング理解エンジンフレームレベルの動作境界認識、動的視覚分析、および音声・映像協調モデリングを通じて、ミリ秒レベルの精度で時間的位置特定と因果推論が実現される。
  • エージェントコラボレーションフレームワークコードインタープリタ、ツール使用、検索機能を統合することで、マルチモーダルな知覚から論理的推論、そしてツール実行へと至る、閉ループ型の意思決定システムを構築する。
  • 統合型マルチモーダル特徴融合視覚、音声、テキストの特徴を共通の表現空間にマッピングすることで、深い意味的整合性と、異なる感覚モダリティの情報の統合的な推論を可能にする。

Keye-VL-2.0-30B-A3B の使い方

  • モデルを取得する完全にオープンソースのモデル重みとデプロイメントに関するドキュメントは、GitHub、Hugging Face、またはModelScopeからダウンロードできます。
  • ハードウェアの準備H800または同等のグラフィックカードが必要で、マルチGPUテンソル並列推論には少なくとも2つのGPUを使用します。
  • Dockerの迅速な展開公式のDockerイメージを直接プルして実行することで、ワンクリックで環境設定とモデルの読み込みを完了できます。
  • ソースコードのインストールとデプロイKeyeのカスタマイズ版SGLang、DeepGEMM、EffectiveKernelsの3つの依存関係リポジトリを順番にクローンし、コンパイルしてインストールします。
  • 推論サービスを開始しますSGLangを使用してモデルの重みをロードし、テンソル並列パラメータを設定し、リモートコードの信頼性を有効にすることで、OpenAIプロトコルと互換性のあるAPIサービスをローカルで起動できます。
  • API呼び出し起動後、動画とテキストによる指示は標準のHTTPリクエストを介して送信されます。モデルは、構造化された長尺動画の理解結果、またはエージェントの実行結果を返します。

Keye-VL-2.0-30B-A3Bの主な利点

  • DSAのマルチモーダルにおける最初の実装DeepSeek Sparse Attentionがマルチモーダル理解のシナリオに導入されたのは今回が初めてであり、超長時間の視覚コンテキストによって引き起こされる指数関数的な計算能力のボトルネックを根本的に打破し、1時間にも及ぶ動画の効率的な推論を可能にする。
  • 256K 極めて長いコンテキスト最大256Kのトークンレベルの超長コンテキストをサポートし、従来のモデルのようにセグメンテーションや切り捨てを行う必要なく、1時間ごとのビデオシーケンスのほぼロスレスなエンドツーエンドの深度認識を可能にします。
  • ミリ秒レベルのフレームレベルの位置決め外科手術レベルの精密なタイミング分析機能を備えており、複雑なプロセス、ゲームのハイライト、その他のシナリオにおけるあらゆる重要な動作を、タイムスタンプに至るまで正確に分解し、位置付けることができます。
  • 時間的因果推論単なる画像ラベル認識にとどまらず、連続的な時間的流れの中で因果関係を捉え、「画像を見る」ことから「論理を理解する」ことへと飛躍的な進歩を遂げます。例えば、「雪道での自動車事故」の画像から、「団体旅行は自家用車よりも優れている」という安全戦略を直接的に推論することが可能です。
  • エージェント間の連携メカニズムKeyeシリーズは、コード、ツール、検索といった複雑なシナリオにおいて、システムレベルの自律的な連携および実行機能を初めて実現し、モデルが受動的な「観察者」から、タスクを解決する能動的な「行為者」へと進化することを可能にします。

Keye-VL-2.0-30B-A3Bのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/Kwai-Keye/Keye
  • ハギングフェイスモデルライブラリ:https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B

Keye-VL-2.0-30B-A3Bと類似の競合製品との比較

比較対象寸法 Keye-VL-2.0-30B-A3B Gemini-2.5-Pro Gemini 3 Flash
会社 快手 Google Google
モデルサイズ 30B 未発売(プロレベル) 未発売(Flashレベル)
コアアーキテクチャ DSAスパースアテンション+マルチモーダル融合 クローズドソースのマルチモーダルアーキテクチャ クローズドソースのマルチモーダルアーキテクチャ
非常に長い文脈 256K Token(1時間におよぶ動画) 長い文脈 長い文脈
ActivityNet-TimeLens<
ビデオモーションポジショニング
mIoU 58.5 mIoU 58.1 mIoU 57.0
Charades-TimeLens<
日々の行動のタイミングの分析
mIoU 58.4 mIoU 61.2
QVHighlights-TimeLens<
ハイライト抽出
mIoU 70.1 mIoU 49.5
エージェント間の連携機能 最初のロック解除<
Code / Tool / Search
サポート サポート
オープンソースの状況 完全オープンソース<
(重量+コード+ドキュメント)
非公開ソース 非公開ソース

Keye-VL-2.0-30B-A3Bの応用シナリオ

  • 長尺動画コンテンツの理解Keye-VL-2.0-30B-A3Bは、旅行Vlog、ドキュメンタリー、教育ビデオなどの1時間程度の動画に対して、詳細な時間的因果推論を実行し、機材の提案、予算計画、観光スポットのおすすめ、安全に関するヒントなどを含む、構造化された完全な要約を自動的に生成できます。
  • 工業プロセス分析このモデルは、複雑なプロセス動画の中から重要な動作ノードをミリ秒単位の精度で特定し、製造プロセスを複数の段階に正確に分解してタイムスタンプを付与することができ、プロセス分解、操作仕様の抽出、品質検査プロセスの最適化に適しています。
  • eスポーツおよびスポーツコンテンツ制作視覚的な緊張感、視聴覚的な相乗効果、そして物語の論理を深く理解することで、このモデルはeスポーツやスポーツイベントの動画におけるハイライトシーンや感情的な共鳴ポイントを正確に特定し、単なるキルプロンプトにとどまらない、刺激的な瞬間をインテリジェントに抽出することができます。
  • エージェントによる自動化タスクKeyeシリーズで初めて実現された協調メカニズムとして、このモデルはシステムレベルでのコード生成、ツール呼び出し、および複数ステップの検索の自律的な実行をサポートし、マルチモーダルな知覚から論理的推論、そしてツール呼び出しに至るまでの複雑な閉ループタスクを完了することを可能にします。
  • 教育と訓練実際の教育現場では、このモデルは生徒の操作動画から重要な動作を特定し、手順をミリ秒単位で分解することで、教師に正確な指導フィードバックと操作修正の根拠を提供し、技能評価とコース最適化を支援します。