AB
AiBoss
project

Kwai Keye-VL - Kuaishouが発表したマルチモーダル大規模言語モデル

Kwai Keye-VLは、Kuaishouが独自開発したマルチモーダルな大規模言語モデルです。Qwen3-8B言語モデルをベースに、SigLIPで初期化されたビジュアルエンコーダを統合し、動的な解像度入力に対応しています。このモデルは、テキスト、画像などを高度に融合・処理することができます。

Kwai Keye-VLとは何ですか?

Kwai Keye-VLは、Kuaishouが独自に開発したマルチモーダル言語モデルです。Qwen3-8B言語モデルをベースに、SigLIPで初期化されたビジュアルエンコーダを統合し、動的な解像度入力に対応しています。テキスト、画像、動画などのマルチモーダル情報を深く融合・処理することが可能です。革新的な適応型インタラクションメカニズムと動的な推論能力により、ユーザーにとってよりインテリジェントで包括的なマルチモーダルインタラクションの新しいパラダイムの創造を目指しています。動画理解、複雑な視覚認識、論理的推論において卓越した性能を発揮し、特に2025年度全国大学入学共通試験(高考)数学試験では140点という驚異的なスコアを記録しました。本モデルは現在正式にオープンソース化されており、マルチモーダル研究および応用を強力にサポートしています。

Kwai Keye-VLの主な機能

  • 動画の理解これにより、短い動画コンテンツを深く理解することが可能になり、動画内のシーン、登場人物、動作などの情報を分析したり、説明文やタグを生成したり、関連コンテンツを推奨したりすることができます。
  • 画像認識と記述画像の詳細を自動的に分析し、画像内の物体やシーンを識別し、正確な説明を生成します。
  • 論理的推論数学の問題解決や科学的推論など、複雑な論理的推論タスクにおいて優れた能力を発揮します。
  • マルチモーダルな相互作用テキスト、画像、動画など、複数のモダリティの情報処理をサポートし、モダリティ間の効果的な相互作用と融合を可能にする。
  • 知的な創造マルチモーダル情報の理解に基づき、コピー、スクリプト、クリエイティブなソリューションの生成など、コンテンツ作成におけるユーザーを支援します。

Kwai Keye-VLの技術原理

  • モデルアーキテクチャQwen3-8B言語モデルをベースとし、SigLIPで初期化されたビジュアルエンコーダを統合しています。動的な解像度入力に対応し、元の比率に基づいて画像を14×14ブロックに分割し、MLP層で視覚的特徴を統合します。3D RoPE(回転位置符号化)を使用して、テキスト、画像、ビデオを均一に処理し、位置符号化とタイムスタンプのアライメントに基づいてビデオの時間的変化を正確に捉えます。
  • 事前トレーニング戦略ビジュアルエンコーダを継続的に事前学習し、内部データ分布に適応させ、動的な解像度入力をサポートします。バックボーンモデルを固定し、軽量なMLPアダプタのみを学習させることで、極めて低コストかつ高効率で堅牢な画像/動画とテキストのアライメント関係を確立します。マルチタスク共同学習のためにすべてのモデルパラメータを解放し、モデルの全体的な視覚理解能力を包括的に向上させます。厳選された高品質のデータを使用してモデルを微調整し、洗練された理解力と識別能力をさらに強化します。異なるデータ比率でのパラメータ平均化に基づくアニーリング学習を用いて、モデルのバイアスを低減し、堅牢性を高めながら多次元機能を維持する、同種異種融合技術を探求します。
  • 研修後の戦略
    • 非論理的訓練このデータセットは、500万件の高品質なマルチモーダルVQAデータポイントを使用しています。データの多様性は、独自開発のTaskGalaxyソリューションを使用して構築されたタスクシステム(7万件のタスクを含む)によって確保され、データ品質は、困難なサンプルのAIスクリーニングと手動アノテーションによって保証されています。オープンソースデータと独自構築の選好データを組み合わせたもので、後者はSFTエラーサンプルを質問素材として収集し、Qwen2.5VL 72BとSFTモデルを使用して回答ペアを生成し、結果を手動でソートします。
    • 推論訓練このアプローチでは、4つの異なる推論モードのトレーニングデータを使用して、モデルの思考プロセス機能をゼロから活性化し、人間の段階的な推論パラダイムを理解できるようにします。このコールドスタートを基盤として、GRPOアルゴリズムがハイブリッドモード強化学習に使用されます。革新的なデュアルトラック報酬メカニズム(結果の正確性とプロセスの一貫性を同時に評価)により、マルチモーダル知覚、数学的推論、短いビデオの理解、エージェントのコラボレーションなど、モデルの総合的な機能が深く最適化され、推論能力が大幅に向上します。MPOアルゴリズムは、高品質と低品質のデータペアの両方で複数ラウンドを反復し、コンテンツの重複と論理的なギャップを排除します。最終的に、これによりモデルは問題の複雑さに基づいて深層推論モードをインテリジェントに選択する適応能力を獲得し、パフォーマンスと安定性の両面で大きなブレークスルーを達成します。

Kwai Keye-VLのプロジェクトアドレス

  • プロジェクト公式サイト:https://kwai-keye.github.io/
  • GitHubリポジトリ:https://github.com/Kwai-Keye/Keye/tree/main
  • ハギングフェイスモデルライブラリ:https://huggingface.co/Kwai-Keye

Kwai Keye-VLの応用シナリオ

  • 動画コンテンツ制作これは、短編動画制作者がタイトル、説明文、スクリプトを素早く作成するのに役立ち、制作効率を向上させます。
  • インテリジェントな顧客サービスマルチモーダルなインタラクション(テキスト、音声、画像)に基づいて、ユーザーにインテリジェントなカスタマーサービスを提供し、ユーザーエクスペリエンスを向上させます。
  • 教育指導生徒一人ひとりに合わせた学習指導を提供し、宿題の解答や重要な概念の説明などを通して、学習を支援します。
  • 広告とマーケティング広告主の広告効果を高めるために、魅力的なコピーとスクリプトを作成する。
  • 医療支援これは医師が医療画像を分析するのを支援し、予備的な診断の提案を提供し、医療効率を向上させる。