Kimi-VL - 月の裏側から生まれた、軽量でオープンソースのマルチモーダル視覚言語モデル。
Kimi-VLは、Dark Side of the Moonがオープンソース化した軽量マルチモーダル視覚言語モデルです。軽量MoEモデルMoonlight(総パラメータ数160億、アクティベーションパラメータ数28億)とネイティブ解像度MoonViTビジュアルエンコーダ(パラメータ数4億)をベースにしています。
キミVLとは何ですか?
Kimi-VLは、Dark Side of the Moonがオープンソース化した軽量マルチモーダル視覚言語モデルです。軽量MoEモデルMoonlight(総パラメータ数160億、活性化パラメータ数28億)とネイティブ解像度MoonViTビジュアルエンコーダ(パラメータ数4億)をベースとしています。Kimi-VLは、単一画像、複数画像、動画、長文ドキュメントなどのマルチモーダル入力に対応しています。画像認識、数学、学際的な問題、OCRなどのタスクで優れた性能を発揮し、特に長文コンテキスト(12万8千語)や複雑な推論において卓越した能力を発揮します。数学的推論や長文動画の理解といったタスクでは、GPT-4oなどのモデルを凌駕する性能を示します。Kimi-VLには、長連鎖推論をサポートするバージョンKimi-VL-Thinkingも用意されており、これは長連鎖推論のファインチューニングと強化学習に基づき、活性化パラメータ数はわずか28億です。推論の難易度が高いベンチマークテストでは、その性能の一部は、非常に大規模な次元を持つ最先端モデルの性能に匹敵するか、あるいはそれを上回ることさえある。
Kimi-VL-A3B-Thinking-2506の最新オープンソース版は、マルチモーダル推論ベンチマークにおいて優れた性能を発揮し、精度が大幅に向上するとともに、思考時間が20%短縮されました。モデルの視覚理解能力は大幅に強化され、高解像度画像処理に対応し、高解像度知覚およびOSエージェントグラウンディングベンチマークにおいて目覚ましい進歩を遂げています(V*Benchmarkで83.2、ScreenSpot-Proで52.8、OSWorld-Gで52.5のスコア)。このモデルは、画像理解、グラフ推論、数学的計算など、複数の分野で優れた性能を発揮し、特定の応答パターンや思考連鎖をサポートします。
キミVLの主な機能
- マルチモーダル情報入力単一画像、複数画像、動画、長文ドキュメントなど、さまざまな入力形式に対応しています。
- きめ細かい画像認識画像に対して詳細な分析を行い、画像内の複雑なディテールやシーンを特定します。
- 数学的および論理的推論マルチモーダルな数学問題や論理的推論タスクにおいて優れた性能を発揮し、視覚情報を取り入れた複雑な計算にも対応します。
- OCRとテキスト認識光学文字認識(OCR)タスクにおいて優れた性能を発揮し、画像内のテキストコンテンツを正確に認識します。
- インテリジェントエージェントアプリケーションスクリーンショットの解析やインテリジェントなエージェントナビゲーションなどのエージェントタスクをサポートし、複雑な視覚的およびテキストによるインタラクションシナリオを処理します。
- 長期的な思考能力Kimi-VL-Thinkingバージョンは、複雑なタスクにおけるより深い推論をサポートします。
キミVLの技術原理
- 建築設計:
- ビジュアルエンコーダー(MoonViT)4億個のパラメータを持つVision Transformerアーキテクチャをベースとし、画像分割やスティッチングを必要とせず、ネイティブ解像度で画像を処理します。NaViTのパッキング手法を導入し、画像を画像ブロックに分割、平坦化、連結して一次元シーケンスを作成します。言語モデルと同じ演算子と最適化手法を共有しています。
- 多層パーセプトロン投影モジュール(MLPプロジェクター)この手法では、2層のMLPを用いて視覚エンコーダーと言語モデルを橋渡しします。ピクセルの再配置によって画像特徴の空間次元が圧縮され、言語モデルが必要とする埋め込み次元に投影されます。
- ハイブリッドエキスパート(MoE)言語モデル(ムーンライト)合計60億個のパラメータと28億個の活性化パラメータに基づく軽量なMoEアーキテクチャ。これは、事前学習フェーズの中間チェックポイントから初期化されます。このチェックポイントでは、既に520万トークンのプレーンテキストデータが処理され、8,000個のコンテキスト長が活性化されています。その後、ハイブリッド学習スキームを使用して、230万トークンのマルチモーダルデータとプレーンテキストデータでさらに事前学習が行われます。
- 事前トレーニング段階:
- 独立系ViTトレーニング: 堅牢な視覚特徴抽出機能を確立するために、視覚エンコーダを独立してトレーニングする。
- 合同訓練このプロセスは、事前学習、冷却、長期コンテキスト活性化の3つの段階から構成され、同時にモデルの言語能力とマルチモーダル能力を向上させます。
- トレーニング後の段階モデルのパフォーマンスは、32Kおよび128Kのコンテキストでそれぞれテストを実行することでさらに最適化されました。Long-CoTを使用して活性化を微調整し、長期的思考能力を強化し、強化学習を使用してモデルの推論能力をさらに向上させました。
- パフォーマンス最適化128Kのコンテキストウィンドウを使用して、長文テキストや動画から正確な情報を検索します。ネイティブ解像度エンコーダMoonViTは、超高解像度ビジョンタスクにおいて、低い計算オーバーヘッドで高い精度を維持します。Kimi-VL-Thinkingは、Long CoT活性化と強化学習に基づいて、複雑なタスクにおいてより深い推論を可能にします。
キミVLのパフォーマンス上の利点
- 高い知能Kimi-VLは、マルチモーダル推論とマルチステップエージェントタスクにおいて優れた性能を発揮し、そのテキスト処理能力は純粋なテキスト言語モデルに匹敵します。MMMU、MathVista、OSWorldなどのベンチマークテストにおいて、Kimi-VLは「長期的思考」能力に頼ることなく目覚ましい成果を上げ、卓越した知能を実証しています。
- 長い文脈Kimi-VLは、128Kという超ロングなコンテキストウィンドウを備えており、LongVideoBenchやMMLongBench-Docといったベンチマークテストなど、長尺動画や長文ドキュメントの処理において、同クラスの他のモデルを大きく凌駕する性能を発揮します。膨大な量の情報を正確に検索・理解し、複雑なタスクに対してより包括的なコンテキストサポートを提供します。
- より優れた視覚能力他のオープンソースの視覚言語モデルと比較して、Kimi-VLは、視覚認識、視覚世界知識、OCR、高解像度スクリーンスナップショット解析など、複数の視覚シナリオにおいて包括的かつ顕著な競争優位性を示します。Kimi-VLは、複雑な画像の詳細を捉え、視覚情報を深く理解するタスクを正確かつ効率的に完了できます。
Kimi-VLのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/MoonshotAI/Kimi-VL
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/moonshotai/kimi-vl
- 技術論文:https://github.com/MoonshotAI/Kimi-VL/blob/main/Kimi-VL.pdf
Kimi-VLの応用シナリオ
- インテリジェントな顧客サービス複数回の対話形式でユーザーの質問に答えるために使用され、テキストと画像を組み合わせたインタラクションをサポートします。
- 教育指導生徒の学習を支援するため、図解入りの解答例や教材を提供する。
- コンテンツ作成動画編集やクリエイティブコンテンツ制作を支援するために、テキスト、画像、動画コンテンツを生成します。
- 医療支援医療画像を分析し、予備的な診断提案や健康相談を提供する。
- 本社長文文書を処理し、重要な情報を抽出し、インテリジェントな会議サービスをサポートします。