project
CoinVE-200K - テンセントのオープンソース大規模組み合わせ型指導ビデオ編集データセット
CoinVE-200Kは、テンセントビデオのインテリジェントクリエーションチームがオープンソース化した、大規模な組み合わせ命令による動画編集データセットです。20万組の1080p動画編集サンプルが含まれており、各サンプルには追加、削除、変更などを含む2~5個の基本編集命令が含まれています。
CoinVE-200Kとは何ですか?
CoinVE-200Kは、Tencent Videoのインテリジェントクリエーションチームがオープンソース化した、大規模な複合型指示動画編集データセットです。1080p動画編集サンプル20万ペアが含まれており、各サンプルには追加、削除、変更、スタイル設定などの2~5個の基本編集指示が含まれています。人物、物体、背景など複数のカテゴリを網羅し、最大長は201フレームです。CoinVE-200Kには、オープンソースの22パラメータモデルCoinVE-Editと評価セットCoinVE-Benchが付属しており、複合型指示動画編集におけるデータ、モデル、評価基準の3つのギャップを埋めています。
CoinVE-200Kの主な機能
-
膨大な量の編集データモデルのマルチインテント共同トレーニングをサポートするために、1080pの合成指導ビデオ編集サンプルペアを20万セット提供します。
-
複数原子操作の網羅性追加、削除、置換、スタイル設定など、6つの基本的な編集操作を網羅しており、複雑な編集作業を柔軟に組み合わせることができます。
-
フルシナリオターゲットサポート編集対象は、人物、物体、背景など多岐にわたり、シーンや意味の多様性に富んでいる。
-
すぐに使える編集可能なモデルオープンソースの22BパラメータCoinVE-Editモデルが付属しており、複数の編集コマンドを一度に正確に実行できます。
-
システム評価ベンチマーク我々は、11種類の詳細な指標を用いて組み合わせ編集のパフォーマンスを体系的に評価するために、CoinVE-Benchベンチマークスイートを構築した。
CoinVE-200Kの技術原理
- データ生成とフィルタリングあらかじめ定義された編集分類システムに基づき、Qwen3.6-27Bを使用してソースビデオコンテンツを分析し、編集可能な対象を特定します。複数のアトミック操作を組み合わせて複合命令を生成します。次に、SAM3/SAM2を使用して編集領域マスクを生成します。HunyuanImage-3.0とNano Bananaを使用して編集キーフレームを合成します。その後、Wan2.1-AnimateまたはVACEを使用してビデオを完全なビデオに展開します。Geminiを使用して二次品質フィルタリングを行い、命令への準拠、視覚品質、時間的一貫性などの基準に基づいて適格なサンプルを選択します。
- マルチモーダルな意味理解CoinVE-Editは、マルチモーダル理解モジュールとしてQwen3-VL-8B-Instructを使用しています。ソースビデオのフレームシーケンスと複数のテキスト編集指示を同時に受け取り、ビデオコンテンツと複雑な編集意図を共同で分析し、統合編集のための高レベルのセマンティック表現を抽出することで、モデルが複数の指示間の関係と制約を包括的に理解できるようにします。
- 編集知覚特徴変換MLLMによって出力される隠れ状態は、Feature Connectorを介して2種類の編集対応トークンにマッピングされます。1つは各命令に紐づけられた学習可能なトークン、もう1つは元のビデオ情報を保持するビジュアルトークンです。これらのうち、命令関連のトークンは、生成プロセスをガイドしてさまざまな種類の編集ニーズに正確に対応するための条件信号としてDiTバックボーンネットワークに注入されます。
- 領域分離注意機構マスク予測器は、各指示に対して時空間編集領域マスクを予測し、GateNetは動的なゲーティング係数を生成します。DiTのクロスアテンション層では、Qブレンディング機構がマスクとゲーティングの重みに基づいて、各指示トークンとビジュアルトークンのクエリへの寄与を区別し、無関係な領域からの干渉を抑制しつつ、時間的な一貫性を維持しながら、対応する領域における異なる編集意図の正確な結合を実現します。
- 二段階補完評価システムCoinVE-Benchは、MLLMベースのチェックリストと専用評価ツールを組み合わせた評価フレームワークを採用しています。前者はGemini 3.6 Flashを使用して、編集精度、物理的な自然さ、意味の保持という3つの側面から指示の遵守の正確性を評価します。後者はAesthetic Predictor、DOVER++、VisualQuality-R1、およびオプティカルフローフィールドを使用して、美的品質、技術的品質、全体的な品質、および時間的安定性を測定し、合計4つの主要な側面と11の指標を網羅します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
CoinVE-200Kの使い方
-
データセットをダウンロードModelScope CLIをインストールした後、以下のコマンドを実行してください。
modelscope download全量を取得するか、必要な分だけダウンロードするかを指定するコマンド。metadata_coinve200k.jsonlまずメタデータのテストを行います。 -
分割されたファイルを解凍します。ダウンロードしたtarファイルを指定された場所に展開してください。
src_videos、tgt_videos、combined_masksそしてinstruction_masks対応するディレクトリ。 -
メタデータを解析する: Python を使用して読み込む
metadata_coinve200k.jsonl各サンプルについて、元のビデオのパス、編集後のビデオのパス、および2~5個の編集指示をまとめて取得してください。 -
コールマスク情報メタデータからの抜粋
instruction_mask_video_pathsそしてcombined_mask_video_path各命令に対応する時空間編集領域マスクを取得します。 -
モデルトレーニングを実施する解析されたビデオペア、結合された指示、およびマスクは、DiTフレームワークに入力され、結合された指示ビデオ編集モデルのトレーニングと微調整を監督するために使用されます。
-
ベースラインの結果を再現する公式のオープンソースコードを直接読み込みます。 CoinVE-Edit モデルの重み、 CoinVE-Bench 複合編集の性能は、評価データセットを用いて検証された。
CoinVE-200Kの主な利点
-
規模と品質の両面で業界をリード:持っている 1080pのセット20万セット 最大201フレームからなる高解像度ビデオ編集ペアは、現在までに発表された教育ビデオ編集データセットの中で最大規模である。
-
複雑な組み合わせ編集各サンプルには2~5個のアトミック編集命令が含まれており、追加、削除、変更、スタイル設定などの操作を柔軟かつ複雑に組み合わせることができます。
-
厳格な品質ろ過MLLMによる意味理解と二次品質フィルタリングパイプラインを通じて、指示への準拠、視覚的な品質、時間的な一貫性、および未編集領域の完全性を確保します。
-
フルチェーンのオープンソースエコシステムこれは、22BパラメータのCoinVE-EditモデルとCoinVE-Bench評価セットを同時に提供し、データ・モデル・評価の完全な閉ループを形成します。
-
精度はクローズドソースモデルを上回る複合命令編集(SA/SPA/EP)の精度において、Seedance 2.0やKling O3といった主流のクローズドソースソリューションを凌駕する。
-
領域分離編集メカニズムマスクベース条件付けとQブレンディング交差注意を組み合わせることで、無関係なコンテンツを保持しつつ、複数の指示を対応する時空間領域に正確に結びつけることができる。
CoinVE-200Kプロジェクトのアドレス
- プロジェクト公式サイト:https://coinve200k.github.io/
- GitHubリポジトリ:https://github.com/coinve200k/CoinVE-200K
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/FireCRT/CoinVE-200K
- arXiv技術論文:https://arxiv.org/pdf/2608.17566
CoinVE-200Kと類似の競合製品との比較
| 寸法 | CoinVE-200K | OpenVE-3M | ReCo-Data |
|---|---|---|---|
| データスケール | 20万グループ | 300万グループ | 50万グループ |
| ビデオ解像度 | 1080p | 720p (1280×720) | 480×832 |
| 最大フレーム数 | 201フレーム | 65~129フレーム | 81フレーム |
| 複合編集 | サポート(2~5個の原子命令) | 単一命令マスタ | 単一命令マスタ |
| 平均命令数 | 2.55 | 約1個 | 約1個 |
| 編集タイプ | 追加、削除、置換、スタイル変更など。 | 8つのカテゴリ(スタイル、背景、詳細、字幕などを含む) | 追加、削除、置換、スタイル設定 |
| マッチングモデル | CoinVE-Edit(22B) | なし | ReCo(1.3B) |
| 専用評価セット | CoinVE-Bench | OpenVE-Bench | なし |
| 高品質ろ過 | ジェミニ二次フィルタリング + MLLMチェックリスト | 持っている | ジェミニ2.5フラッシュシンキングフィルター |
CoinVE-200Kの応用事例
-
映画・テレビのポストプロダクション監督は自然言語コマンドを使用して、複数の要素の置き換え、背景の変更、スタイルの転送を一度に完了させ、ポストプロダクションの効率を大幅に向上させる。
-
広告コンテンツの反復ブランドは、同じ動画素材に対して、人物の服装の変更、商品の差し替え、背景の調整など、一括編集を迅速に行うことで、撮り直しのコストを削減できます。
-
ショートビデオ制作クリエイターは複数の編集意図を入力することで、ワンクリックでキャラクターの削除、オブジェクトの追加、画像のスタイル変更といった複雑な効果を実現でき、プロとしてのハードルを下げることができます。
-
AIモデルのトレーニング高品質な教師ありデータとして、複数の指示を組み合わせた大規模な動画編集モデルの学習に使用され、それによってモデルが複数の意図を理解し、正確に実行する能力が向上します。
-
評価ベンチマーク調査: 学術コミュニティに対し、指示への準拠性、物理的な自然さ、視覚的な品質の観点から、ビデオ編集モデルのパフォーマンスを体系的に評価するための標準化されたCoinVE-Benchを提供する。