project
Follow-Your-Clickは、Tencentなどが開発したオープンソースの画像から動画への変換モデルで、ローカライズされたアニメーションを生成できる。
Follow-Your-Clickは、テンセント(滬源チーム)、清華大学、香港科技大学の研究者らが共同開発した画像から動画への変換(I2V)モデルです。このモデルは、…
Follow-YourClickとは何ですか?
Follow-Your-Clickは、テンセント(滬源チーム)、清華大学、香港科技大学の研究者らが共同開発した画像から動画への変換(I2V)モデルです。ユーザーは簡単なクリック操作と短い指示に従うだけで、局所的な画像アニメーションを生成でき、静止画像を動的な動画に変換できます。このモデルは、局所的なアニメーション機能が不足しており、シーン全体しか動かせないという、既存の画像から動画への変換手法の限界を克服することを目的としています。
Follow-Your-Click公式サイトへの入り口
- 公式プロジェクトホームページ:https://follow-your-click.github.io/
- arXivの研究論文:https://arxiv.org/abs/2403.08268(注:ソースコードとデモは4月に公開予定です。)
- GitHubリポジトリ:https://github.com/mayuelala/FollowYourClick
Follow-YourClickの主な機能
- シンプルで使いやすい操作性Follow-Your-Clickは、ユーザーが簡単なクリック操作でアニメーション領域を指定したり、短いプロンプトに従ってアニメーションの種類や動作を定義したりできる、直感的なユーザーインターフェースを提供します。
- ローカルアニメーション生成ユーザーは画像内の特定の部分をクリックすることでアニメーション効果を加えることができます。つまり、ユーザーは画像内の任意の部分を選択し、オブジェクトを笑顔にしたり、揺らしたり、動かしたりするなど、動的な効果を追加できるのです。
- 複数オブジェクトのアニメーションこのモデルは、画像内の複数のオブジェクトを同時にアニメーション化することをサポートしており、ユーザーはより豊かで複雑な動的なシーンを作成できます。
- 簡潔な行動指示ユーザーは動作の簡単な説明を入力するだけでよく、モデルがそれを理解し、対応するアニメーション効果を生成します。これにより、アニメーション制作プロセスが簡素化され、ユーザーが複雑な操作を行ったり、長々と説明を入力したりする必要がなくなります。
- 高品質なビデオ生成このモデルは、生成されるビデオの品質とリアリティを高めるために、ファーストフレームマスキングやオプティカルフローに基づくモーション振幅制御といった高度な技術戦略を採用しています。
- 動作速度制御このモデルでは、アニメーションオブジェクトの動きの速度をユーザーが制御できるため、さまざまなアニメーションのニーズに合わせて精密な制御が可能になります。
Follow-YourClickの仕組み
- ユーザーインタラクション:ユーザーはまず、画像上の特定の位置をクリックして、アニメーション化したいオブジェクトの領域を選択します。この操作方法はシンプルで直感的であり、複雑な操作や詳細な説明は不要です。次に、ユーザーには「体を振る」や「笑う」といった短い動作指示が表示され、選択した部位に対して実行すべき動作を指定します。
- 画像セグメンテーション:ユーザーのクリックをアニメーションに使用できる領域マスクに変換するために、このフレームワークはSAM(Segment Anything)ツールを統合しています。SAMは、ユーザーのクリックに基づいて高品質のオブジェクトマスクを生成できる、プロンプト表示型の画像セグメンテーションツールです。
- 最初のフレームのマスキング戦略:動画生成品質を向上させるため、本フレームワークは最初のフレームのマスキング戦略を採用しています。トレーニング中、入力画像の潜在表現の一部をランダムにマスクすることで、モデルの時間的関連性の学習能力を高めます。この手法により、生成される動画の品質が大幅に向上します。
- モーションエンハンスメントモジュール:モデルが短い動作キューにより適切に対応できるようにするため、このフレームワークにはモーション拡張モジュールが組み込まれています。このモジュールは、新しいクロスアテンション層を通して、動作関連の語彙に対するモデルの応答性を向上させます。トレーニング中は、このモジュールは短い動作キューを使用して学習され、推論中は、これらのキューがモーション拡張モジュールとU-Netのクロスアテンションモジュールの両方に入力されます。
- 光フローに基づく動作振幅制御:従来のモーション強度制御は、フレームレート(FPS)の調整に依存していました。しかし、この方法では個々のオブジェクトの動きの速度を正確に制御することはできません。動きの速度を正確に学習するために、本フレームワークではオプティカルフローに基づくモーション振幅制御手法を提案します。オプティカルフローの平均振幅を計算し、それを位置埋め込みに投影することで、すべてのフレームにわたってモーション強度を一貫して適用できます。
- ビデオ生成:推論段階では、ユーザーのクリック位置と簡単な動作情報に基づいてアニメーション動画が生成されます。このモデルは、ユーザーが指定した領域マスクと動作情報を組み合わせて、入力画像の残りの部分を静止させたまま、一貫性のある一連のアニメーションフレームを生成します。