project
HappyHorse - Artificial Analysisによるブラインドテストで、最高ランクのAI動画生成モデル。
HappyHorseは、突如として人工分析動画生成ブラインドテストのリーダーボードのトップに現れた謎のAIモデルであり、Eloスコア1347でSeedance 2.0を大きく引き離し、テキスト生成動画と画像生成動画の両方で優勝を果たした。
HappyHorseとは何ですか?
HappyHorseは、突如として人工知能による動画生成ブラインドテストのリーダーボードでトップに躍り出た謎のAIモデルです。Eloスコア1347でSeedance 2.0を大きく引き離し、テキストベースと画像ベースの両方の動画生成で二冠を達成しました。このモデルは、アリババ傘下のTaotian Future Life Lab(Kelingの元責任者である張迪氏が率いる)が開発したもので、40層のシングルストリームTransformerアーキテクチャを採用し、わずか8ステップのノイズ除去で高品質な動画を生成していると推測されています。現在、このモデルは匿名であり、2026年のAI動画分野における驚異的なダークホースと目されています。
HappyHorseの主な機能
- 文生ビデオHappyHorseは、テキストプロンプトに基づいて高品質で映画のようなビデオを生成する機能をサポートしており、Eloスコア1347でWenshengビデオブラインドテストのリーダーボードで世界第1位にランクインしています。
- 画像と動画このモデルは参照画像に基づいて動的なビデオコンテンツを生成でき、画像生成ビデオ部門で1391ポイントという最高得点の新記録を樹立した。
- ビデオ制作ビデオHappyHorseは動画編集機能を提供しており、ユーザーは既存の動画からスタイルを変更したり、コンテンツを再構築したりすることができます。
- 音声と映像のコラボレーションこのモデルはネイティブの音声生成機能を備えており、映像と同期した効果音を出力できるため、映像と音声を合わせたランキングで世界第2位にランクインしている。
- 高解像度出力1080pの高解像度ビデオのエクスポートに対応し、ウォーターマークのない商用利用可能なビデオ生成サービスを提供します。
- 参照画像ワークフローユーザーは参照画像ワークフローを通じて役割やシーンの一貫性を維持できるため、ビデオコンテンツをより正確に制御することが可能になります。
HappyHorseの使い方
- 人工知能分析へのアクセス人工知能分析のウェブサイト(https://artificialanalysis.ai/)にアクセスし、ビデオアリーナのブラインドテストエリアに入ってください。
- ブラインドテスト投票に参加するシステムは、匿名モデル(HappyHorseを含む場合がある)によって生成された2つの動画をランダムに表示します。ユーザーは、「Aの方が良い」または「Bの方が良い」をクリックすることで、画質や動きの滑らかさなどの要素に基づいて、より良い動画を選択できます。
- ビューモデルID投票後、各動画がどのモデルから生成されたものかがページに表示されます。HappyHorseを選択した場合は、その生成効果を確認できます。
人工分析機能は比較評価機能のみを提供し、カスタムプロンプトを入力して動画を生成する機能はサポートしていません。
HappyHorseに関する重要な情報と使用要件
- 身元匿名のAI動画生成モデルが、人工知能分析とAIのパフォーマンスチャートの両方でトップに立ち、アリババ傘下のタオティエン「未来生命研究所」(元ケリン社長の張迪氏が率いる)の成果物であると推測されている。
- 建築40層のシングルストリームTransformer、8段階のノイズ除去、および拡散モデルと自己回帰型Transfusion統合マルチモーダルアーキテクチャの融合を採用する。
- パフォーマンスビデオスコアは1347(人工レーティング)で、ビデオスコアは1391(Eloレーティング)であり、Seedance 2.0を60~74ポイント近く上回っている。
- 関数テキストベース動画、画像ベース動画、動画ベース動画、およびネイティブオーディオの同期生成。キャラクターの一貫性、物理的な論理、およびリップシンクに特化。
HappyHorseの主な利点
- ブラインドテストのリーダーボードでは、生成品質において明確なリードが示されている。人工知能による実ユーザーブラインドテストでは、文盛動画が1347ポイントでEloスコアチャートのトップに立ち、図盛動画が1391ポイントで2位となり、2位のSeedance 2.0に60~74ポイント近い差をつけ、これは2位と19位の合計スコア差に相当する。
- ミニマリストで力任せな単一流線型の建築40層のシングルストリームTransformerを採用し、テキスト、ビデオ、オーディオトークンを均一に処理することで、複雑なマルチストリーム構造を廃止し、CFGガイダンスを必要とせずに8ステップのノイズ除去で生成を完了できるため、推論コストを大幅に削減できます。
- ネイティブオーディオとビデオのコラボレーション生成映像に合わせたネイティブな効果音の同期生成をサポートし、映像と音声を合わせたランキングで世界第2位にランクインするなど、高いレベルの映像と音声の整合性を実現しています。
- 商業グレードの人材の一貫性表情、唇の動き、体の動き、そして物理的な論理をシミュレートすることに優れており、バーチャルヒューマンや短編ドラマなど、キャラクターの一貫性に対する厳しい要求がある商業的なシナリオに特に適しています。
HappyHorseと類似の競合製品との比較
| 比較対象寸法 | HappyHorse-1.0 | シードダンス2.0(つまり夢) | クリング 3.0 |
|---|---|---|---|
| ブラインドテストランキング | 文生・土生ビデオ両ランキングで1位(1347/1391点) | 文生・土生ビデオ両リストで2位(1273/1356点) | 4位~5位(1241ポイント) |
| 会社 | 疑わしい アリババ桃天「未来型リビングラボ」(張迪氏のチーム) | ByteDance(Jimeng/CapCut チーム) | 手際の良い人(ケリングAIチーム) |
| コアアーキテクチャ | 40層単流変圧器8段階のノイズ低減CFGなし | 具体的なアーキテクチャは明らかにされていないが、マルチストリームDiTであると推測されている。 | 全方位マルチモーダルアーキテクチャ、多段階ノイズ低減 |
| 音声生成 | ネイティブオーディオ同期機能とオーディオチャート2番 | ネイティブオーディオ同期機能とオーディオチャート初め | 音声はサポートされていますが、優先順位は低いです。 |
| 利用料金 | $0.83-$1.24100クレジット(約0.05ドル/秒) | 国内プレミアム会員 月額499元(値上げ後) | $13.441分あたり(プロ版) |
| 利用可能ステータス | 公式サイトあり、APIは近日公開予定 | APIは利用不可、順番待ちが必要、中国国内では無料割り当て枠に制限あり。 | APIは利用可能ですが、高額です。 |
HappyHorseの応用事例
- バーチャルヒューマンとデジタルヒューマンの創造このモデルは、表情、口の動き、身体の動きにおいて大きな利点があり、バーチャルアンカー、デジタルヒューマンのショートビデオ、AI広報担当者など、高度な人間らしさが求められる商業的なシナリオに適しています。
- AIによる短編ドラマと映画制作映画品質の連続映像の生成をサポートし、マルチカメラによるストーリーテリングやキャラクターの動きの一貫性に優れており、AI短編ドラマ、コマーシャル、予告編、その他の映画やテレビコンテンツの制作に適しています。
- 物理ロジックの実演と製品紹介このモデルは、物理的な相互作用(フラフープの回転、輪ゴムボールの跳ね返り、コーヒーに液体を注ぐ動作など)を正確にシミュレートすることができ、製品機能のデモンストレーション、教育用および一般向けの科学ビデオ、物理エンジンなどのクリエイティブコンテンツに適しています。
- 音声と映像が同期したコンテンツこのモデルは、環境音効果とキャラクターのセリフを含む没入感のある動画を作成することができ、オーディオストーリー、ASMRコンテンツ、吹き替えクリップなどのオーディオビジュアルコラボレーションシナリオに適しています。