project
video-use - ブラウザ使用チームが開発したオープンソースのAI動画編集エージェント
Video-useは、Browser Useチームが開発したオープンソースのAIビデオ編集エージェントで、従来のタイムライン操作を自然言語による対話に置き換えます。ユーザーは、元の映像をフォルダに配置し、必要な内容を説明するだけで、エージェントが自動的に編集を完了します。
動画の利用とは何ですか?
Video-useは、Browser Useチームが開発したオープンソースのAIビデオ編集エージェントで、従来のタイムライン操作を自然言語による対話に置き換えます。ユーザーは、元の映像素材をフォルダに配置し、必要な内容を説明するだけで、エージェントが自動的に映像素材のインベントリ作成、音声の癖の除去、カラーグレーディング、字幕作成、アニメーションオーバーレイ、自己評価を行い、最終的なビデオを出力します。Video-useの核となるイノベーションは、LLMが音声をテキスト(約12KB)に変換できるようにすることで、トークンコストを大幅に削減できる点にあります。音声録音、チュートリアル、インタビューなどの構造化されたコンテンツを効率的に自動編集するために特別に設計されています。
ビデオ使用の主な機能
-
言語チックと沈黙の解消「えーと」「あー」といった間投詞、長い沈黙、不適切な繰り返しショットなどを自動的に識別して削除します。
-
自動色調整warm_cinematicやneutral_punchなどのプリセットが内蔵されており、カスタムffmpegフィルターチェーンもサポートしています。
-
30msの音声フェードイン各カットポイントに30ミリ秒のフェードイン/フェードアウトを自動的に追加することで、カットポイントでの突然の音割れを完全に解消します。
-
字幕を焼くデフォルトのショートビデオスタイルは「2つの単語を大文字で表示する」です。長い文章や大きな字幕などには、カスタムフォント、色、位置を設定できます。
-
アニメーションオーバーレイこれは、HyperFrames、Remotion、Manim、PIL+ffmpegなどのエンジンを呼び出してBロールとアニメーションカードを生成します。これらは独立したサブエージェントによって並行して生成されます。
-
自己評価サイクルレンダリング後、カットオフポイントでのフレームスキップ、音声のノイズ、字幕の隠蔽、オーバーレイのずれなどの問題を自動的にチェックし、これらの問題を最大3回まで修正します。
-
会話の記憶各編集決定は
project.md作業を続ける際は、以前の設定や戦略を維持してください。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
ビデオの使い方
- リポジトリのクローン作成: ターミナルで実行
git clone https://github.com/browser-use/video-use ~/Developer/video-useプロジェクトコードをローカルの開発者ディレクトリにダウンロードしてください。 - 依存関係をインストールしますプロジェクトディレクトリに移動してから実行してください。
uv syncまたはpip install -e .Pythonの依存関係をインストールし、同時に...brew install ffmpeg必要な音声および映像処理ツールをインストールしてください。 - APIキーの設定環境変数テンプレートファイルをコピーする
cp .env.example .env次に編集します.env音声文字起こしサービス用のElevenLabs APIキーをファイルに入力してください。 - スキルを登録する例えば、Claude Codeユーザーが実行できるように、ビデオの使用をエージェントのスキルディレクトリに登録するためのシンボリックリンクを作成します。
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use。 - 使用を開始する元のビデオ映像が保存されているフォルダに移動し、プログラミングエージェントを起動して、「これらを起動ビデオに編集する」と指示すると、自動編集プロセスが開始されます。
動画利用の主な利点
-
対話型のやり取りが手動編集に取って代わる専門的な編集ソフトを習得する必要はなく、要件を自然言語で記述するだけで、プロセス全体を円滑に進めることができます。
-
APIに制限されない普遍的な互換性公式のオープンインターフェースに依存するものではなく、あらゆるウェブベースのビデオツールをAIで制御できる。
-
極めて低いトークンコストを理解する(動画)LLMは、フレームごとの視覚分析を音声から文字起こしされたテキスト(約12KB)に置き換えることで、動画を「見る」のではなく「読む」という効率的な方法を可能にします。
-
自動化された機械労働発話時の癖の除去、色補正、字幕作成、アニメーションオーバーレイといった反復作業はエージェントによって自動的に実行され、人間は戦略を確認するだけでよい。
-
標準化された出力は再現可能である編集ルールはコード内で固定されており、同じ種類のコンテンツの出力スタイルが一貫していることを保証し、手動操作によって生じる不一致を回避する。
-
自己評価品質保証レンダリング後、フレームスキップ、ポップノイズ、オクルージョンなどの問題を自動的にチェックして修正し、最終製品が品質基準を満たしていることを確認してからユーザーに提示します。
動画利用のためのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/browser-use/video-use
類似製品との動画利用状況の比較
| 寸法 | video-use | OpenStoryline (FireRedTeam) |
|---|---|---|
| 開発チーム | ブラウザの使用(海外) | Xiaohongshu Super Intelligence Team / FireRedTeam (中国) |
| オープンソースライセンス | MIT | Apache-2.0 |
| Stars | 13,749 | 2,817 |
| コアポジショニング | プログラミングエージェント、会話型編集、生映像 | 意図に基づいた動画制作:素材探しから最終編集まで |
| 相互作用方法 | コマンドラインチャット(クロード・コード/コーデックス) | 自然言語対話 + Webインターフェース + CLI |
| コンテンツソース | 現地で撮影された未編集映像(ナレーション、インタビュー素材) | ローカルメディアの映像素材に加え、オンラインメディアの検索とダウンロードにも対応しています。 |
| スマートスクリプト | 音声文字起こしに基づくコンテンツ理解 | ストーリーライン、ナレーション、およびFew-shotスタイルの転送を自動生成します。 |
| アニメーション/特殊効果 | HyperFrames / Remotion / Manim / PIL | 内蔵のインテリジェントなBGM推薦機能、AIによるトランジション生成機能、フォントスタイルのマッチング機能 |
ビデオ利用の応用シナリオ
-
テクノロジー系ブロガーの解説クリップ複数の未編集映像を素早く編集し、冗長な部分や間を自動的に削除して、一貫性のあるリリース用ビデオを作成します。
-
チュートリアル作成チーム多数の反復的な編集作業を一括処理し、字幕、カラーグレーディング、アニメーションオーバーレイのワークフローを標準化する。
-
製品発表ビデオ戦略に基づいて複数のクリップを自動的につなぎ合わせ、ビジュアルスタイルを統一し、それに合わせたBロールアニメーションを生成します。
-
インタビュー/ポッドキャストのポストプロダクション最適なテイクを自動的に識別し、不要な部分を削除して、字幕とフェードアウト効果付きの完成版映像を出力します。
-
コンテンツクリエイターのための標準化されたワークフロー編集プロセスを手作業から戦略確認へと移行することで、コンテンツ制作そのものに集中できる時間を確保する。