Google DeepMindが、エージェントベースの動画理解機能「Gemini」を発表。
Google DeepMindは、Gemini 3.7 Flash、3.6 Flash、および3.5 Flash-Liteモデルに、エージェントベースの動画理解機能を導入したことを発表しました。動画クリップを動的にスキャンすることで、トークン消費量を最大88%、コストを最大66%削減し、精度を最大7%向上させることができます。この機能は、Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformを通じて利用可能です。
主な事実
2026年9月1日、Google DeepMindはブログ記事で、Gemini 3.7 Flash、3.6 Flash、および3.5 Flash-Liteモデルにエージェントベースの動画理解機能を導入したことを発表しました。この機能により、モデルは動画全体を固定フレームレートで処理するのではなく、動画セグメントを動的にスキャンできるようになり、トークン消費量とコストを大幅に削減しながら精度が向上します。公式データによると、この機能によりトークン消費量を最大88%、コストを最大66%、精度を最大7%削減できます。この機能は現在、Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformを通じて利用可能で、動画アップロードとYouTube動画に対応しています。
背景と影響
プロキシベースのビデオ理解は、プロキシベースのビジョンと同様に、コード実行とGeminiモデルの画像理解機能を組み合わせたものです。Geminiのネイティブビデオツールを活用することで、1秒未満のタイムラプス取得、より正確な異常検出、精密なカウントを実現します。この機能は、10分間のチュートリアル、90分間の講義、数時間にわたる録画など、長時間のビデオ処理に特に適しており、静的処理におけるトークンコストの高さや詳細の損失といった問題を解決します。Google DeepMindは、この機能をGeminiアプリケーションに段階的に展開し、今後数か月以内にYouTubeの「Ask YouTube」機能をサポートする予定であると述べています。
制限事項と情報源
上記のパフォーマンスデータ(トークン消費量の88%削減、コストの66%削減、精度の7%向上など)は、Google DeepMindの公式ブログからのものであり、独自に検証されていません。この機能は現在、Gemini APIを通じてのみ利用可能です。具体的な利用可能性、価格、および地域サポートについては、Google AI StudioおよびGemini Enterprise Agent Platformの公式ドキュメントを参照してください。初期パートナーからの詳細なフィードバックはまだ公開されていません。出典:Google DeepMindブログ。