Google DeepMind推出Gemini代理式视频理解功能
Google DeepMind宣布在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型中推出代理式视频理解功能,通过动态扫描视频片段,可将令牌消耗降低最多88%,成本降低最多66%,同时准确率提升最多7%。该功能现已通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform中提供。
核心事实
Google DeepMind于2026年9月1日发布博客,宣布在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型中推出代理式视频理解功能。该功能允许模型动态扫描视频片段,而非以固定帧率处理整个视频,从而在提升准确性的同时大幅降低令牌消耗和成本。据官方数据,该功能可将令牌消耗降低最多88%,成本降低最多66%,准确率提升最多7%。该功能现已通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform中提供,支持视频上传和YouTube视频。
背景与影响
代理式视频理解类似于代理式视觉,结合了代码执行与Gemini模型的图像理解能力,利用Gemini的原生视频工具实现亚秒级时刻检索、更准确的异常检测、精确计数等功能。该功能特别适用于长视频处理,如10分钟的教程、90分钟的讲座或多小时录像,解决了静态处理中高令牌成本或细节丢失的问题。Google DeepMind表示,该功能将逐步推广至Gemini应用,并计划在未来几个月内为YouTube的“Ask YouTube”功能提供支持。
限制与来源
上述性能数据(如令牌消耗降低88%、成本降低66%、准确率提升7%)均来自Google DeepMind官方博客,未经独立验证。该功能目前仅通过Gemini API提供,具体可用性、定价及地区支持请以Google AI Studio和Gemini Enterprise Agent Platform的官方文档为准。早期合作伙伴的反馈尚未公开详细数据。来源:Google DeepMind博客。