NVIDIA 发布 VSS Blueprint 3.3:以单条提示构建视觉 AI 智能体并降低 VLM 运行成本
NVIDIA 发布 Metropolis 视频搜索与摘要蓝图 VSS 3.3,新增 Build Vision Agent 技能与自适应 EVS,官方称可减少开发与运行成本。
核心事实
NVIDIA 在其开发者博客发布 Metropolis 视频搜索与摘要蓝图(VSS)3.3 版本。据官方介绍,该版本新增 Build Vision Agent 技能(vss-build-vision-ai),可由单条自然语言提示组合多工作流部署;同时引入自适应高效视频采样(Adaptive EVS),通过动态裁剪帧内未变化的视觉 patch 并围绕活动时刻批量处理 VLM 任务,以降低视觉语言模型的运行开销。
VSS 将 NVIDIA Cosmos 等视觉语言模型、NVIDIA Nemotron 等大语言模型、检索增强生成(RAG)与 Model Context Protocol 工具连接起来,把实时与录制视频转化为自然语言搜索、视觉问答、告警核验与自动报告。
背景与影响
官方称,生产级视觉 AI 智能体通常横跨多个工作流,由此带来开发、运行与变更三类成本。Build Vision Agent 技能从四个经过验证的开发者配置(dense、alerts、lvs、search)中选取最接近的一个作为 Foundation,只计算最小增量,并让 Kafka、Redis、Elasticsearch 等共享基础设施收敛到单一实例。
在博客给出的瓶装线演示中,该技能在一台双 GPU 的 RTX PRO 6000 Blackwell 主机上,用不到 30 分钟生成可实时预览的部署,涵盖搜索、告警核验与班次报告,并让 FP8 Cosmos 3 Nano 复用检测器的 GPU。官方还称,在运行 Cosmos 3 Super FP8 的 RTX PRO 6000 Blackwell 上,自适应 EVS 将告警上下文化延迟降低 17%,并发实时 VLM 流增加 46%;对一段 60 分钟视频的摘要耗时约为原来的一半,VLM 输入 token 减少 80%。
限制与来源
上述延迟、并发流与 token 数据均来自 NVIDIA 官方博客,属于厂商自述,尚未获独立验证;官方也说明结果会随场景运动、分块长度与相似度阈值而变化。博客提到的 10 月 1 日线上活动时间以太平洋时间标注,具体安排请以 NVIDIA 官网当前信息为准。本文内容整理自 developer.nvidia.com 的官方技术博客。