AB
AiBoss站
快讯

康泰纳仕用 Amazon Bedrock 构建多模态视频检索

AWS 博客介绍康泰纳仕与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建多模态视频检索方案,据报将单次内容发现任务耗时从 250 分钟降至 2 分钟以内。

核心事实

据 AWS 官方博客文章,媒体集团康泰纳仕(Condé Nast)与 AWS 生成式 AI 创新中心(GenAIIC)合作,构建了一套 AI 驱动的多模态视频检索方案。该方案基于 Amazon Bedrock 与 Amazon OpenSearch Service,对视频转录文本、画面元素与音频进行基于意图的语义搜索。文章称,团队选用了 TwelveLabs 的 Marengo 嵌入模型,用于联合编码视觉、音频与转录信号。据该文描述,方案将单次内容发现任务的耗时从平均 250 分钟降至 2 分钟以内。

背景与影响

文章指出,康泰纳仕编辑团队此前需要在超过 14 万条视频的库中人工翻找素材,只能依赖标题与描述定位片段,且高度依赖个人经验,一旦相关人员不在便形成单点故障;同时,标题或描述中缺少相应关键词的素材长期难以被发现。方案设计围绕两点约束展开:一是关键词搜索无法理解“初学者瑜伽、背景舒缓”这类意图,需要跨模态的向量嵌入;二是视频库规模较大,需将计算密集的嵌入生成与低延迟的检索服务解耦,使两层可独立扩展与演进。方案能力包括自然语言意图检索、跨转录与画面与音频的多模态理解、以参考图片查找视觉相似内容、容错与意图解析,以及返回精确时间戳。技术选型上,文章称通过 Bedrock 统一 API 调用多种基础模型,并借助 IAM、Amazon VPC 与 AWS CloudTrail 实现访问控制、网络隔离与审计;向量索引侧使用 OpenSearch Service 的托管 k-NN 检索、多可用区复制与元数据过滤。

限制与来源

上述内容来自 AWS 博客的一篇客户案例文章,属于厂商自述,文中数据与效果尚未获独立第三方确认。文中未披露该方案的定价、地区可用性、许可条款或正式发布时间,相关功能与模型可用范围请以 AWS 及各模型提供方官网当前信息为准。本文不构成任何投资或采购建议。