AB
AiBoss
ニュース

亚马逊 Bedrock 知识库接入 Marengo 3.0,支持视频与图像语义检索

AWS 宣布 TwelveLabs Marengo Embed 3.0 作为嵌入模型在 Amazon Bedrock 知识库中正式可用,可对视频、音频与图像内容进行自然语言检索,官方博客给出了基于控制台的操作流程。

核心事实

据 AWS 官方博客消息,TwelveLabs 的 Marengo Embed 3.0 已作为嵌入模型在 Amazon Bedrock 知识库中正式可用(general availability)。该模型为多模态嵌入模型,可将视频、音频、图像与文本联合编码到 512 维向量空间。博客称,借助这一模型,通过视频、音频和图像内容进行自然语言搜索可成为一项全托管体验。

官方给出的示例场景是一段约 10 分钟的 2022 年世界杯决赛片段:将视频上传至 Amazon S3 后,在 Bedrock 控制台创建托管知识库、选择 Marengo Embed 3.0 作为嵌入模型、配置 S3 数据源并执行同步,随后即可用「show me the penalty kicks from this soccer match」这类自然语言查询检索,返回结果包含分块起止时间、来源 URI 与嵌入类型等元数据。

背景与影响

博客指出,视频与媒体资产目前大多仍难以按语义检索,媒体、体育分析、教育、安全和零售等领域的团队需要在数小时素材中定位特定片段。传统做法需要拼接转录服务、抽帧流水线、嵌入模型、向量数据库与同步逻辑。Bedrock 知识库作为全托管的 RAG 服务,负责存储、摄取、嵌入、重排与检索,并支持 MP4、MOV 视频,JPEG、PNG 图像以及音轨,同时提供面向 Amazon S3、SharePoint、Confluence 等的原生连接器。

按博客描述,托管知识库会自动完成分段、抽帧与转录,音频与视频分段时长默认均为 4 秒,用户可在高级配置中调整。检索侧可通过 Amazon Bedrock Retrieve API 对接下游应用。

限制与来源

需注意,上述内容来自 AWS 官方博客,属于厂商自述,本文未做独立验证。博客提到使用该模型需要具备相应 AWS 账户、在受支持区域启用 TwelveLabs Marengo Embed 3.0 的模型访问权限,以及相应的 IAM 权限;具体可用区域、模型访问条件、计费方式与配额限制,请以 AWS 官网及 Amazon Bedrock 文档的当前信息为准。博客中的世界杯片段仅为演示场景,不代表任何实际性能或效果承诺。

来源:AWS 官方博客《Video and image search in Amazon Bedrock Knowledge Base using Marengo 3.0》。