AB
AiBoss
News

AWS 发布基于智能体的对话式视频智能方案

AWS 博客介绍了一套基于 Strands Agents SDK 的对话式视频智能方案:用户用自然语言提问,智能体在运行时决定调用 Amazon Bedrock、Amazon Rekognition 还是 Amazon Transcribe,从而免去为每类问题单独搭建流水线。

AWS 博客介绍对话式视频智能方案

AWS 官方博客发布了一篇技术文章,介绍如何在 AWS 上构建「智能体式对话视频智能」方案。据该文描述,用户上传视频后可用自然语言提问,例如「这次会议做了哪些决定」「是否有人提到预算时间线」,系统会给出答案。方案基于 Strands Agents SDK 构建单个 AI 智能体,由 Amazon Bedrock 提供模型能力,并按问题类型编排 Amazon Rekognition 与 Amazon Transcribe;已分析过的内容可复用缓存结果,新视频的首次分析据称需要 5 至 10 分钟,具体取决于视频长度与所需服务。

背景与影响

文章指出,媒体、安防、保险与专业服务等行业产生的视频量已超出团队人工审阅的能力,会议录像、监控画面与现场检查视频往往长期闲置,而其中的信息仍有价值。传统做法要么人工逐条观看,要么为每类问题单独开发机器学习流水线,成本较高。该方案的核心思路是把流水线选择交给模型在运行时决定,而非写死在应用代码里。文中提到一家大型媒体娱乐公司在 AWS Professional Services 参与下采用了这一方法,用于查询录制的发现会内容;文中援引客户内部的前后对比称人工审阅时间减少约 80%,并注明该数据未经独立验证。

限制与来源

需要说明的是,上述内容来自 AWS 官方博客的厂商自述,性能与效率数字均为其单方表述,尚未获独立确认。文章列出的前提条件包括:具备 Amazon Bedrock(需启用 Anthropic Claude Sonnet)与 Amazon S3 访问权限的 AWS 账户,文档处理需 Amazon Bedrock Data Automation 或 Amazon Rekognition 与 Amazon Transcribe,Python 3.11 及以上并安装 Strands Agents SDK,以及配置好相应 IAM 权限的 AWS CLI。各服务的可用区域、支持语言、模型与计费方式可能随时调整,请以 AWS 官网当前信息为准。完整实现据称放在配套的 GitHub 仓库中。