AB
AiBoss
News

AWS 发布 WhisperX 深度学习容器,在 SageMaker AI 上实现带说话人标注的转录

AWS 博客介绍如何在 Amazon SageMaker AI 上部署 WhisperX 深度学习容器,为语音转文字加入逐词时间戳与说话人分离,并支持实时与异步两种端点。

AWS 推出 WhisperX 深度学习容器

AWS 官方博客发布技术文章,介绍如何在 Amazon SageMaker AI 上使用 WhisperX 深度学习容器(DLC)完成带说话人标注的语音转录。据该文章描述,这一容器已预置 Whisper、对齐模型与说话人分离权重,无需 Hugging Face 令牌,可直接部署到 SageMaker AI 的实时或异步端点,无需自行构建镜像。容器遵循 SageMaker AI 标准服务约定:在 8080 端口提供服务,推理接口为 POST /invocations,健康检查为 GET /ping;请求采用 multipart/form-data,音频作为文件部分,并可附带 language、diarize、response_format 等字符串字段;输出支持 json、verbose_json、srt 与 vtt 格式。

背景与适用场景

文章指出,通用语音转文字在两类需求上存在短板:时间戳通常停留在语句级别,误差可达数秒;同时无法可靠回答“谁说了什么”。WhisperX 在 OpenAI 的 Whisper 基础上加入批量推理、wav2vec2 强制对齐以获得逐词时间戳,以及说话人分离能力。文章列举的适用场景包括呼叫中心通话分析、会议记录、播客、庭审记录与广播媒体,以及医疗、法律、金融等受监管领域的审计与取证。在端点选择上,文章建议长音频使用异步端点,短小交互式片段使用实时端点,后者需在 SageMaker AI 的 60 秒响应上限内完成。文章还提到实例选择(如 ml.g4dn.xlarge 与 ml.g5.2xlarge)与 GPU AMI 固定要求,并说明吞吐量通过增加实例而非并发来扩展。

限制与来源说明

以上内容整理自 AWS 官方博客文章《Speaker-labeled transcription with WhisperX on SageMaker AI》,作者署名为 Ayush Sharma、Dmitry Soldatkin、Yadan Wei 与 Daniel Wirjo。本文未对转录准确率、延迟、吞吐量等指标做任何实测,也未涉及定价、区域可用性或配额数值,相关细节请以 AWS 官网与官方文档当前信息为准。文中提及的实例类型、镜像地址与服务配额均需以实际账户与所在区域的支持情况为准。