快讯
字节跳动推出音视频全双工大模型 SeedRealtime
字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,基于统一架构原生融合音频、视频与文本,实现”边看、边听、边说”的实时多模态交互。模型具备音视频联合理解、主动交互与流畅对话节奏三大核心能力,端到端评测显示对话节奏问题较级联模型减少一半。
字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,基于统一架构原生融合音频、视频与文本,实现”边看、边听、边说”的实时多模态交互。模型具备音视频联合理解、主动交互与流畅对话节奏三大核心能力,端到端评测显示对话节奏问题较级联模型减少一半。