AB
AiBoss
ニュース

讯飞开放 Spark-Audio-1.0-Preview 体验,支持多语言音频理解

科大讯飞上线 Spark-Audio-1.0-Preview 体验,支持语音转写、翻译、说话人识别及复杂音频问答。官方称模型基于国产算力训练,覆盖99种语言和202种方言;API 仍待后续上线。

科大讯飞宣布 Spark-Audio-1.0-Preview 开放体验,直接处理文本和音频输入。该语音基座模型支持转写、多语言翻译、方言识别、环境音识别、说话人识别、情感分析及复杂音频问答。

按官方说明,模型由0.65B音频编码器与30B-A3B混合专家语言模型构成,基于国产算力集群训练,语音识别覆盖99种语言与202种方言。当前开放的是预览体验,API 后续才将上线讯飞开放平台;厂商评测结果不等同于所有真实场景的独立性能保证。

参考:科大讯飞公告官方体验入口