MiniMax 公布 API 能力总览:覆盖文本、视频、语音、图像与音乐生成
MiniMax 官方 API 文档页梳理了其开放接口的整体能力范围,涵盖大语言模型、视频生成、语音合成、图像生成、音乐生成与文件管理,并给出各能力对应的模型清单与接入方式。
核心事实
据 MiniMax 官方 API 文档的「API Overview」页面,该平台对外提供的接口能力覆盖多个方向:大语言模型、视频生成、语音、图像生成、音乐生成以及文件管理。文档列出了各方向对应的模型清单,例如语言模型包括 MiniMax M3.1-Flash-Preview、MiniMax M3、MiniMax M2.7、MiniMax M2.5、MiniMax M2.1、MiniMax M2 及其 highspeed 版本;视频方向列出 MiniMax-H3 与 MiniMax-H3-Max;语音方向列出 speech-2.8-hd、speech-2.8-turbo、speech-2.6-hd、speech-2.6-turbo、speech-02-hd、speech-02-turbo;图像方向列出 image-01;音乐方向列出 music-3.0。文档同时说明,语言模型可通过 HTTP 请求、Anthropic SDK(文档标注为推荐)或 OpenAI SDK 接入。
背景与影响
从文档结构看,MiniMax 在语言模型上同时提供 Anthropic 与 OpenAI 两套兼容接口,降低了已有 SDK 使用者的迁移成本。视频方向采用异步任务模式,创建任务后返回 task_id,再通过查询接口获取状态与结果,并支持列出、取消或删除任务。语音方向强调接口无状态,单次调用只处理当次输入;文档称语音合成支持 40 种语言与 300 多个系统音色,并提供同步与异步两种长文本合成路径。此外,文档提到 web_search 为服务端托管的联网搜索工具,并提供官方 MCP 的 Python 与 JavaScript 实现。音乐生成方面,文档称自 2026 年 8 月 20 日起付费音乐与歌词生成 API 不再向新用户开放,免费音乐生成 API 将停止服务,具体安排以官方页面为准。
限制与来源
以上内容整理自 MiniMax 官方 API 文档页面(platform.minimax.io/docs/api-reference/api-overview),属于厂商自述的能力说明,本文未做独立验证。文档中涉及的具体模型可用范围、上下文长度、分辨率、时长、字符数上限、音色数量、语言数量、任务记录保留时间、下载链接有效期以及音乐 API 的调整时间等,均可能随官方更新而变化;部分模型(如 MiniMax-M3.1-Flash-Preview)文档称目前仅通过 Token Plan 与 MiniMax Code 提供。实际计费方式、地区可用性、账号与语言支持等,请以官网当前信息为准。本文不构成任何投资或采购建议。