资源库
音频与语音 AI Models
面向语音识别、语音合成与音频理解的模型。
Eleven v3
ElevenLabs
ElevenLabs 语音合成模型,面向自然语音生成。
text-to-speech
音频与语音专有
GPT Transcribe
OpenAI
面向文件与实时输入的高精度语音转写模型。
speech-to-text
音频与语音专有
Qwen2-Audio
Alibaba
通义千问音频理解模型,支持语音输入对话。
speech-to-textopen-weightmultimodal
音频与语音开放权重
Scribe
ElevenLabs
ElevenLabs 语音转写模型,用于语音识别。
speech-to-text
音频与语音专有
speech-02-hd
MiniMax
MiniMax 高清语音合成模型。
text-to-speech
音频与语音专有
Stable Audio Open
Stability AI
Stability AI 开放音频生成模型,用于文本生成音频。
open-weight
音频与语音开放权重
TTS-1 HD
OpenAI
侧重音质的文本转语音模型。
text-to-speech
音频与语音专有
Voxtral
Mistral AI
Mistral 语音理解模型,面向音频输入任务。
speech-to-text
音频与语音专有
Whisper
OpenAI
通用语音识别模型,用于音频转写。
speech-to-text
音频与语音专有