Explorer les API de modèles IA par catégorie

API de modèles audio et vocaux

Modèles de reconnaissance vocale, de synthèse vocale et audio pour la transcription, la voix et les expériences en temps réel.

10 modèles disponibles

Comparer les tarifs et capacités des API de modèles

Ouvrez la page d’un modèle pour consulter les tarifs actuels, les points de terminaison, les limites de contexte et les API associées.

Tarifs de tous les modèles
XiaomiMiMo

Xiaomi

mimo-v2.5-tts-voicedesign

无需参考音频,一句话描述即可生成全新音色。多维度语义理解,覆盖口音、年龄、气质与录音质感。
Contexte —
Basé sur les jetons
Fournisseurs 1
Gratuit
XiaomiMiMo

Xiaomi

mimo-v2.5-tts-voiceclone

数秒参考音频,即可高保真复刻目标音色。无需训练或标注,克隆后仍可叠加风格指令与情绪标签。
Contexte —
Basé sur les jetons
Fournisseurs 1
Gratuit
XiaomiMiMo

Xiaomi

mimo-v2.5-tts

精品音色语音合成,风格指令精准遵循。内联情绪标签逐字控制,零提示词捕捉角色气质。
Contexte —
Basé sur les jetons
Fournisseurs 1
Gratuit
XiaomiMiMo

Xiaomi

mimo-v2.5-asr

中英双语 + 多方言语音识别,无需语言标签,自动识别语码混用中的各语言内容。支持歌词转写,适应强噪声等复杂声学场景。
Contexte —
Par demande
Fournisseurs 1
Requête$0.011/requête
Suno

SUNO

suno_wav

Suno 将已有音乐导出为 WAV 音频。
Contexte —
Basé sur les jetons
Fournisseurs 1
Entree$75/1MSortie$75/1M
Suno

SUNO

suno_stem

Suno 音轨分离接口,用于提取人声或乐器等分轨。
Contexte —
Basé sur les jetons
Fournisseurs 1
Entree$75/1MSortie$75/1M
Suno

SUNO

suno_music

Suno 音乐生成接口,可根据文字提示创作音乐。
Contexte —
Par demande
Fournisseurs 1
Requête$0.072/requête
BaiLian

Alibaba

qwen3-omni-flash-realtime

千问实时音视频对话模型,可理解文本、图像和音视频输入,并流式输出文本与语音。
Contexte —
Basé sur les jetons
Fournisseurs 2-30%
Entree$3.584$2.5088/1MSortie$7.168$5.0176/1M
BaiLian

Alibaba

qwen3-tts-instruct-flash-realtime

千问支持指令控制的实时文本转语音模型,可通过文字指令调整语音风格。
Contexte —
Basé sur les jetons
Fournisseurs 2-30%
Entree$75$52.5/1MSortie$75$52.5/1M
BaiLian

Alibaba

qwen3.5-omni-flash-realtime

千问实时音视频对话模型,可理解文本、图像和音视频输入,并流式输出文本与语音。
Contexte —
Basé sur les jetons
Fournisseurs 2-30%
Entree$75$52.5/1MSortie$75$52.5/1M