カテゴリ別に AI モデル API を探す

音声・スピーチモデル API

文字起こし、音声、リアルタイム体験向けの音声認識、音声合成、オーディオモデルです。

10 件の利用可能なモデル

モデル API の料金と機能を比較

モデルページで最新料金、エンドポイント、コンテキスト上限、関連 API を確認できます。

すべてのモデル料金
XiaomiMiMo

Xiaomi

mimo-v2.5-tts-voicedesign

无需参考音频,一句话描述即可生成全新音色。多维度语义理解,覆盖口音、年龄、气质与录音质感。
コンテキスト —
トークンベース
サプライヤー 1
無料
XiaomiMiMo

Xiaomi

mimo-v2.5-tts-voiceclone

数秒参考音频,即可高保真复刻目标音色。无需训练或标注,克隆后仍可叠加风格指令与情绪标签。
コンテキスト —
トークンベース
サプライヤー 1
無料
XiaomiMiMo

Xiaomi

mimo-v2.5-tts

精品音色语音合成,风格指令精准遵循。内联情绪标签逐字控制,零提示词捕捉角色气质。
コンテキスト —
トークンベース
サプライヤー 1
無料
XiaomiMiMo

Xiaomi

mimo-v2.5-asr

中英双语 + 多方言语音识别,无需语言标签,自动识别语码混用中的各语言内容。支持歌词转写,适应强噪声等复杂声学场景。
コンテキスト —
リクエストごと
サプライヤー 1
リクエスト$0.011/リクエスト
Suno

SUNO

suno_wav

Suno 将已有音乐导出为 WAV 音频。
コンテキスト —
トークンベース
サプライヤー 1
入力$75/1M出力$75/1M
Suno

SUNO

suno_stem

Suno 音轨分离接口,用于提取人声或乐器等分轨。
コンテキスト —
トークンベース
サプライヤー 1
入力$75/1M出力$75/1M
Suno

SUNO

suno_music

Suno 音乐生成接口,可根据文字提示创作音乐。
コンテキスト —
リクエストごと
サプライヤー 1
リクエスト$0.072/リクエスト
BaiLian

Alibaba

qwen3-omni-flash-realtime

千问实时音视频对话模型,可理解文本、图像和音视频输入,并流式输出文本与语音。
コンテキスト —
トークンベース
サプライヤー 2-30%
入力$3.584$2.5088/1M出力$7.168$5.0176/1M
BaiLian

Alibaba

qwen3-tts-instruct-flash-realtime

千问支持指令控制的实时文本转语音模型,可通过文字指令调整语音风格。
コンテキスト —
トークンベース
サプライヤー 2-30%
入力$75$52.5/1M出力$75$52.5/1M
BaiLian

Alibaba

qwen3.5-omni-flash-realtime

千问实时音视频对话模型,可理解文本、图像和音视频输入,并流式输出文本与语音。
コンテキスト —
トークンベース
サプライヤー 2-30%
入力$75$52.5/1M出力$75$52.5/1M