Qwen: Qwen-Audio-3.0-TTS Flash

"model":"qwen/qwen-audio-3.0-tts-flash"
Голоса
2
Вход
Текст
Выход
Речь

Qwen Audio 3.0 TTS Flash — быстрая модель озвучки текста от Alibaba. Ориентирована на низкую задержку и массовые сценарии; сильнее всего в китайском и английском.

ЦенаЗа 1M токенов
Вход (текст)1 895,25 ₽

Итоговая стоимость генерации видна в статистике и через GET /generation.

Параметры генерации

inputТекст для озвучки

Обязательный параметр: текст, который модель произнесёт дословно.

voiceГолос

loongjohn, longanhuan_v3.6

response_formatФормат аудио

mp3 или pcm (по умолчанию pcm; набор зависит от провайдера).

max_tokensЛимит ответа
presence_penaltyШтраф за присутствие
seedЗерно (seed)
temperatureТемпература
top_pTop-p (выборка ядра)

Быстрый старт

curl https://api.aiadapter.ru/api/v1/audio/speech \
  -H "Authorization: Bearer sk-aa-v1-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen/qwen-audio-3.0-tts-flash","input":"Привет! Это тест озвучки.","voice":"loongjohn"}' \
  --output speech.pcm

Ответ — сырые аудио-байты (по умолчанию pcm, 24 кГц моно; mp3 — если модель поддерживает). Идентификатор генерации — в заголовке X-Generation-Id, стоимость — GET /generation?id=…. Или без кода — в чате: пресет «Сгенерировать речь».