Google: Gemini 3.8 Flash TTS

Чат с моделью
"model":"google/gemini-3.8-flash-tts"
Голоса
30
Вход
Текст
Выход
Речь

Gemini 3.8 Flash TTS — модель text-to-speech от Google, преемница Gemini 3.1 Flash TTS Preview. Это креативный уровень семейства 3.8 TTS: он подходит для дикторского чтения, озвучки персонажей и диалогов с несколькими говорящими, где точность передачи голоса, нюансы актёрской игры и охват региональных диалектов важнее задержки.

Она принимает ту же конфигурацию речи, что и её предшественница, включая 30 готовых студийных голосов, и поддерживает функции Google Voice Design (пользовательские голоса по текстовому описанию) и Voice Replication (голоса, клонированные по короткому образцу) через идентификаторы вида voice_....

ЦенаЗа 1M токенов
Вход (текст)63,18 ₽
Выход (аудио-токены)1 137,15 ₽

Итоговая стоимость генерации видна в статистике и через GET /generation.

Параметры генерации

inputТекст для озвучки

Обязательный параметр: текст, который модель произнесёт дословно.

voiceГолос

Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callirrhoe, Autonoe, Enceladus, Iapetus, Umbriel, Algieba, Despina, Erinome, Algenib, Rasalgethi, Laomedeia, Achernar, Alnilam, Schedar, Gacrux, Pulcherrima — и ещё 6

response_formatФормат аудио

mp3 или pcm (по умолчанию pcm; набор зависит от провайдера).

Быстрый старт

curl https://api.aiadapter.ru/api/v1/audio/speech \
  -H "Authorization: Bearer sk-aa-v1-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"google/gemini-3.8-flash-tts","input":"Привет! Это тест озвучки.","voice":"Zephyr"}' \
  --output speech.pcm

Ответ — сырые аудио-байты (по умолчанию pcm, 24 кГц моно; mp3 — если модель поддерживает). Идентификатор генерации — в заголовке X-Generation-Id, стоимость — GET /generation?id=…. Или без кода — в чате: пресет «Сгенерировать речь».