Google: Gemini 3.1 Flash TTS Preview
"model":"google/gemini-3.1-flash-tts-preview"
Gemini 3.1 Flash TTS — модель озвучки текста от Google и заметный шаг вперёд по сравнению с Gemini 2.5 Flash TTS. Принимает текст и возвращает естественную речь: 30 фирменных голосов с разными характерами (от мягкого Achernar до бодрого Puck), поддержка более 20 языков, включая русский. Хороший баланс качества, скорости и цены — на ИИ-адаптере используется как модель по умолчанию для пресета «Сгенерировать речь» в чате.
Итоговая стоимость генерации видна в статистике и через GET /generation.
Параметры генерации
Обязательный параметр: текст, который модель произнесёт дословно.
Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callirrhoe, Autonoe, Enceladus, Iapetus, Umbriel, Algieba, Despina, Erinome, Algenib, Rasalgethi, Laomedeia, Achernar, Alnilam, Schedar, Gacrux, Pulcherrima — и ещё 6
mp3 или pcm (по умолчанию pcm; набор зависит от провайдера).
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/speech \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"google/gemini-3.1-flash-tts-preview","input":"Привет! Это тест озвучки.","voice":"Zephyr"}' \
--output speech.pcm
Ответ — сырые аудио-байты (по умолчанию pcm, 24 кГц моно;
mp3 — если модель поддерживает). Идентификатор генерации — в заголовке X-Generation-Id,
стоимость — GET /generation?id=…. Или без кода — в чате: пресет «Сгенерировать речь».