Google: Gemini 3.5 Transcribe

Документация API
"model":"google/gemini-3.5-transcribe"
Вход
Аудио
Выход
Текст
Тариф
За токены

Gemini 3.5 Transcribe — модель speech-to-text от Google. Подходит для синхронной транскрибации, где нужны временные метки на уровне слов или диаризация спикеров, с поддержкой до восьми говорящих. Длительность аудио — до одного часа либо до 30 минут, если включены временные метки или диаризация.

Цена
Входза 1M токенов252,7 ₽
Выходза 1M токенов1 516,2 ₽

Итоговая стоимость каждого запроса — в ответе (usage.cost_rub) и в статистике.

Быстрый старт

curl https://api.aiadapter.ru/api/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-aa-v1-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"google/gemini-3.5-transcribe","file":"<base64-аудио>"}'

Модели распознавания речи доступны только по API — в чате их нет. Параметры запроса — в документации.