"model":"openai/whisper-large-v3"
Вход
Аудио
Выход
Текст
Тариф
За минуту аудио
Whisper Large V3 — открытая (open-source) модель автоматического распознавания речи от OpenAI, которая умеет и транскрибировать, и переводить аудио. Она поддерживает более 99 языков и принимает распространённые аудиоформаты, включая mp3, mp4, wav, webm, flac и ogg. Имея 1550 млн параметров, она достигает доли ошибок в словах (WER) 10,3% и хорошо подходит для устойчивой к шуму многоязычной транскрибации в сложных условиях. Поддерживает детализацию временных меток на уровне слов и сегментов.
Цена
Минута аудио0.057 ₽
Час аудио3,41 ₽
Итоговая стоимость каждого запроса — в ответе (usage.cost_rub) и в статистике.
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/transcriptions \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"openai/whisper-large-v3","file":"<base64-аудио>"}'
Модели распознавания речи доступны только по API — в чате их нет. Параметры запроса — в документации.