"model":"nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b"
Вход
Аудио
Выход
Текст
Тариф
За минуту аудио
Nemotron 3.5 ASR Streaming Multilingual 0.6B — модель распознавания речи от NVIDIA. Её архитектура FastConformer-RNNT с обусловливанием промптом и учётом кеша (cache-aware) нацелена на транскрибацию с низкой задержкой более чем на 40 языках — для субтитров в реальном времени, голосовых агентов и конвейеров многоязычной транскрибации.
Цена
Минута аудио0.025 ₽
Час аудио1,51 ₽
Итоговая стоимость каждого запроса — в ответе (usage.cost_rub) и в статистике.
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/transcriptions \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b","file":"<base64-аудио>"}'
Модели распознавания речи доступны только по API — в чате их нет. Параметры запроса — в документации.