"model":"microsoft/mai-transcribe-2"
MAI-Transcribe 2 — многоязычная модель speech-to-text от Microsoft AI, занимающая первое место в многоязычном бенчмарке FLEURS. Поддерживает 60 языков с автоматическим определением языка, переключение между языками (code switching) для смешанной речи, диаризацию спикеров, временные метки на уровне слов, приоритизацию ключевых слов для предметной терминологии и настраиваемые стили транскрибации — дословный или «чистый». Подходит для титров, расшифровки звонков, создания субтитров, задач доступности и других приложений с голосовыми функциями и работает быстрее, чем MAI-Transcribe-1.5, на длинных аудиозаписях.
Задайте для response_format значение "verbose_json", чтобы получить временные метки сегментов, и добавьте timestamp_granularities: ["word"] для временных меток на уровне слов. Чтобы получить метки спикеров, установите для provider.options.azure.diarization.enabled значение true, ключевые слова передавайте через provider.options.azure.phraseList.phrases, а стиль транскрибации выбирайте через provider.options.azure.enhancedMode.modelOptions.transcribeStyle.
Итоговая стоимость каждого запроса — в ответе (usage.cost_rub) и в статистике.
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/transcriptions \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"microsoft/mai-transcribe-2","file":"<base64-аудио>"}'
Модели распознавания речи доступны только по API — в чате их нет. Параметры запроса — в документации.