"model":"meta/muse-voice-transcribe-1.0"
Muse Voice Transcribe 1.0 — синхронная модель speech-to-text от Meta. Подходит для сценариев push-to-talk, определения конца реплики (endpointing) и транскрибации с учётом говорящих; поддерживает приоритизацию ключевых слов для предметных терминов и приоритизацию языка с помощью подсказок с названием языка. Принимает монофоническое аудио WAV в формате 16-битного PCM с частотой 16 кГц или 24 кГц для записей длительностью до 10 минут. Не предоставляет временных меток на уровне слов и оценок уверенности, а другие аудиоформаты перед загрузкой необходимо конвертировать в WAV.
Итоговая стоимость каждого запроса — в ответе (usage.cost_rub) и в статистике.
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/transcriptions \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"meta/muse-voice-transcribe-1.0","file":"<base64-аудио>"}'
Модели распознавания речи доступны только по API — в чате их нет. Параметры запроса — в документации.