Meta: Muse Voice Transcribe 1.0

Документация API
"model":"meta/muse-voice-transcribe-1.0"
Вход
Аудио
Выход
Текст
Тариф
За минуту аудио

Muse Voice Transcribe 1.0 — синхронная модель speech-to-text от Meta. Подходит для сценариев push-to-talk, определения конца реплики (endpointing) и транскрибации с учётом говорящих; поддерживает приоритизацию ключевых слов для предметных терминов и приоритизацию языка с помощью подсказок с названием языка. Принимает монофоническое аудио WAV в формате 16-битного PCM с частотой 16 кГц или 24 кГц для записей длительностью до 10 минут. Не предоставляет временных меток на уровне слов и оценок уверенности, а другие аудиоформаты перед загрузкой необходимо конвертировать в WAV.

Цена
Минута аудио0.379 ₽
Час аудио22,74 ₽

Итоговая стоимость каждого запроса — в ответе (usage.cost_rub) и в статистике.

Быстрый старт

curl https://api.aiadapter.ru/api/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-aa-v1-..." \
  -H "Content-Type: application/json" \
  -d '{"model":"meta/muse-voice-transcribe-1.0","file":"<base64-аудио>"}'

Модели распознавания речи доступны только по API — в чате их нет. Параметры запроса — в документации.