"model":"qwen/qwen3-asr-flash-2026-02-10"
Qwen3-ASR-Flash — сервис автоматического распознавания речи от Alibaba, построенный на базе Qwen3-Omni и обученный на десятках миллионов часов мультимодальных речевых данных. Модель работает с 11 языками — включая китайский (с кантонским, сычуаньским, миньнаньским диалектами и диалектом у), английский, арабский, французский, немецкий, испанский, итальянский, португальский, русский, японский и корейский — и автоматически определяет язык, так что для аудио на нескольких языках ручная настройка не требуется.
Модель рассчитана на сложные акустические условия: она расшифровывает слова песен поверх фоновой музыки, справляется с зашумлёнными записями и записями, сделанными на большом расстоянии от микрофона, отфильтровывает тишину и неречевые звуки и принимает произвольный контекстный текст (имена, жаргон, предметную терминологию), чтобы сместить распознавание в сторону нужной лексики.
Итоговая стоимость каждого запроса — в ответе (usage.cost_rub) и в статистике.
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/transcriptions \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"qwen/qwen3-asr-flash-2026-02-10","file":"<base64-аудио>"}'
Модели распознавания речи доступны только по API — в чате их нет. Параметры запроса — в документации.