"model":"bytedance-seed/seed-audio-1-0"
Seed Audio 1.0 — непотоковая модель генерации аудио от ByteDance Seed. Она создаёт речь и другие звуки по текстовому промпту на естественном языке, в котором можно описать желаемый голос, тон и звуковые эффекты; дополнительно можно задать идентификатор диктора Seed (speaker ID) или референсный аудиофрагмент для клонирования голоса. Результат ограничен 120 секундами на запрос и тарифицируется за каждую секунду сгенерированного аудио. Подходит для аудиокниг, закадровой озвучки, игр и схожих задач.
Итоговая стоимость генерации видна в статистике и через GET /generation.
Параметры генерации
Обязательный параметр: текст, который модель произнесёт дословно.
Произвольный идентификатор голоса провайдера.
mp3 или pcm (по умолчанию pcm; набор зависит от провайдера).
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/speech \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"bytedance-seed/seed-audio-1-0","input":"Привет! Это тест озвучки.","voice":"alloy"}' \
--output speech.pcm
Ответ — сырые аудио-байты (по умолчанию pcm, 24 кГц моно;
mp3 — если модель поддерживает). Идентификатор генерации — в заголовке X-Generation-Id,
стоимость — GET /generation?id=…. Или без кода — в чате: пресет «Сгенерировать речь».