S
Sesame: CSM 1B
"model":"sesame/csm-1b"
Голоса
7
Вход
Текст
Выход
Речь
Sesame CSM-1B — компактная открытая разговорная модель речи (Conversational Speech Model) от Sesame. Лёгкая и дешёвая озвучка коротких реплик; английский язык.
ЦенаЗа 1M токенов
Вход (текст)884,45 ₽
Итоговая стоимость генерации видна в статистике и через GET /generation.
Параметры генерации
inputТекст для озвучки
Обязательный параметр: текст, который модель произнесёт дословно.
voiceГолос
conversational_a, conversational_b, read_speech_a, read_speech_b, read_speech_c, read_speech_d, none
response_formatФормат аудио
mp3 или pcm (по умолчанию pcm; набор зависит от провайдера).
frequency_penaltyШтраф за частоту
max_tokensЛимит ответа
min_pMin-p
presence_penaltyШтраф за присутствие
repetition_penaltyШтраф за повторы
seedЗерно (seed)
stopСтоп-последовательности
temperatureТемпература
top_kTop-k
top_pTop-p (выборка ядра)
Быстрый старт
curl https://api.aiadapter.ru/api/v1/audio/speech \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"sesame/csm-1b","input":"Привет! Это тест озвучки.","voice":"conversational_a"}' \
--output speech.pcm
Ответ — сырые аудио-байты (по умолчанию pcm, 24 кГц моно;
mp3 — если модель поддерживает). Идентификатор генерации — в заголовке X-Generation-Id,
стоимость — GET /generation?id=…. Или без кода — в чате: пресет «Сгенерировать речь».