"model":"heygen/avatar-iv"
HeyGen: Avatar IV — модель image-to-video, которая превращает одну фотографию в выразительное видео с «говорящей головой» и синхронизацией губ. Она не просто подбирает форму рта под слова, а интерпретирует тон голоса, ритм и эмоции в аудио, чтобы управлять движениями головы, мимикой и жестами, и выдаёт результат в разрешении до 1080p.
Звучащая речь берётся из одного из двух источников: текстового сценария, который модель озвучивает с помощью HeyGen text-to-speech, или предоставленной аудиодорожки, под которую напрямую синхронизируются губы на изображении. Сквозные (passthrough) параметры позволяют выбрать голос, настроить его параметры, задать выразительность, описать промптом конкретные движения, заменить или удалить фон, добавить субтитры и задать название видео.
Параметры генерации
720p, 1080p
16:9, 9:16, 1:1
Передаётся модели как есть.
Передаётся модели как есть.
Передаётся модели как есть.
Передаётся модели как есть.
Передаётся модели как есть.
Передаётся модели как есть.
Передаётся модели как есть.
Передаётся модели как есть.
Передаётся модели как есть.
Быстрый старт
curl https://api.aiadapter.ru/api/v1/videos \
-H "Authorization: Bearer sk-aa-v1-..." \
-H "Content-Type: application/json" \
-d '{"model":"heygen/avatar-iv","prompt":"Кот играет на пианино"}'
Генерация асинхронная: в ответ придёт id задачи;
статус — GET /videos/{id}, готовый файл — GET /videos/{id}/content
(подробнее в доке). Или без кода — в чате: режим «Видео».