HeyGen: Avatar IV — это модель преобразования изображения в видео, которая оживляет одно фото в выразительное видео с говорящей головой и синхронизацией губ. Вместо того чтобы просто сопоставлять формы рта со словами, она интерпретирует вокальный тон, ритм и эмоции аудио, чтобы управлять движениями головы, мимикой и жестами, создавая результат с разрешением до 1080p.
Речевое аудио поступает из одного из двух источников: текстового сценария, который модель озвучивает с помощью HeyGen text-to-speech, или предоставленной аудиодорожки, с которой изображение синхронизируется по губам напрямую. Сквозные параметры позволяют выбрать голос, настроить параметры голоса, задать выразительность, указать конкретные движения, заменить или удалить фон, добавить субтитры и озаглавить видео.
| Параметр | USD | RUB |
|---|---|---|
| за секунду | 0.0700 $ | 5,98 ₽ |
# Запрос к API VEGA через heygen/avatar-iv
curl https://api.vega.chat/api/v1/videos \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $VEGA_API_KEY" \
-d '{
"aspect_ratio": "16:9",
"duration": 8,
"model": "heygen/avatar-iv",
"prompt": "A serene mountain landscape at sunset",
"resolution": "720p"
}'