Генерирует talking head-видео и AI-аватаров через CLI belt: из портрета и текста с помощью встроенного TTS или из портрета и готового аудио. Подходит для роликов с виртуальными ведущими, UGC-контента и lipsync.
Возможности
- Запускает P-Video-Avatar, OmniHuman 1.5, Fabric 1.0 и PixVerse Lipsync через
belt app run. - P-Video-Avatar озвучивает текст встроенным TTS: доступны 30 голосов и 10 языков, разрешение до 1080p.
- Позволяет задавать голос и его подачу, а также стиль видео через
voice_promptиvideo_prompt. - Создаёт видео по готовому аудио; OmniHuman 1.5 поддерживает несколько людей в одном изображении.
- Поддерживает рабочий процесс для дубляжа: транскрибация, перевод, генерация речи и lipsync.
Когда использовать
- Нужно превратить портрет и текст в видео с виртуальным ведущим.
- Нужно сделать UGC-рекламу или несколько роликов с разными голосами.
- Нужно синхронизировать изображение с готовым аудио.
- Нужно озвучить видео на другом языке и заменить аудиодорожку.
Установка
npx skills add belt-sh/cli
Примеры
Создать talking head-видео из портрета и текста:
belt app run pruna/p-video-avatar --input '{
"image": "https://portrait.jpg",
"voice_script": "Welcome to our product walkthrough. Today I will show you three key features.",
"voice": "Puck (Male)",
"voice_language": "English (US)",
"resolution": "720p"
}'
Создать видео по портрету и готовому аудио:
belt app run bytedance/omnihuman-1-5 --input '{
"image_url": "https://portrait.jpg",
"audio_url": "https://speech.mp3"
}'
Сгенерировать речь, затем использовать её для видео с аватаром:
belt app run inworld/text-to-speech-2 --input '{
"text": "[friendly] Welcome to our product demo!",
"voice_id": "Sarah",
"delivery_mode": "CREATIVE"
}' > speech.json
belt app run bytedance/omnihuman-1-5 --input '{
"image_url": "https://presenter-photo.jpg",
"audio_url": "<audio-url-from-step-1>"
}'