API VEGA

Генерирует talking head-видео и AI-аватаров через CLI belt: из портрета и текста с помощью встроенного TTS или из портрета и готового аудио. Подходит для роликов с виртуальными ведущими, UGC-контента и lipsync.

Возможности

  • Запускает P-Video-Avatar, OmniHuman 1.5, Fabric 1.0 и PixVerse Lipsync через belt app run.
  • P-Video-Avatar озвучивает текст встроенным TTS: доступны 30 голосов и 10 языков, разрешение до 1080p.
  • Позволяет задавать голос и его подачу, а также стиль видео через voice_prompt и video_prompt.
  • Создаёт видео по готовому аудио; OmniHuman 1.5 поддерживает несколько людей в одном изображении.
  • Поддерживает рабочий процесс для дубляжа: транскрибация, перевод, генерация речи и lipsync.

Когда использовать

  • Нужно превратить портрет и текст в видео с виртуальным ведущим.
  • Нужно сделать UGC-рекламу или несколько роликов с разными голосами.
  • Нужно синхронизировать изображение с готовым аудио.
  • Нужно озвучить видео на другом языке и заменить аудиодорожку.

Установка

npx skills add belt-sh/cli

Примеры

Создать talking head-видео из портрета и текста:

belt app run pruna/p-video-avatar --input '{
  "image": "https://portrait.jpg",
  "voice_script": "Welcome to our product walkthrough. Today I will show you three key features.",
  "voice": "Puck (Male)",
  "voice_language": "English (US)",
  "resolution": "720p"
}'

Создать видео по портрету и готовому аудио:

belt app run bytedance/omnihuman-1-5 --input '{
  "image_url": "https://portrait.jpg",
  "audio_url": "https://speech.mp3"
}'

Сгенерировать речь, затем использовать её для видео с аватаром:

belt app run inworld/text-to-speech-2 --input '{
  "text": "[friendly] Welcome to our product demo!",
  "voice_id": "Sarah",
  "delivery_mode": "CREATIVE"
}' > speech.json

belt app run bytedance/omnihuman-1-5 --input '{
  "image_url": "https://presenter-photo.jpg",
  "audio_url": "<audio-url-from-step-1>"
}'