Сводка

Генерируйте речь, транскрибируйте аудио с временными метками и удаляйте фоны видео для прозрачных наложений.

  • Три CLI-команды (tts, transcribe, remove-background), каждая из которых загружает и кэширует свою модель при первом запуске; ключи API не требуются

  • Синтез речи поддерживает 54 голоса на разных языках (американский, британский, испанский, французский, хинди, итальянский, японский, португальский, мандарин) с контролем скорости; автоматическое определение языка по префиксу голоса

  • Расшифровка возвращает временные метки на уровне слов в нормализованном JSON; поддерживает несколько входных форматов (аудио, видео, SRT/VTT, ответы OpenAI) с настраиваемыми размерами моделей Whisper и явным выбором языка, чтобы предотвратить ошибки тихого перевода

  • Удаление фона выводит VP9 WebM с альфа-каналом (или ProRes/PNG) для прозрачных наложений; необязательный флаг --background-output создаёт обратно вырезанный слой для компоновки текста или графики между субъектом и фоном

HyperFrames Media

Создавайте аудио и медиа-активы, необходимые для композиции — озвучивание (TTS), фоновая музыка + звуковые эффекты, расшифровка, субтитры, удаление фона — затем используйте и анимируйте эти данные в HTML. Для размещения активов в композициях см. hyperframes-core.

Аудио-двигатель — один источник для TTS · BGM · SFX

Рабочие процессы НЕ пишут аудио вручную и не продают копию. Есть один движок — scripts/audio.mjs — который принимает нейтральный audio_request.json и записывает audio_meta.json (плюс ассеты в assets/voice|bgm|sfx):

# <MEDIA_DIR> = this skill's directory
node <MEDIA_DIR>/scripts/audio.mjs --request ./audio_request.json --hyperframes . --out ./audio_meta.json

Все три возможности ухудшаются из-за одного переключателя — независимо от того, присутствует ли учетная запись HeyGen (разрешено через $HEYGEN_API_KEY / $HYPERFRAMES_API_KEY / ~/.heygen, не через CLI):