Сводка
Генерируйте речь, транскрибируйте аудио с временными метками и удаляйте фоны видео для прозрачных наложений.
-
Три CLI-команды (
tts,transcribe,remove-background), каждая из которых загружает и кэширует свою модель при первом запуске; ключи API не требуются -
Синтез речи поддерживает 54 голоса на разных языках (американский, британский, испанский, французский, хинди, итальянский, японский, португальский, мандарин) с контролем скорости; автоматическое определение языка по префиксу голоса
-
Расшифровка возвращает временные метки на уровне слов в нормализованном JSON; поддерживает несколько входных форматов (аудио, видео, SRT/VTT, ответы OpenAI) с настраиваемыми размерами моделей Whisper и явным выбором языка, чтобы предотвратить ошибки тихого перевода
-
Удаление фона выводит VP9 WebM с альфа-каналом (или ProRes/PNG) для прозрачных наложений; необязательный флаг
--background-outputсоздаёт обратно вырезанный слой для компоновки текста или графики между субъектом и фоном
HyperFrames Media
Создавайте аудио и медиа-активы, необходимые для композиции — озвучивание (TTS), фоновая музыка + звуковые эффекты, расшифровка, субтитры, удаление фона — затем используйте и анимируйте эти данные в HTML. Для размещения активов в композициях см. hyperframes-core.
Аудио-двигатель — один источник для TTS · BGM · SFX
Рабочие процессы НЕ пишут аудио вручную и не продают копию. Есть один движок — scripts/audio.mjs — который принимает нейтральный audio_request.json и записывает audio_meta.json (плюс ассеты в assets/voice|bgm|sfx):
# <MEDIA_DIR> = this skill's directory
node <MEDIA_DIR>/scripts/audio.mjs --request ./audio_request.json --hyperframes . --out ./audio_meta.json
Все три возможности ухудшаются из-за одного переключателя — независимо от того, присутствует ли учетная запись HeyGen (разрешено через $HEYGEN_API_KEY / $HYPERFRAMES_API_KEY / ~/.heygen, не через CLI):