google
Google

Google: Gemini 3.1 Flash TTS Preview

google/gemini-3.1-flash-tts-preview
Контекст
32 768
Вход токены
123,05 ₽/M
Выход токены
2461,1 ₽/M
описание

Gemini 3.1 Flash TTS Preview — это модель преобразования текста в речь от Google, представляющая собой значительный генерационный скачок по сравнению с Gemini 2.5 Flash TTS. Она принимает текстовый ввод и генерирует аудиовывод более чем на 70 языках — почти в 3 раза больше языкового охвата, чем у предшественника.

Главным нововведением является система из более чем 200 встроенных аудиотегов (например, [whispers], [laughs], [excited]), позволяющая разработчикам управлять подачей, эмоциями и темпом произношения прямо в середине предложения, а также рабочий процесс «director's chair» в Google AI Studio для определения аудиопрофилей для каждого персонажа и контекста на уровне сцены. Поддерживается до двух говорящих с независимой настройкой голоса и стиля для каждого говорящего, вывод PCM‑аудио с частотой 24 kHz / 16‑бит моно, и автоматическое добавление водяного знака SynthID ко всему выводу. Размер контекстного окна составляет 32 k токенов.

модальности
интеграция

Как использовать через API

bash
# Запрос к API VEGA через google/gemini-3.1-flash-tts-preview
curl https://api.vega.chat/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $VEGA_API_KEY" \
  -d '{
    "model": "google/gemini-3.1-flash-tts-preview",
    "messages": [
      {  "role": "user", "content": "Hello!"  }
    ]
  }'