xiaomi
XiaomiMiMo

Xiaomi: MiMo-V2-Omni

xiaomi/mimo-v2-omni
Контекст
262 144
Вход токены
49,22 ₽/M
Выход токены
246,11 ₽/M
Кэш чтение
9,84 ₽/M
описание

MiMo-V2-Omni — передовая омни‑модальная модель, которая нативно обрабатывает изображения, видео и аудио входы в единой архитектуре. Она сочетает сильное мультимодальное восприятие с агентными возможностями — визуальное привязочное, многошаговое рассуждение, генерацию кода, планирование и взаимодействие с внешними инструментами. Модель обучена на огромном наборе данных, включающем более 10 млн изображений, 5 млн видеоклипов и 20 млн аудиофайлов, а также на разнообразных текстовых корпусах, что обеспечивает ей обширные знания в разных предметных областях. Благодаря унифицированному токену, MiMo-V2-Omni может одновременно принимать несколько модальностей, объединяя их в единый контекстный поток, что позволяет выполнять задачи, такие как: описание сцены на основе изображения и аудио, ответы на вопросы, требующие визуального и звукового анализа, генерация видео‑подсказок, синхронный перевод речи в реальном времени и многое другое. Архитектура поддерживает динамическое масштабирование вычислений, позволяя эффективно использовать как небольшие, так и крупные вычислительные ресурсы. MiMo-V2-Omni также включает механизм безопасного реагирования, который снижает риск генерации вредоносного или недостоверного контента, а также поддерживает настройку под конкретные задачи и домены.

модальности
+
+
+
интеграция

Как использовать через API

bash
# Запрос к API VEGA через xiaomi/mimo-v2-omni
curl https://api.vega.chat/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $VEGA_API_KEY" \
  -d '{
    "model": "xiaomi/mimo-v2-omni",
    "messages": [
      {  "role": "user", "content": "Hello!"  }
    ]
  }'