inception

Inception: Mercury 2.5

inception/mercury-2.5
Контекст
260 000
Вход токены
5,24 ₽/M
Выход токены
19,64 ₽/M
Кэш чтение
0,52 ₽/M
описание

Mercury 2.5 — это самая быстрая LLM для рассуждений и новейшая диффузионная LLM (dLLM) от Inception.

Вместо последовательной генерации токенов Mercury 2.5 создаёт и уточняет несколько токенов параллельно, достигая 1,107 токенов/сек на стандартных GPU. Он обеспечивает скачок интеллекта на 10+ пунктов по сравнению с Mercury 2, качество сопоставимо с оптимизированными по стоимости фронтирными моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.

Mercury 2.5 поддерживает настраиваемые уровни рассуждений, параллельные вызовы инструментов и вывод JSON, соответствующий схеме. Он создан для производственных нагрузок, где задержка накапливается: поисковые агенты, голосовые пайплайны и кодинг-субагенты. Подробнее в посте в блоге (открывается в новой вкладке).

модальности
интеграция

Как использовать через API

bash
# Запрос к API VEGA через inception/mercury-2.5
curl https://api.vega.chat/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $VEGA_API_KEY" \
  -d '{
    "model": "inception/mercury-2.5",
    "messages": [
      {  "role": "user", "content": "Hello!"  }
    ]
  }'