Mercury 2.5 — это самая быстрая LLM для рассуждений и новейшая диффузионная LLM (dLLM) от Inception.
Вместо последовательной генерации токенов Mercury 2.5 создаёт и уточняет несколько токенов параллельно, достигая 1,107 токенов/сек на стандартных GPU. Он обеспечивает скачок интеллекта на 10+ пунктов по сравнению с Mercury 2, качество сопоставимо с оптимизированными по стоимости фронтирными моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.
Mercury 2.5 поддерживает настраиваемые уровни рассуждений, параллельные вызовы инструментов и вывод JSON, соответствующий схеме. Он создан для производственных нагрузок, где задержка накапливается: поисковые агенты, голосовые пайплайны и кодинг-субагенты. Подробнее в посте в блоге (открывается в новой вкладке).
# Запрос к API VEGA через inception/mercury-2.5
curl https://api.vega.chat/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $VEGA_API_KEY" \
-d '{
"model": "inception/mercury-2.5",
"messages": [
{ "role": "user", "content": "Hello!" }
]
}'