Mercury 2.5 — это самая быстрая LLM для рассуждений и новейшая диффузионная LLM (dLLM) от Inception.
Вместо последовательной генерации токенов Mercury 2.5 создаёт и уточняет несколько токенов параллельно, достигая 1 107 токенов/сек на стандартных GPU. Он обеспечивает скачок интеллекта на 10+ баллов по сравнению с Mercury 2 и качество, сопоставимое с оптимизированными по стоимости фронтирными моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.
Mercury 2.5 поддерживает настраиваемые уровни рассуждений, параллельные вызовы инструментов и вывод JSON в соответствии со схемой. Он создан для продакшн-нагрузок, где задержка критична: поисковые агенты, голосовые пайплайны и субагенты для написания кода.
# Запрос к API VEGA через inception/mercury-2.5-preview
curl https://api.vega.chat/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $VEGA_API_KEY" \
-d '{
"model": "inception/mercury-2.5-preview",
"messages": [
{ "role": "user", "content": "Hello!" }
]
}'