API VEGA
DeepSeek V4.1 Flash - эволюция или революция?
Открыть галерею
10 сентября 2026 г.

DeepSeek V4.1 Flash - эволюция или революция?

DeepSeek выпустила V4.1 Flash, и модель уже доступна на VEGA (ru.vega.chat) и через API VEGA.

Что это за модель

DeepSeek-V4.1-Flash: мультимодальная MoE-модель с 552B параметров в основе и контекстом до 1 миллиона токенов. Модель работает с текстом и изображениями из коробки, без отдельных vision-версий.

Архитектура новая. DeepSeek называет её Causal Encoder-Decoder (CED): 40 слоёв трансформера, разбитые на 20 слоёв энкодера и 20 слоёв декодера. Из-за этого при обработке входа активируется всего 8B параметров, при генерации 16B. У предыдущего V4-Flash активировалось 13B, а у V4-Pro все 49B.

Результаты DeepSeek-V4.1-Flash на агентных бенчмарках

Уровень Opus по тестам DeepSeek

DeepSeek провела тесты и сообщает, что V4.1-Flash обходит V4-Pro по производительности, стоимости, скорости и общему времени работы. V4-Pro постепенно выводится из эксплуатации.

В сравнении с фронтальными моделями V4.1-Flash конкурирует с Opus-5.0, GPT-5.6, K3 и GLM-5.3. Важно: это тесты самой DeepSeek, не независимые.

По агентным бенчмаркам V4.1-Flash местами обходит Opus-5.0:

  • Terminal-Bench 2.1: 90.6 у Flash против 89.1 у Opus
  • DeepSWE v1.1: 74.2 против 74.0
  • CyberGym: 88.1, лучший результат в таблице
  • AutomationBench: 54.8 против 50.3
  • Agent's Last Exam: 31.8 против 28.6

По чистому рассуждению (HLE) Opus впереди: 56.3 против 36.8. Но для агентных задач и кода Flash выглядит сильнее.

Сравнение V4.1-Flash с фронтальными моделями

В коде тоже неплохо: HumanEval 79.4, BigCodeBench 60.6, Codeforces Rating 3471. Все три результата лучшие в таблице.

KV cache: 4 раза меньше

DeepSeek сильно поработала над сжатием KV cache. По сравнению с предыдущим поколением V4.1-Flash требует в 4 раза меньше HBM и в 8 раз меньше SSD-хранилища. Глобальный след KV cache: 890 байт на токен, примерно четверть от V4-Flash.

Размер KV cache на токен по поколениям DeepSeek

Для агентов это особенно полезно. Cache-hit charges часто составляют большую часть расходов на агентов, и сжатие cache снижает эти расходы.

Дешёвая и быстрая

Модель дешевле предыдущих версий. Новая архитектура позволяет обслуживать больше пользователей по меньшей цене, и DeepSeek передаёт эту экономию пользователям.

На API VEGA модель доступна под именем deepseek-flash. Старые имена deepseek-v4-flash и deepseek-v4-flash-vision-exp временно направляются на V4.1-Flash для совместимости.

Для чего подходит

Повседневные задачи, агенты, вайб-кодинг. Контекст 1M токенов, нативная работа с изображениями, настраиваемое reasoning effort от 1 до 100. Можно менять глубину рассуждения под задачу: быстро и дёшево или глубоко и точно.

Для вайб-кодинга модель хорошо показывает себя на агентных бенчмарках, работает с длинным контекстом и понимает изображения: скриншоты, диаграммы, интерфейсы.

Для агентов: низкая стоимость KV cache, быстрый inference, 1M контекст. Agent's Last Exam, AutomationBench и Terminal-Bench все в пользу Flash.

Открытый исходный код

Модель выложена под лицензией MIT. Веса, технический отчёт и код для инференса доступны всем.

Комментарии

0/5000

Поддержка Markdown