
DeepSeek выпустила V4.1 Flash, и модель уже доступна на VEGA (ru.vega.chat) и через API VEGA.
DeepSeek-V4.1-Flash: мультимодальная MoE-модель с 552B параметров в основе и контекстом до 1 миллиона токенов. Модель работает с текстом и изображениями из коробки, без отдельных vision-версий.
Архитектура новая. DeepSeek называет её Causal Encoder-Decoder (CED): 40 слоёв трансформера, разбитые на 20 слоёв энкодера и 20 слоёв декодера. Из-за этого при обработке входа активируется всего 8B параметров, при генерации 16B. У предыдущего V4-Flash активировалось 13B, а у V4-Pro все 49B.

DeepSeek провела тесты и сообщает, что V4.1-Flash обходит V4-Pro по производительности, стоимости, скорости и общему времени работы. V4-Pro постепенно выводится из эксплуатации.
В сравнении с фронтальными моделями V4.1-Flash конкурирует с Opus-5.0, GPT-5.6, K3 и GLM-5.3. Важно: это тесты самой DeepSeek, не независимые.
По агентным бенчмаркам V4.1-Flash местами обходит Opus-5.0:
По чистому рассуждению (HLE) Opus впереди: 56.3 против 36.8. Но для агентных задач и кода Flash выглядит сильнее.

В коде тоже неплохо: HumanEval 79.4, BigCodeBench 60.6, Codeforces Rating 3471. Все три результата лучшие в таблице.
DeepSeek сильно поработала над сжатием KV cache. По сравнению с предыдущим поколением V4.1-Flash требует в 4 раза меньше HBM и в 8 раз меньше SSD-хранилища. Глобальный след KV cache: 890 байт на токен, примерно четверть от V4-Flash.

Для агентов это особенно полезно. Cache-hit charges часто составляют большую часть расходов на агентов, и сжатие cache снижает эти расходы.
Модель дешевле предыдущих версий. Новая архитектура позволяет обслуживать больше пользователей по меньшей цене, и DeepSeek передаёт эту экономию пользователям.
На API VEGA модель доступна под именем deepseek-flash. Старые имена deepseek-v4-flash и deepseek-v4-flash-vision-exp временно направляются на V4.1-Flash для совместимости.
Повседневные задачи, агенты, вайб-кодинг. Контекст 1M токенов, нативная работа с изображениями, настраиваемое reasoning effort от 1 до 100. Можно менять глубину рассуждения под задачу: быстро и дёшево или глубоко и точно.
Для вайб-кодинга модель хорошо показывает себя на агентных бенчмарках, работает с длинным контекстом и понимает изображения: скриншоты, диаграммы, интерфейсы.
Для агентов: низкая стоимость KV cache, быстрый inference, 1M контекст. Agent's Last Exam, AutomationBench и Terminal-Bench все в пользу Flash.
Модель выложена под лицензией MIT. Веса, технический отчёт и код для инференса доступны всем.