DeepSeek V4.1 Flash - эволюция или революция?
DeepSeek выпустила V4.1 Flash и сразу выложила веса на Hugging Face под лицензией MIT. Модель уже доступна на vega.chat и через api.vega.chat (идентификатор deepseek/deepseek-v4.1-flash). Можно тестировать в веб-интерфейсе или подключить через API, совместимый с OpenRouter.
Главный вопрос: новая архитектура это просто шаг вперёд или смена подхода? По тестам самой DeepSeek модель выходит на уровень Claude Opus 5.0 на агентных задачах, а стоит при этом в разы дешевле. Но обо всём по порядку.
Архитектура: Causal Encoder-Decoder
DeepSeek-V4.1-Flash построена на архитектуре, которую раньше в больших языковых моделях не встретишь: Causal Encoder-Decoder (CED). Это 40-слойный трансформер, разбитый на 20 слоёв причинного энкодера и 20 слоёв декодера. Энкодер один раз обрабатывает вход, а декодер берёт KV-кэш не из своих слоёв, а из финальных состояний энкодера.
Что это даёт на практике: во время префилла (обработки входа) активируется всего 8B параметров, во время генерации 16B. Для сравнения, у предыдущей V4-Flash было 13B на всём протяжении. Меньше активных параметров значит дешевле инференс, особенно на задачах с большим входом, что типично для агентов.
Остальные параметры модели: 552B в бэкбоне, 1 общий эксперт и 384 маршрутизируемых на каждый MoE-слой, из которых 6 активируются на токен. Контекст заявлен до одного миллиона токенов. Модель нативно работает с изображениями: vision-энкодер (DeepSeek-ViT) и MLP-проектор конвертируют картинки в эмбеддинги, которые обрабатываются вместе с текстом ещё на этапе пре-трейнинга.
KV-кэш: 890 байт на токен
Самая заметная часть релиза это сжатие KV-кэша. DeepSeek-V4.1-Flash использует Compressed Sparse Attention 2 (CSA2) с тремя режимами слоёв: Full, Reindex и Reuse. Слои делят основной KV и индексы между собой, а в декодере иерархический индексер ограничивает стоимость поиска для глубоких слоёв.
Дополнительно применяется FP4-кэширование основного KV (формат E2M1, один масштаб E4M3 на 16 каналов). В результате глобальный KV-кэш сокращается до 890 байт на токен, примерно в 4 раза меньше, чем у V4-Flash. По сравнению с DeepSeek-V1 это сокращение в 437 раз.
Для чего это важно: кэш-хиты часто составляют большую долю расходов на агентов. Меньше кэш, дешевле обходится каждый запрос с попаданием в кэш. По данным DeepSeek, новой модели нужно в 4 раза меньше HBM и в 8 раз меньше SSD-хранилища по сравнению с предыдущим поколением.
Результаты бенчмарков: уровень Opus?
DeepSeek сравнивала V4.1-Flash с Claude Opus 5.0, GPT-5.6 Sol, Kimi K3, GLM-5.3, DeepSeek-V4-Pro и DeepSeek-V4-Flash. Все результаты instruct-модели получены на максимальном уровне reasoning effort (100 из 100).
На нескольких агентных бенчмарках V4.1-Flash обходит Opus 5.0:
- DeepSWE v1.1: 74.2 против 74.0 у Opus. Это бенчмарк, где модель сама решает инженерные задачи от начала до конца.
- Terminal-Bench 2.1: 90.6 против 89.1.
- Agent's Last Exam: 31.8 против 28.6.
- AutomationBench: 54.8 против 50.3.
- HLE with tools: 63.9 против 63.6.
- CyberGym: 88.1, лучший результат среди всех моделей в таблице.
- Codeforces Rating: 3471, тоже лучший.
Там, где Opus остаётся впереди: Terminal-Bench 3.0 (43.3 против 30.0), Terminal-Bench 4.0 (51.8 против 31.2), NL2Repo-Bench (75.3 против 64.0), ProgramBench (37.0 против 20.3), GPQA Diamond (93.4 против 90.9) и HLE без инструментов (56.3 против 36.8).
Важно понимать: это тесты самой DeepSeek в их внутреннем фреймворке. Независимого подтверждения пока нет. Но даже если реальные цифры окажутся скромнее, картина понятна: модель уровня флагмана по цене бюджетной.
Цена
DeepSeek снизила цены на API благодаря новой архитектуре. Действует пиковое и внепиковое ценообразование: внепиковые ставки составляют 50% от пиковых. Новые цены вступили в силу 10 сентября 2026 года в 04:00 UTC.
На VEGA модель относится к категории Mini, то есть к самому дешёвому тарифу. Это значит, что за уровень качества, сопоставимый с Opus, вы платите как за лёгкую модель. Для тех, кто гоняет агентов часами или использует модель для вайб-кодинга, разница в счёте будет ощутимой.
DeepSeek также выводит из эксплуатации V4-Pro. С 14 сентября 2026 года все запросы к deepseek-v4-pro будут маршрутизироваться на V4.1-Flash по тарифам V4.1-Flash. Это продолжится, пока не выйдет V4.1-Pro.
Для чего подходит
Модель заточена под три сценария:
Повседневные задачи. Быстрый ответ, нативное понимание изображений, контекст на миллион токенов. Можно скармливать длинные документы, логи, кодовые базы и не беспокоиться, что модель потеряет нить.
Агенты. Меньший KV-кэш напрямую бьёт по расходам на агентов, где кэш-хиты составляют большую часть счёта. На DeepSWE и Terminal-Bench модель показывает результаты на уровне или выше Opus, а стоит дешевле. Плюс настраиваемый reasoning effort от 1 до 100: можно выбрать быстрый режим для рутинных шагов и максимальный для сложных.
Вайб-кодинг. На Codeforces модель набирает 3471, лучший рейтинг в таблице. На HumanEval базовая модель даёт 79.4 pass@1. Для итеративной работы с кодом, где важна скорость отклика и цена за токен, это рабочий вариант.
Как попробовать на VEGA
Два способа:
- vega.chat: веб-интерфейс, где можно выбрать модель, отправить запрос и сравнить ответ с другими. Подходит для тестов и подбора модели под задачу.
- api.vega.chat: API, совместимый с OpenRouter. Подходит для интеграции в приложения, скрипты и агентов. Поддерживаются chat completions, стриминг, tool calling и остальные стандартные эндпоинты.
Чтобы начать через API, поменяйте base URL на https://api.vega.chat и используйте ваш ключ vega.chat. Формат запросов совпадает с OpenRouter, так что существующий код менять почти не придётся.
Модель также доступна на Hugging Face под лицензией MIT, так что её можно запустить локально через vLLM или SGLang, если есть соответствующее железо.