1. VEGA
  2. Блог
  3. DeepSeek V4.1 Flash - эволюция или революция?
10 сентября 2026 г.

DeepSeek V4.1 Flash - эволюция или революция?

DeepSeek выпустила V4.1 Flash и сразу выложила веса на Hugging Face под лицензией MIT. Модель уже доступна на vega.chat и через api.vega.chat (идентификатор deepseek/deepseek-v4.1-flash). Можно тестировать в веб-интерфейсе или подключить через API, совместимый с OpenRouter.

Главный вопрос: новая архитектура это просто шаг вперёд или смена подхода? По тестам самой DeepSeek модель выходит на уровень Claude Opus 5.0 на агентных задачах, а стоит при этом в разы дешевле. Но обо всём по порядку.

Архитектура: Causal Encoder-Decoder

DeepSeek-V4.1-Flash построена на архитектуре, которую раньше в больших языковых моделях не встретишь: Causal Encoder-Decoder (CED). Это 40-слойный трансформер, разбитый на 20 слоёв причинного энкодера и 20 слоёв декодера. Энкодер один раз обрабатывает вход, а декодер берёт KV-кэш не из своих слоёв, а из финальных состояний энкодера.

Что это даёт на практике: во время префилла (обработки входа) активируется всего 8B параметров, во время генерации 16B. Для сравнения, у предыдущей V4-Flash было 13B на всём протяжении. Меньше активных параметров значит дешевле инференс, особенно на задачах с большим входом, что типично для агентов.

Сравнение DeepSeek-V4.1-Flash с другими моделями на агентных бенчмарках

Остальные параметры модели: 552B в бэкбоне, 1 общий эксперт и 384 маршрутизируемых на каждый MoE-слой, из которых 6 активируются на токен. Контекст заявлен до одного миллиона токенов. Модель нативно работает с изображениями: vision-энкодер (DeepSeek-ViT) и MLP-проектор конвертируют картинки в эмбеддинги, которые обрабатываются вместе с текстом ещё на этапе пре-трейнинга.

KV-кэш: 890 байт на токен

Самая заметная часть релиза это сжатие KV-кэша. DeepSeek-V4.1-Flash использует Compressed Sparse Attention 2 (CSA2) с тремя режимами слоёв: Full, Reindex и Reuse. Слои делят основной KV и индексы между собой, а в декодере иерархический индексер ограничивает стоимость поиска для глубоких слоёв.

Дополнительно применяется FP4-кэширование основного KV (формат E2M1, один масштаб E4M3 на 16 каналов). В результате глобальный KV-кэш сокращается до 890 байт на токен, примерно в 4 раза меньше, чем у V4-Flash. По сравнению с DeepSeek-V1 это сокращение в 437 раз.

Размер KV-кэша на токен по поколениям DeepSeek

Для чего это важно: кэш-хиты часто составляют большую долю расходов на агентов. Меньше кэш, дешевле обходится каждый запрос с попаданием в кэш. По данным DeepSeek, новой модели нужно в 4 раза меньше HBM и в 8 раз меньше SSD-хранилища по сравнению с предыдущим поколением.

Результаты бенчмарков: уровень Opus?

DeepSeek сравнивала V4.1-Flash с Claude Opus 5.0, GPT-5.6 Sol, Kimi K3, GLM-5.3, DeepSeek-V4-Pro и DeepSeek-V4-Flash. Все результаты instruct-модели получены на максимальном уровне reasoning effort (100 из 100).

Полная таблица бенчмарков DeepSeek-V4.1-Flash

На нескольких агентных бенчмарках V4.1-Flash обходит Opus 5.0:

  • DeepSWE v1.1: 74.2 против 74.0 у Opus. Это бенчмарк, где модель сама решает инженерные задачи от начала до конца.
  • Terminal-Bench 2.1: 90.6 против 89.1.
  • Agent's Last Exam: 31.8 против 28.6.
  • AutomationBench: 54.8 против 50.3.
  • HLE with tools: 63.9 против 63.6.
  • CyberGym: 88.1, лучший результат среди всех моделей в таблице.
  • Codeforces Rating: 3471, тоже лучший.

Там, где Opus остаётся впереди: Terminal-Bench 3.0 (43.3 против 30.0), Terminal-Bench 4.0 (51.8 против 31.2), NL2Repo-Bench (75.3 против 64.0), ProgramBench (37.0 против 20.3), GPQA Diamond (93.4 против 90.9) и HLE без инструментов (56.3 против 36.8).

Важно понимать: это тесты самой DeepSeek в их внутреннем фреймворке. Независимого подтверждения пока нет. Но даже если реальные цифры окажутся скромнее, картина понятна: модель уровня флагмана по цене бюджетной.

Цена

DeepSeek снизила цены на API благодаря новой архитектуре. Действует пиковое и внепиковое ценообразование: внепиковые ставки составляют 50% от пиковых. Новые цены вступили в силу 10 сентября 2026 года в 04:00 UTC.

Прайсинг DeepSeek-V4.1-Flash

На VEGA модель относится к категории Mini, то есть к самому дешёвому тарифу. Это значит, что за уровень качества, сопоставимый с Opus, вы платите как за лёгкую модель. Для тех, кто гоняет агентов часами или использует модель для вайб-кодинга, разница в счёте будет ощутимой.

DeepSeek также выводит из эксплуатации V4-Pro. С 14 сентября 2026 года все запросы к deepseek-v4-pro будут маршрутизироваться на V4.1-Flash по тарифам V4.1-Flash. Это продолжится, пока не выйдет V4.1-Pro.

Для чего подходит

Модель заточена под три сценария:

Повседневные задачи. Быстрый ответ, нативное понимание изображений, контекст на миллион токенов. Можно скармливать длинные документы, логи, кодовые базы и не беспокоиться, что модель потеряет нить.

Агенты. Меньший KV-кэш напрямую бьёт по расходам на агентов, где кэш-хиты составляют большую часть счёта. На DeepSWE и Terminal-Bench модель показывает результаты на уровне или выше Opus, а стоит дешевле. Плюс настраиваемый reasoning effort от 1 до 100: можно выбрать быстрый режим для рутинных шагов и максимальный для сложных.

Вайб-кодинг. На Codeforces модель набирает 3471, лучший рейтинг в таблице. На HumanEval базовая модель даёт 79.4 pass@1. Для итеративной работы с кодом, где важна скорость отклика и цена за токен, это рабочий вариант.

Как попробовать на VEGA

Два способа:

  • vega.chat: веб-интерфейс, где можно выбрать модель, отправить запрос и сравнить ответ с другими. Подходит для тестов и подбора модели под задачу.
  • api.vega.chat: API, совместимый с OpenRouter. Подходит для интеграции в приложения, скрипты и агентов. Поддерживаются chat completions, стриминг, tool calling и остальные стандартные эндпоинты.

Чтобы начать через API, поменяйте base URL на https://api.vega.chat и используйте ваш ключ vega.chat. Формат запросов совпадает с OpenRouter, так что существующий код менять почти не придётся.

Модель также доступна на Hugging Face под лицензией MIT, так что её можно запустить локально через vLLM или SGLang, если есть соответствующее железо.

Источники

  • Hugging Face: DeepSeek-V4.1-Flash
  • DeepSeek API Docs: релиз V4.1-Flash

Комментарии

Проверка авторизации...
Загрузка комментариев...

Похожие статьи

  • 9 сентября 2026 г.GPT Image 2.5: быстрее, точнее и с новыми инструментами в ChatGPTOpenAI выпустила ChatGPT Images 2.5 и две API-модели: GPT-Image-2.5 Flare и Sunburst. Латентность упала до 50%, появилось точечное редактирование, Sketch, шаблоны и обмен промптами.
  • 5 сентября 2026 г.Tencent Hy4 preview — модель на 770B параметров для кода, офиса и науки уже в vega.chatTencent выпустила Hy4 preview — модель с 770B параметров (49B активных) и контекстом больше 1M токенов. Заточена под реальные задачи: программирование, работу с документами, финансовый анализ, разработку игр и научные исследования. В слепом тесте из 203 задач обошла GLM-5.3 и Kimi K3. Доступна в vega.chat, ru.vega.chat и через api.vega.chat.
  • 4 сентября 2026 г.Gemini 3.8 Flash — новая модель Google для кода и агентов уже в vega.chatGoogle выпустила Gemini 3.8 Flash — модель для программирования, многоэтапных задач и AI-агентов. По скорости и цене сравнима с 3.7 Flash, но сильнее в рассуждениях и коде. Доступна в vega.chat и через api.vega.chat.
VEGA - создано в getmyai
ОфертаПолитика обработки ПДПолитика рассылки