VJOURNAL

ИИ • Глобальная редакция • 01 октября 2026 г.

DeepSeek V4.1 Flash меняет выбор открытых моделей рядом с Qwen и Mistral

Новый Flash сочетает зрение со сменой архитектуры. При выборе между датированными моделями Qwen и Mistral важны размер развёртывания и условия лицензий.

Обложка VJOURNAL к материалу «DeepSeek V4.1 Flash меняет выбор открытых моделей рядом с Qwen и Mistral»

Короткий ответ

Новый Flash сочетает зрение со сменой архитектуры. При выборе между датированными моделями Qwen и Mistral важны размер развёртывания и условия лицензий.

Дата проверки фактов: 7 источников
После релиза 10 сентября прежние имена Flash перенаправляют запросы к мультимодальному V4.1 Flash.
Qwen3.6-27B и Mistral Medium 3.5 — проверенные модели апреля и мая, а не новые октябрьские анонсы.
Отсутствующие сопоставимые оценки отмечены как неизвестные; активные параметры не равны объёму хранения весов.

Сентябрьский релиз меняет старые имена API

По журналу DeepSeek от 10 сентября V4.1 Flash получил нативное понимание изображений и заменил предыдущие варианты Flash. Документация, проверенная 1 октября, указывает перенаправление прежних имён V4 Flash и Flash Vision к V4.1 Flash. Развёртывание открытых моделей поэтому требует записи фактической версии: привычное имя запроса может вызвать другую модель.

Сопоставляем этот релиз с доступными весами Qwen3.6-27B и Mistral Medium 3.5. Их подтверждённые анонсы относятся к апрелю и маю. Это датированные практические альтернативы, без утверждения о новом октябрьском выпуске или полном рейтинге открытых моделей.

Архитектура важнее названия Flash

Карточка DeepSeek описывает основу 552B и дополнительную память Engram 196B. При обработке входа активируются 8B параметров на токен, при генерации — 16B. Это объём вычислений, а не весь объём хранения весов. Таблица показывает компоненты, не подменяя полный размер активным числом.

Плотные модели Qwen на 27B и Mistral на 128B дают другие исходные условия. Ёмкость контекста отделена от памяти для партии запросов и выбранной точности. Для бюджета нужно отдельно учитывать веса, кеш контекста и расходы среды исполнения.

Официальные карточки проверены 1 октября 2026; релизы DeepSeek 10 сентября, Qwen 21 апреля, Mistral 22 мая. Заявленные ёмкость и лицензии, а не измеренные требования к оборудованию.
МодельАрхитектура / параметрыЗаявленный контекст, токеныЛицензия весов
DeepSeek-V4.1-FlashMoE: 552B + Engram 196B1,000,000MIT
Qwen3.6-27BПлотная: 27B262,144Apache 2.0
Mistral Medium 3.5Плотная: 128B256KМодифицированная MIT; исключения по выручке

Испытания привязаны к конкретному агенту

DeepSeek публикует результаты модели инструкций при усилии 100, температуре 1 и top_p 0.95. Для Terminal-Bench 4.0 указан DeepSeek Harness Minimal, для DeepSWE v1.1 — mini-SWE. Сопоставимые запуски Qwen и Mistral в этих источниках не подтверждены; клетки оставлены неизвестными.

Оценка другой версии Terminal-Bench не заполняет пробел, как и преимущество активных параметров. Для команды важна правка, прошедшая её проверки в выбранной среде, с нужным разбором вызовов инструментов и бюджетом контекста. Опубликованные данные помогают подготовить опыт; редакция его не проводила.

Карточка DeepSeek проверена 1 октября 2026; релиз 10 сентября. Проценты pass@1 / решённых задач по данным разработчика: усилие 100, температура 1, top_p 0.95. Даты запусков неизвестны; сопоставимые результаты Qwen/Mistral не подтверждены.
ПоказательDeepSeek-V4.1-FlashQwen3.6-27BMistral Medium 3.5Условия оценки
Terminal-Bench 4.0 (%)31.2%НеизвестноНеизвестноDeepSeek Harness Minimal
DeepSWE v1.1 (%)74.2%НеизвестноНеизвестноmini-SWE

У скачиваемых весов разные условия

Карточки указывают MIT у DeepSeek, Apache 2.0 у Qwen и модифицированную MIT у Mistral с исключениями по выручке. Это существенные различия. Оценивать нужно лицензию конкретных весов, а не предположение об одинаковых условиях всех открытых моделей.

API и скачанный набор весов также означают разную организацию работы. Локально команда управляет средой, обновлениями и мощностью; сервис добавляет собственные условия доступа. Запись версии и конфигурации сохраняет смысл сравнения при смене имени API или реализации среды.

Сравнивать следует рабочую систему целиком

Для практического опыта нужны репозиторий, типичные изображения и письменные критерии приёмки. Сохраните одинаковые инструменты, запишите версию, усилие и квантование, проверьте структурированные ответы. Учитывайте неудачные попытки и работу проверяющего: ёмкость модели не заменяет готовый результат.

На октябрьскую дату три варианта предлагают разные архитектуру, контроль и лицензии. Выбор зависит от выполнения вашей задачи в доступной инфраструктуре. Требования к оборудованию конкретного читателя и единое испытание трёх моделей здесь неизвестны; общего победителя по скорости или стоимости эти данные не устанавливают.

Вопросы и ответы

Можно ли скачать все три модели?

Официальные репозитории публикуют веса названных моделей. Лицензии и требования среды различаются, поэтому возможность скачивания не означает одинаковые условия развёртывания.

Flash — маленькая локальная модель?

Модель использует разрежённые вычисления, но карточка описывает основу 552B и память Engram 196B. Активные параметры на токен не равны всем весам, которые нужно хранить.

Почему оценки соперников неизвестны?

Мы не подтвердили результаты Qwen и Mistral в точно таких же средах DeepSeek. Это пробел сопоставимых доказательств, а не нулевой результат этих моделей.