Respuesta breve
El nuevo Flash une visión y un cambio de arquitectura. Frente a alternativas fechadas de Qwen y Mistral, el tamaño de despliegue y las licencias pesan tanto como las pruebas.
El lanzamiento de septiembre modifica los alias antiguos
El registro de DeepSeek del 10 de septiembre cambia una decisión concreta de despliegue de modelos abiertos: V4.1 Flash incorpora comprensión visual nativa y reemplaza las ofertas Flash anteriores. La documentación actual señala que los nombres retirados V4 Flash y Flash Vision experimental dirigen ahora solicitudes a V4.1 Flash. Un nombre conocido puede llamar a un modelo diferente del usado en un experimento antiguo.
Conviene registrar la versión real al comparar resultados. Comprobamos los documentos el 1 de octubre y contrastamos este lanzamiento con Qwen3.6-27B y Mistral Medium 3.5 descargables. Sus anuncios verificados son de abril y mayo. Son alternativas prácticas fechadas, sin presentarlas como novedades de octubre ni como un ranking exhaustivo del sector.
La arquitectura importa más que la etiqueta Flash
La ficha oficial de DeepSeek describe una base de 552B y un componente adicional de memoria Engram de 196B. Activa 8B parámetros por token al procesar la entrada y 16B al generar. Son cifras de cálculo, no el almacenamiento de todos los pesos. La tabla identifica componentes en lugar de presentar el número activo como tamaño total.
Qwen, denso de 27B, y Mistral, denso de 128B, ofrecen otros puntos de partida. La capacidad de contexto publicada es distinta de la memoria necesaria para una precisión y un lote concretos. Nuestra inferencia editorial es presupuestar por separado pesos, caché de contexto y sobrecarga del servicio antes de escoger hardware o un proveedor de ejecución.
| Modelo | Arquitectura / parámetros | Contexto documentado, tokens | Licencia de los pesos |
|---|---|---|---|
| DeepSeek-V4.1-Flash | MoE: 552B + Engram 196B | 1,000,000 | MIT |
| Qwen3.6-27B | Densa: 27B | 262,144 | Apache 2.0 |
| Mistral Medium 3.5 | Densa: 128B | 256K | MIT modificada; excepciones por ingresos |
La evidencia necesita el agente exacto
DeepSeek publica resultados de instrucciones con esfuerzo 100, temperatura 1 y top_p 0.95. Terminal-Bench 4.0 utiliza DeepSeek Harness Minimal; DeepSWE v1.1 emplea mini-SWE para ajustarse a sus requisitos. La tabla conserva esa diferencia. Las celdas rivales quedan como Desconocido porque no verificamos ejecuciones equivalentes de Qwen y Mistral en estas fuentes.
Un resultado de otra versión de Terminal-Bench o de otra prueba de programación no rellena el hueco. Tampoco una ventaja en parámetros activos. Para un equipo importa un parche que supere sus verificaciones con el entorno, el analizador de herramientas y el presupuesto de contexto previstos. Las cifras publicadas ayudan a diseñar esa prueba; VJOURNAL no la ejecutó.
| Medida | DeepSeek-V4.1-Flash | Qwen3.6-27B | Mistral Medium 3.5 | Configuración de evaluación |
|---|---|---|---|---|
| Terminal-Bench 4.0 (%) | 31.2% | Desconocido | Desconocido | DeepSeek Harness Minimal |
| DeepSWE v1.1 (%) | 74.2% | Desconocido | Desconocido | mini-SWE |
Los pesos descargables tienen condiciones distintas
Las fichas oficiales indican MIT para DeepSeek, Apache 2.0 para Qwen y MIT modificada para Mistral con excepciones relacionadas con ingresos. Son diferencias materiales al decidir el despliegue. Debe revisarse la licencia adjunta a los pesos seleccionados, en lugar de asumir que todos los modelos abiertos permiten exactamente las mismas condiciones de uso.
Una API alojada y un conjunto de pesos descargados también organizan el trabajo de manera diferente. Con pesos locales, el equipo gestiona ejecución, actualizaciones y capacidad; un servicio añade sus propias condiciones de acceso. Registrar versión y configuración permite comparar después si cambia un alias de API o una implementación del entorno.
La alternativa útil es un sistema que termina el trabajo
La comparación realista comienza con un repositorio, imágenes representativas y criterios escritos de aceptación. Mantén las herramientas constantes, identifica los pesos, anota razonamiento y cuantización e inspecciona las salidas estructuradas. Cuenta revisión e intentos fallidos. Una capacidad publicada no sustituye la evidencia de trabajo final que funciona en el entorno elegido.
Al cierre de octubre, las tres opciones documentadas equilibran de manera distinta arquitectura, control y licencias. La decisión consiste en terminar el encargo dentro de la infraestructura disponible. Los requisitos de hardware para el lector y una prueba común de los tres siguen desconocidos aquí. Por ello no declaramos un ganador compuesto en rendimiento o coste.
Preguntas frecuentes
¿Se pueden descargar los tres modelos?
Los repositorios oficiales publican pesos de los modelos nombrados. Las licencias y requisitos de ejecución cambian, por lo que descargables no implica condiciones idénticas.
¿Flash es un modelo local pequeño?
Tiene cálculo activado disperso, pero la ficha describe una base de 552B y memoria Engram de 196B. Los parámetros activos por token no equivalen a los pesos almacenados.
¿Por qué faltan las cifras de los rivales?
No verificamos resultados de Qwen o Mistral con los mismos entornos DeepSeek mostrados. Desconocido expresa falta de evidencia comparable y no un cero para esas opciones.
