Réponse en bref
Le nouveau Flash associe vision et changement d’architecture. Face aux alternatives datées de Qwen et Mistral, le déploiement et les licences comptent autant que les tests.
La sortie de septembre change les anciens alias
Le journal DeepSeek du 10 septembre apporte une décision concrète au déploiement de modèles ouverts : V4.1 Flash intègre la compréhension visuelle et remplace les anciennes offres Flash. La documentation actuelle indique que les noms retirés V4 Flash et Flash Vision expérimental dirigent désormais les requêtes vers V4.1 Flash. Un nom familier peut donc appeler une autre version qu’un ancien essai.
Cela justifie de consigner le modèle réellement utilisé. Nous avons vérifié les documents le 1er octobre et comparons cette sortie aux poids téléchargeables de Qwen3.6-27B et Mistral Medium 3.5. Leurs annonces vérifiées remontent à avril et mai. Ce sont des alternatives pratiques datées, sans prétendre à de nouveaux lancements d’octobre ou à un classement exhaustif.
L’architecture compte plus que le nom Flash
La fiche officielle DeepSeek décrit une base de 552B et une mémoire Engram supplémentaire de 196B. Elle active 8B paramètres par jeton au traitement de l’entrée, 16B à la génération. Ce sont des chiffres de calcul, pas le stockage intégral des poids. Le tableau distingue les composants au lieu de présenter le compte actif comme taille totale.
Qwen, dense de 27B, et Mistral, dense de 128B, offrent d’autres points de départ. Leur contexte publié est distinct de la mémoire nécessaire à une précision et à un lot donnés. Notre interprétation éditoriale est de budgéter séparément les poids, le cache de contexte et les coûts de fonctionnement avant de choisir un matériel ou un service.
| Modèle | Architecture / paramètres | Contexte documenté, jetons | Licence des poids |
|---|---|---|---|
| DeepSeek-V4.1-Flash | MoE: 552B + Engram 196B | 1,000,000 | MIT |
| Qwen3.6-27B | Dense: 27B | 262,144 | Apache 2.0 |
| Mistral Medium 3.5 | Dense: 128B | 256K | MIT modifiée ; exceptions liées au chiffre d’affaires |
Les résultats exigent l’environnement exact de l’agent
DeepSeek publie les résultats de sa version instruction à effort 100, température 1 et top_p 0.95. Terminal-Bench 4.0 utilise DeepSeek Harness Minimal ; DeepSWE v1.1 emploie mini-SWE pour respecter ses exigences. Le tableau garde ces différences. Les cellules concurrentes restent Inconnu, faute d’essais équivalents vérifiés pour Qwen et Mistral dans ces sources.
Un résultat d’une autre version de Terminal-Bench ou d’une autre épreuve de programmation ne comble pas cette lacune. Le nombre de paramètres actifs non plus. Une équipe a besoin d’une correction qui passe ses contrôles dans l’environnement prévu, avec son analyseur d’outils et son budget de contexte. Ces chiffres aident à préparer un essai ; VJOURNAL ne l’a pas exécuté.
| Mesure | DeepSeek-V4.1-Flash | Qwen3.6-27B | Mistral Medium 3.5 | Conditions d’évaluation |
|---|---|---|---|---|
| Terminal-Bench 4.0 (%) | 31.2% | Inconnu | Inconnu | DeepSeek Harness Minimal |
| DeepSWE v1.1 (%) | 74.2% | Inconnu | Inconnu | mini-SWE |
Les poids téléchargeables ont des conditions différentes
Les fiches officielles indiquent MIT pour DeepSeek, Apache 2.0 pour Qwen et une MIT modifiée pour Mistral avec des exceptions liées au chiffre d’affaires. Ces différences comptent dans le choix de déploiement. L’examen doit porter sur la licence attachée aux poids sélectionnés, sans supposer que toutes les offres ouvertes ont des conditions interchangeables.
Une API hébergée et des poids téléchargés organisent aussi le travail différemment. Avec des poids locaux, l’équipe gère environnement, mises à jour et capacité ; un service ajoute ses propres conditions d’accès. Consigner la version et ses réglages permet de comparer ensuite, quand un alias API ou une implémentation de l’environnement change.
L’alternative utile est une chaîne de travail complète
Une comparaison réaliste commence par un dépôt, des images représentatives et des critères écrits d’acceptation. Gardez les outils constants, identifiez les poids, relevez raisonnement et quantification, puis examinez les sorties structurées. Comptez validation et tentatives ratées. Une capacité publiée ne remplace pas la preuve du travail terminé dans le système choisi.
À la date d’octobre, les trois options documentées proposent des équilibres distincts entre architecture, contrôle et licences. La décision porte sur l’achèvement de la tâche dans l’infrastructure disponible. Les besoins matériels du lecteur et un test commun des trois modèles restent inconnus ici. Aucun gagnant global de performance ou de coût n’est donc déclaré.
Questions et réponses
Les trois modèles sont-ils téléchargeables ?
Les dépôts officiels publient les poids des modèles cités. Licences et besoins d’exécution varient ; téléchargeable ne signifie pas des conditions de déploiement identiques.
Flash est-il un petit modèle local ?
Le calcul actif est parcimonieux, mais la fiche décrit une base de 552B et une mémoire Engram de 196B. Les paramètres actifs par jeton ne sont pas tous les poids stockés.
Pourquoi les scores concurrents sont-ils inconnus ?
Nous n’avons pas vérifié de résultats Qwen ou Mistral avec les mêmes environnements DeepSeek. Inconnu désigne une lacune de preuve comparable, pas un score nul.
