VJOURNAL

IA • Rubrique mondiale • 30 septembre 2026

Les essais de GLM-5.3 relancent le débat sur le risque cyber des modèles ouverts

Deux évaluations relèvent des capacités cyber importantes, selon des méthodes distinctes. Un succès en laboratoire ne vaut pas constat d'une campagne d'intrusion.

Couverture VJOURNAL pour « Les essais de GLM-5.3 relancent le débat sur le risque cyber des modèles ouverts »

Réponse en bref

Deux évaluations relèvent des capacités cyber importantes, selon des méthodes distinctes. Un succès en laboratoire ne vaut pas constat d'une campagne d'intrusion.

Arrêt des vérifications: 2 sources
Dans les essais isolés d'Anthropic, GLM-5.3 a réussi 50 exploits complets sur 410 tentatives visant des failles V8 connues ; il ne s'agit pas d'attaques constatées.
NIST a classé GLM-5.3 en tête des modèles à poids ouverts qu'il avait évalués en cyber, tout en le plaçant sous la frontière américaine sur son indice global.
Deux évaluations relèvent des capacités cyber importantes, selon des méthodes distinctes. Un succès en laboratoire ne vaut pas constat d'une campagne d'intrusion.

Deux enquêtes, deux angles

Anthropic a publié le 29 septembre son évaluation de GLM-5.3, conçu par Z.ai, deux semaines après celle de l'institut américain NIST. Ce dernier l'a présenté comme le modèle à poids ouverts le plus performant de son échantillon en cyber, mais inférieur à la frontière américaine sur son indicateur agrégé. Anthropic s'est davantage intéressé aux exploits menés à terme et au contournement simulé des protections. Ces résultats éclairent des dimensions voisines sans former un palmarès unique valable pour toutes les situations.

Les chiffres ont besoin de leur contexte

Dans des essais ExploitBench isolés sur des failles V8 déjà connues, GLM-5.3 a produit 50 exploits complets en 410 tentatives, contre 56 pour Claude Mythos Preview, distribué de manière restreinte. Sur cent tâches choisies dans un banc interne d'exploitation binaire, Anthropic indique quatre pour cent de réussites selon un critère de prise de contrôle. Chaque pourcentage dépend des cibles, des outils et du seuil de réussite. Il ne prédit ni le sort d'un site quelconque ni le nombre de failles nouvelles d'un logiciel.

La disponibilité est une autre variable

La comparaison de NIST incluait des modèles américains testés avec certaines protections cyber désactivées, dont quelques-uns ne sont remis qu'à des utilisateurs sélectionnés. Anthropic estime que la diffusion libre de GLM-5.3 change l'exposition au risque. Dans ses simulations, des procédés pour contourner les garde-fous ont réussi dans 64 à 100 pour cent des cas selon la méthode. C'est une observation sur une configuration et des consignes données, pas une propriété vérifiée de chaque installation. Les mêmes capacités peuvent aussi servir une recherche défensive autorisée.

Ce qu'il reste à établir

Les défenseurs peuvent revoir leurs journaux, leurs surfaces exposées et leurs délais de correction sans traiter ces essais comme la preuve d'une offensive en cours. Des réplications indépendantes et l'analyse d'incidents réels diraient mieux si la performance se transpose hors du laboratoire. Les sources ont aussi des positions différentes : NIST fournit une base publique, Anthropic juge un concurrent et ses propres protections. Au 30 septembre, les mesures publiées sont vérifiables ; l'ampleur de leurs conséquences dans le monde réel reste inconnue.

Questions et réponses

Le rapport décrit-il des victimes réelles ?

Non. Les chiffres proviennent d'essais isolés et de cibles contrôlées par les chercheurs. Ils ne comptent pas des incidents observés sur internet.

Pourquoi les conclusions de NIST et d'Anthropic diffèrent-elles ?

NIST combine quatre bancs d'essai pour comparer les capacités. Anthropic examine aussi des exploits aboutis et le contournement simulé des protections. Les méthodes répondent à des questions distinctes.