Réponse en bref
Argon arrive sur un marché très disputé. Un environnement de test commun et les tarifs publiés éclairent les choix que les classements de lancement ne tranchent pas.
Un nouvel arrivant modifie la sélection
Google a annoncé Gemini 4 Argon le 30 septembre, relançant la comparaison de modèles avancés avec Claude Opus 5.5 et GPT-6 Astra. Pour les équipes qui achètent du raisonnement complexe, la première différence concerne l’exploitation : Google commence avec des cyberdéfenseurs de confiance, tandis que les deux autres produits disposent d’offres API documentées.
L’annonce officielle d’Opus est datée du 22 septembre. La fiche API d’Astra reste la référence du modèle pour travaux exigeants comparé ici. Il faut donc examiner un produit précis et ses conditions. Un nouveau nom de famille, un tarif promotionnel ou un graphique séduisant ne démontrent pas qu’une entreprise peut déployer la configuration dès aujourd’hui.
Un environnement commun resserre la comparaison
Les pages d’Artificial Analysis, vérifiées le 1er octobre, permettent une comparaison de terminal plus disciplinée que trois graphiques de lancement mélangés. Terminal-Bench 4.0 comprend 66 tâches exécutées avec mini-swe-agent ; le pass@1 est moyenné sur trois répétitions. Nous conservons les arrondis publiés et les niveaux de raisonnement. Pour Claude, la configuration inclut également son comportement de repli par défaut.
Cet environnement réduit une source de variation, sans égaliser les budgets de calcul. Quelques points ne tranchent pas la qualité des explications, de la recherche ou de l’analyse visuelle. Les pages comparatives ne donnent pas les dates exactes des essais : le tableau décrit l’instantané vérifiable, avec ses réglages et ses limites.
| Modèle | Niveau de raisonnement | Terminal-Bench 4.0 (%) |
|---|---|---|
| Gemini 4 Argon | Élevé (high) | 57% |
| Claude Opus 5.5 | Très élevé (xhigh) | 60% |
| GPT-6 Astra | Élevé (high) | 54% |
Le tarif et la sortie décrivent des limites distinctes
La documentation vérifiée le 1er octobre fournit les prix. Les flèches passent du tarif initial de Google au tarif ultérieur ; sa date d’expiration n’est pas précisée. Claude et Astra sont présentés aux prix ordinaires de leur API. Le million de jetons mis en avant par Google concerne la sortie maximale, et ne mesure pas la récupération dans des documents.
Un jeton peu cher peut alimenter une séance coûteuse si l’agent multiplie les reprises. Un modèle plus cher peut devenir intéressant quand son résultat est validé plus vite. Un budget de projet doit intégrer les outils, la recherche, le cache, le supplément d’Astra pour les longues entrées et le temps de vérification humaine.
| Modèle | Entrée USD / 1 M de jetons | Sortie USD / 1 M de jetons | Maximum de jetons en sortie | Accès à la date de vérification |
|---|---|---|---|---|
| Gemini 4 Argon | $2 → $4 | $10 → $20 | 1,000,000 | Partenaires de confiance ; élargissement prévu |
| Claude Opus 5.5 | $4 | $20 | 128,000 | Disponible par API |
| GPT-6 Astra | $10 | $50 | 128,000 | Disponible par API |
Une capacité dépend de la tâche et de l’interface
Repérer un défaut dans une image, modifier un fichier et vérifier son effet dans un navigateur sont des actions différentes. Les outils disponibles définissent une partie de ce que le modèle peut terminer. Un test limité au dialogue laisse de côté l’environnement qui transforme une proposition en livrable et détermine les permissions nécessaires.
Cela compte dans une migration de code ou une recherche documentaire. Une longue sortie ne garantit ni des citations fiables ni une correction préservant le comportement d’une application. La validation doit examiner le code qui fonctionne, les preuves retraçables et une explication permettant à quelqu’un d’autre de comprendre les incertitudes restantes.
La décision commence par les livrables acceptés
Notre conclusion éditoriale consiste à choisir selon le travail. Sélectionnez des tâches représentatives, gardez les fichiers et permissions constants, consignez le niveau d’effort et comptez les livrables acceptés. Ajoutez les reprises et la validation humaine au coût. Une réponse non résolue reste un échec, même si sa formulation semble assurée.
En attendant l’élargissement d’Argon, les équipes peuvent préparer cette évaluation. La question pratique d’octobre est de savoir quelle configuration accessible termine leur travail dans le budget et selon leur procédure de contrôle. Il faudra revoir la décision après un changement de prix, d’accès ou de version ; aucun instantané ne remplace les critères d’acceptation.
Questions et réponses
Quel modèle remporte la comparaison ?
Le tableau porte sur un test de terminal et des réglages précis. Il ne désigne pas un gagnant universel en rédaction, vision, recherche ou sur vos propres tâches.
Argon est-il déjà accessible à tous ?
Google ouvre d’abord l’accès aux cyberdéfenseurs de confiance. Une diffusion plus large est prévue, mais ces sources ne donnent pas de date générale confirmée.
VJOURNAL a-t-il exécuté les tests ?
Non. Nous reprenons des mesures indépendantes publiées par Artificial Analysis et les tarifs documentés des fournisseurs, vérifiés le 1er octobre 2026.
