Réponse en bref
Les résultats Android Bench distinguent le progrès partiel du succès complet. Les nouveaux essais de Google exigent de conserver l’agent, les intervalles et l’unité de coût avant de choisir.
Septembre durcit la question pour les équipes
L’annonce de Google du 17 septembre oriente les résultats Android Bench vers des travaux qui traversent une application entière. Pour une équipe mobile, la nouvelle question est concrète : un agent peut-il mener une migration ou une fonctionnalité jusqu’à une application utilisable ? La mise à jour ajoute des tâches longues et les agents des fournisseurs de modèles.
Cette distinction compte lorsque le travail occupe plusieurs sessions. Une première modification convaincante peut laisser une dépendance manquante ou un écran inutilisable. L’achat exige donc des preuves portant sur le déroulement complet. Ce test aide à sélectionner des candidats pour Android ; les exigences propres à l’équipe déterminent ensuite si l’application est prête à sortir.
Conserver les unités des mesures publiées
La méthodologie officielle décrit trente tâches, chacune exécutée cinq fois indépendamment. Le tableau conserve les couples modèle-agent, les intervalles et l’achèvement partiel. Google définit dollars et heures comme des moyennes par passage complet du jeu. Ce sont des mesures publiées, consultées le 1er octobre ; VJOURNAL n’a pas réalisé ces essais.
Chaque feuille de comparaison doit garder cette unité. Diviser la dépense globale par un nombre supposé de tâches fournit éventuellement une estimation, sans révéler le coût d’une migration particulière. Le résumé ne donne ni dates exactes des exécutions ni effort de raisonnement. Ces informations restent inconnues, plutôt que déduites du nom commercial.
| Modèle / agent | Réussite % | Intervalle de confiance % | Achèvement % | Heures / passage complet | USD / passage complet |
|---|---|---|---|---|---|
| GPT-6 Astra / Codex | 28.0 | 13.3–42.0 | 82.2 | 7.9 | 375.7 |
| Claude Fable 5.1 / Claude Code | 22.7 | 10.7–36.0 | 82.4 | 22.2 | 492.6 |
| GPT-5.6 Sol / Codex | 19.3 | 7.3–32.0 | 74.3 | 8.6 | 235.8 |
| Claude Opus 5 / Claude Code | 16.7 | 5.3–29.3 | 77.8 | 27.0 | 861.4 |
| Gemini 3.8 Flash / Antigravity SDK | 8.0 | 3.3–13.3 | 47.4 | 12.1 | 34.5 |
L’environnement de l’agent appartient au résultat
Codex, Claude Code et Antigravity SDK organisent fichiers, outils et contexte autour des modèles. Leur fonctionnement peut modifier ce que le système termine. La comparaison porte ainsi sur des combinaisons opérationnelles. Elle n’isole pas le modèle en maintenant chaque composant de son environnement identique.
Cette approche aide une équipe qui achète un agent existant, mais tranche moins pour celle qui construit le sien. Modifier outils, permissions ou gestion du contexte crée un autre système. La documentation officielle de SWE-bench constitue une référence distincte pour résoudre des problèmes de dépôts. Importer ses pourcentages masquerait les différences de tâches et de vérification.
Le progrès peut dissimuler un obstacle au lancement
Achèvement et réussite doivent être lus ensemble. Le premier reconnaît le travail utile même dans un essai finalement raté ; la seconde vérifie que les exigences sont satisfaites. Une application presque complète peut encore demander une réparation spécialisée. L’équipe doit identifier l’exigence manquante et savoir si sa correction est prévisible.
Google intègre des vérifications en exécution et une évaluation visuelle, utiles pour apprécier l’interface au-delà de la structure du code. Les intervalles de plusieurs combinaisons se recouvrent. Ce recouvrement déconseille de traiter l’ordre des lignes comme une prédiction précise pour tous les nouveaux dépôts d’entreprise.
Une décision fondée sur l’application acceptée
Un essai d’adoption pertinent utiliserait des migrations représentatives, un dépôt initial reproductible et des contrôles explicites de compilation, fonctionnement et accessibilité. Dépense complète, durée et temps de réparation humaine seraient consignés ensemble. Il s’agit d’un protocole proposé, sans essai réalisé par la rédaction ni résultat garanti.
La publication de septembre permet de mieux examiner la délégation de travaux ambitieux. Elle incite à regarder achèvement, incertitude et catégories d’échec avant de choisir. La question suivante est de savoir quelle combinaison réduit l’effort d’ingénierie vérifié sur les tâches de l’équipe, avec une application fonctionnelle comme condition d’acceptation.
Questions et réponses
Un achèvement de 82,2 % signifie-t-il réussite ?
Non. L’achèvement tient compte des exigences partiellement satisfaites. Google rapporte séparément 28,0 % de tâches entièrement réussies pour Astra avec Codex dans ce jeu de tâches longues.
Le coût concerne-t-il une seule tâche ?
Non. Le tableau définit ces dollars comme le coût moyen d’un passage complet du jeu. Présenter 375,7 dollars comme le prix d’une migration particulière changerait la mesure.
Peut-on comparer ces chiffres à SWE-bench ?
Les tâches, environnements et vérifications diffèrent. Chaque pourcentage doit garder sa version de test et son agent ; une valeur identique ne prouve pas une capacité identique.
