Réponse en bref
Les tarifs d’octobre et les mesures indépendantes éclairent des choix différents pour le budget et l’attente. Un scénario fixe montre les dépenses sans supposer une qualité identique entre modèles.
Le budget d’octobre rencontre un calendrier tarifaire
Le coût des API exige de lire le prix unitaire et sa durée de validité. Les pages officielles d’OpenAI et Google, consultées le 1er octobre, donnent des repères différents pour les requêtes habituelles en production. Google précise aussi un changement de janvier pour Gemini 3.8 Flash. Un budget approuvé aujourd’hui peut donc vieillir sans hausse de trafic.
La question pratique est de savoir si le service produit un résultat accepté dans le délai permis par le produit. Dialogue client, traitement documentaire et classification nocturne demandent des rythmes différents. Un prix faible convient parfois à une file qui tolère l’attente ; un flux rapide importe quand quelqu’un lit une longue réponse. Aucun de ces critères ne démontre seul la qualité.
Tarifs annoncés et calculs restent distincts
Le premier tableau emploie les tarifs texte standard payants et un scénario explicite : chaque appel consomme 10 000 jetons natifs en entrée et 2 000 jetons de sortie facturables au total. On multiplie chaque quantité par son tarif au million, additionne les montants puis applique le nombre d’appels. Pour Luna, la colonne à contexte court d’OpenAI s’applique. Les résultats sont des calculs éditoriaux.
L’enveloppe de sortie comprend le raisonnement facturé en sortie ; elle ne promet pas 2 000 jetons de réponse visibles. Cache, outils, remises par lot et taxes sont exclus de cette référence. Relances et raisonnement prolongé modifient la consommation. Fixer les quantités rend la formule lisible, sans affirmer que chaque modèle résout la même demande aussi bien.
| Modèle / période du tarif | Entrée annoncée USD / million | Sortie annoncée USD / million | Calcul USD / appel | Calcul USD / 10 000 appels |
|---|---|---|---|---|
| GPT-6 Luna | 0.10 | 0.50 | 0.002 | 20 |
| Gemini 3.5 Flash-Lite | 0.30 | 2.50 | 0.008 | 80 |
| Gemini 3.8 Flash — jusqu’au 31-12-2026 | 0.75 | 3.75 | 0.015 | 150 |
| Gemini 3.8 Flash — prévu dès le 01-01-2027 | 1.50 | 7.50 | 0.030 | 300 |
Le débit n’efface pas l’attente initiale
Artificial Analysis fournit le second tableau via les API directes indiquées. Sa méthode de performance 2.2.0 du 2 mars 2026 utilise par défaut une entrée de 10 000 jetons. L’observation d’octobre garde les variantes max de Luna et high de Flash. L’effort de raisonnement de Flash-Lite n’est pas précisé dans son nom affiché : il reste inconnu.
Le débit décrit le flux après son démarrage. La colonne de latence conserve TTFT, le terme employé dans les questions fréquentes de l’évaluateur ; ses graphiques distinguent aussi le premier jeton de réponse. Ces notions ne remplacent pas la durée totale. Les dates exactes des mesures restent inconnues. VJOURNAL n’a pas réalisé ces essais et les valeurs ne garantissent aucun délai régional.
| Modèle / variante mesurée | Jetons de sortie / seconde | TTFT publié, secondes | API mesurée |
|---|---|---|---|
| GPT-6 Luna (max) | 125.2 | 118.03 | OpenAI |
| Gemini 3.8 Flash (high) | 221.0 | 17.45 | |
| Gemini 3.5 Flash-Lite | 326.1 | 9.00 |
Unités de jetons et tarifs futurs demandent une note
Artificial Analysis uniformise les jetons de performance avec o200k_base. Les factures utilisent le comptage natif du fournisseur : un texte identique peut consommer des quantités différentes. Diviser un tarif natif par un débit standardisé masquerait ce décalage. Le scénario fixe des quantités pour planifier, sans supposer des documents identiques.
Google prévoit le double des tarifs d’entrée et de sortie de Flash dès le 1er janvier 2027. La ligne future maintient le volume pour montrer l’exposition du budget. Il s’agit d’un calendrier annoncé, pas d’un prix déjà facturé en octobre. Conserver les deux budgets côte à côte facilite une nouvelle vérification avant renouvellement.
Acheter un résultat accepté dans le délai prévu
Une sélection locale utile commence par des demandes représentatives et une règle d’acceptation claire. Consignez jetons facturés, délai du texte utile, durée totale et relances. Les requêtes interactives méritent un seuil d’attente propre ; les files peuvent privilégier le coût. C’est une démarche proposée, aucune mesure recueillie par cette publication.
Les sources d’octobre désignent des candidats sans inventer un vainqueur universel. Le responsable fixe les échecs à transmettre, l’effort permis et le moment d’arrêt d’une requête retardée. Le coût d’un résultat accepté décrit mieux l’exploitation qu’une promesse de jetons bon marché, surtout lorsque la fin du tarif actuel est connue.
Questions et réponses
Ces coûts sont-ils des factures de production mesurées ?
Non. Il s’agit d’un calcul pour un volume fixe de jetons, avec les tarifs standard payants consultés le 1er octobre 2026. Relances, outils et taxes peuvent modifier la facture réelle.
Le flux le plus rapide donne-t-il la première réponse avant les autres ?
Pas nécessairement. Le débit est mesuré après le début du flux. Traitement initial et raisonnement peuvent retarder le texte utile ; TTFT ne garantit pas la fin de la tâche.
Pourquoi afficher un tarif de janvier ?
Google annonce des tarifs Gemini 3.8 Flash plus élevés dès le 1er janvier 2027. Le calcul futur garde le même volume et reste clairement séparé du tarif d’octobre.
