Respuesta breve
Los precios de octubre y las mediciones independientes señalan decisiones distintas para presupuesto y espera. Un escenario fijo muestra los costes sin atribuir la misma calidad a todos los modelos.
El presupuesto de octubre tiene fecha de revisión
El coste de API exige leer la tarifa y su vigencia. Las páginas oficiales de OpenAI y Google, consultadas el 1 de octubre, presentan economías diferentes para solicitudes habituales de producción. Google también indica un cambio de enero para Gemini 3.8 Flash. Un presupuesto aprobado con la tarifa actual puede quedar desfasado aunque el tráfico permanezca igual.
La pregunta práctica es si el servicio entrega un resultado aceptado dentro del tiempo de espera que admite el producto. Un chat con clientes, la revisión de documentos y una clasificación nocturna necesitan respuestas distintas. Una tarifa baja puede convenir a una cola tolerante a demoras; un flujo rápido importa cuando alguien lee una respuesta larga. Ninguno demuestra calidad por sí solo.
Separar cotizaciones de costes calculados
La primera tabla utiliza tarifas estándar de texto de pago y un escenario explícito: cada llamada consume 10.000 tokens nativos de entrada y 2.000 tokens totales de salida facturable. Se multiplica cada cantidad por su tarifa por millón, se suman importes y se aplica el número de llamadas. Para Luna corresponde la columna de contexto corto de OpenAI. Los totales son aritmética editorial.
La salida incluye los tokens de razonamiento que se cobren como salida; no promete 2.000 tokens de respuesta visible. Esta referencia excluye caché, herramientas, descuentos por lotes e impuestos. Los reintentos y un razonamiento más largo cambian el consumo. Mantener cantidades fijas facilita entender la fórmula, pero no afirma que todos resuelvan igual una solicitud.
| Modelo / periodo de tarifa | Entrada cotizada USD / millón | Salida cotizada USD / millón | Cálculo USD / llamada | Cálculo USD / 10.000 llamadas |
|---|---|---|---|---|
| GPT-6 Luna | 0.10 | 0.50 | 0.002 | 20 |
| Gemini 3.5 Flash-Lite | 0.30 | 2.50 | 0.008 | 80 |
| Gemini 3.8 Flash — hasta 31-12-2026 | 0.75 | 3.75 | 0.015 | 150 |
| Gemini 3.8 Flash — previsto desde 01-01-2027 | 1.50 | 7.50 | 0.030 | 300 |
Un flujo rápido no elimina la espera inicial
Artificial Analysis aporta las mediciones de la segunda tabla mediante las API directas identificadas. Su método de rendimiento 2.2.0, fechado el 2 de marzo de 2026, usa por defecto entradas de 10.000 tokens. La consulta de octubre conserva las variantes max de Luna y high de Flash. El esfuerzo de Flash-Lite no aparece en el nombre mostrado y queda desconocido.
La velocidad corresponde a la emisión después de empezar el flujo. La columna de latencia conserva TTFT, la etiqueta de la sección de preguntas del evaluador; sus gráficos distinguen además el primer token de respuesta. No se pueden sustituir estos conceptos por duración total. Las fechas exactas de las muestras son desconocidas. VJOURNAL no ejecutó las pruebas y estos valores no garantizan un servicio regional.
| Modelo / variante medida | Tokens de salida / segundo | TTFT publicado, segundos | API medida |
|---|---|---|---|
| GPT-6 Luna (max) | 125.2 | 118.03 | OpenAI |
| Gemini 3.8 Flash (high) | 221.0 | 17.45 | |
| Gemini 3.5 Flash-Lite | 326.1 | 9.00 |
Las unidades y las tarifas futuras tienen límites
Artificial Analysis normaliza los tokens de rendimiento con o200k_base. Las facturas usan el recuento nativo del proveedor, por lo que el mismo texto puede consumir cantidades distintas. Dividir una tarifa nativa entre una velocidad normalizada ocultaría esa diferencia. El escenario fija cantidades para planificar; no asegura documentos idénticos entre modelos.
Google programa el doble de las tarifas de entrada y salida de Flash desde el 1 de enero de 2027. La fila futura conserva el volumen para mostrar la exposición presupuestaria. Es un calendario anunciado, no una tarifa ya cobrada en octubre. Conviene mantener juntos ambos presupuestos y revisar la fuente antes de renovar.
Comprar trabajo aceptado dentro del tiempo permitido
Una selección local útil parte de solicitudes representativas y un criterio claro de aceptación. Registre tokens facturados, tiempo hasta texto útil, finalización y reintentos. Los diálogos requieren su propio umbral de espera; las colas pueden priorizar costes. Es una propuesta de trabajo, no una medición realizada por esta publicación.
Las fuentes de octubre permiten identificar candidatos sin fabricar un ganador universal. El responsable decide qué fallos se escalan, cuánto razonamiento se admite y cuándo detener una solicitud lenta. El coste por resultado aceptado describe mejor la operación que un titular sobre tokens baratos, sobre todo cuando la tarifa publicada tiene una fecha de caducidad conocida.
Preguntas frecuentes
¿Son facturas medidas de una aplicación real?
No. Son cálculos para un volumen fijo de tokens con tarifas estándar de pago consultadas el 1 de octubre de 2026. Reintentos, herramientas e impuestos pueden cambiar el gasto real.
¿El flujo más rápido entrega antes la primera respuesta?
No necesariamente. La velocidad comienza después de iniciarse el flujo. El procesamiento y el razonamiento pueden retrasar el texto útil; TTFT no garantiza terminar la tarea.
¿Por qué aparece una fila para enero?
Google anuncia tarifas más altas para Gemini 3.8 Flash desde el 1 de enero de 2027. El cálculo futuro conserva el mismo volumen y se distingue claramente del precio de octubre.
