VJOURNAL

IA • Mesa global • 01 de octubre de 2026

El coste de las API de IA revela por qué un modelo barato también puede hacer esperar

Los precios de octubre y las mediciones independientes señalan decisiones distintas para presupuesto y espera. Un escenario fijo muestra los costes sin atribuir la misma calidad a todos los modelos.

Portada de VJOURNAL para «El coste de las API de IA revela por qué un modelo barato también puede hacer esperar»

Respuesta breve

Los precios de octubre y las mediciones independientes señalan decisiones distintas para presupuesto y espera. Un escenario fijo muestra los costes sin atribuir la misma calidad a todos los modelos.

Corte de verificación: 7 fuentes
La tabla económica se calcula con tarifas oficiales, sin presentarse como una factura real.
Velocidad del flujo y tiempo hasta el primer token describen etapas diferentes.
Google anuncia nuevas tarifas para enero; el presupuesto actual necesita fecha de revisión.

El presupuesto de octubre tiene fecha de revisión

El coste de API exige leer la tarifa y su vigencia. Las páginas oficiales de OpenAI y Google, consultadas el 1 de octubre, presentan economías diferentes para solicitudes habituales de producción. Google también indica un cambio de enero para Gemini 3.8 Flash. Un presupuesto aprobado con la tarifa actual puede quedar desfasado aunque el tráfico permanezca igual.

La pregunta práctica es si el servicio entrega un resultado aceptado dentro del tiempo de espera que admite el producto. Un chat con clientes, la revisión de documentos y una clasificación nocturna necesitan respuestas distintas. Una tarifa baja puede convenir a una cola tolerante a demoras; un flujo rápido importa cuando alguien lee una respuesta larga. Ninguno demuestra calidad por sí solo.

Separar cotizaciones de costes calculados

La primera tabla utiliza tarifas estándar de texto de pago y un escenario explícito: cada llamada consume 10.000 tokens nativos de entrada y 2.000 tokens totales de salida facturable. Se multiplica cada cantidad por su tarifa por millón, se suman importes y se aplica el número de llamadas. Para Luna corresponde la columna de contexto corto de OpenAI. Los totales son aritmética editorial.

La salida incluye los tokens de razonamiento que se cobren como salida; no promete 2.000 tokens de respuesta visible. Esta referencia excluye caché, herramientas, descuentos por lotes e impuestos. Los reintentos y un razonamiento más largo cambian el consumo. Mantener cantidades fijas facilita entender la fórmula, pero no afirma que todos resuelvan igual una solicitud.

Tarifas oficiales de API de texto estándar de pago, OpenAI y Google; consulta 01-10-2026, Luna con contexto corto. Cálculo: 10.000 tokens nativos de entrada y 2.000 de salida facturable por llamada, sin caché, herramientas, descuentos por lotes ni impuestos. Estimación editorial, no factura medida. Enero es una tarifa futura anunciada.
Modelo / periodo de tarifaEntrada cotizada USD / millónSalida cotizada USD / millónCálculo USD / llamadaCálculo USD / 10.000 llamadas
GPT-6 Luna0.100.500.00220
Gemini 3.5 Flash-Lite0.302.500.00880
Gemini 3.8 Flash — hasta 31-12-20260.753.750.015150
Gemini 3.8 Flash — previsto desde 01-01-20271.507.500.030300

Un flujo rápido no elimina la espera inicial

Artificial Analysis aporta las mediciones de la segunda tabla mediante las API directas identificadas. Su método de rendimiento 2.2.0, fechado el 2 de marzo de 2026, usa por defecto entradas de 10.000 tokens. La consulta de octubre conserva las variantes max de Luna y high de Flash. El esfuerzo de Flash-Lite no aparece en el nombre mostrado y queda desconocido.

La velocidad corresponde a la emisión después de empezar el flujo. La columna de latencia conserva TTFT, la etiqueta de la sección de preguntas del evaluador; sus gráficos distinguen además el primer token de respuesta. No se pueden sustituir estos conceptos por duración total. Las fechas exactas de las muestras son desconocidas. VJOURNAL no ejecutó las pruebas y estos valores no garantizan un servicio regional.

Páginas de Artificial Analysis para API directas, consulta 01-10-2026; método 2.2.0 del 02-03-2026, entrada predeterminada de 10.000 tokens. Velocidad en tokens o200k_base por segundo tras comenzar el flujo. TTFT conserva la etiqueta del evaluador, sin garantizar primera respuesta ni finalización. Esfuerzo: Luna max, Flash high, Flash-Lite desconocido. Fechas de muestra desconocidas.
Modelo / variante medidaTokens de salida / segundoTTFT publicado, segundosAPI medida
GPT-6 Luna (max)125.2118.03OpenAI
Gemini 3.8 Flash (high)221.017.45Google
Gemini 3.5 Flash-Lite326.19.00Google

Las unidades y las tarifas futuras tienen límites

Artificial Analysis normaliza los tokens de rendimiento con o200k_base. Las facturas usan el recuento nativo del proveedor, por lo que el mismo texto puede consumir cantidades distintas. Dividir una tarifa nativa entre una velocidad normalizada ocultaría esa diferencia. El escenario fija cantidades para planificar; no asegura documentos idénticos entre modelos.

Google programa el doble de las tarifas de entrada y salida de Flash desde el 1 de enero de 2027. La fila futura conserva el volumen para mostrar la exposición presupuestaria. Es un calendario anunciado, no una tarifa ya cobrada en octubre. Conviene mantener juntos ambos presupuestos y revisar la fuente antes de renovar.

Comprar trabajo aceptado dentro del tiempo permitido

Una selección local útil parte de solicitudes representativas y un criterio claro de aceptación. Registre tokens facturados, tiempo hasta texto útil, finalización y reintentos. Los diálogos requieren su propio umbral de espera; las colas pueden priorizar costes. Es una propuesta de trabajo, no una medición realizada por esta publicación.

Las fuentes de octubre permiten identificar candidatos sin fabricar un ganador universal. El responsable decide qué fallos se escalan, cuánto razonamiento se admite y cuándo detener una solicitud lenta. El coste por resultado aceptado describe mejor la operación que un titular sobre tokens baratos, sobre todo cuando la tarifa publicada tiene una fecha de caducidad conocida.

Preguntas frecuentes

¿Son facturas medidas de una aplicación real?

No. Son cálculos para un volumen fijo de tokens con tarifas estándar de pago consultadas el 1 de octubre de 2026. Reintentos, herramientas e impuestos pueden cambiar el gasto real.

¿El flujo más rápido entrega antes la primera respuesta?

No necesariamente. La velocidad comienza después de iniciarse el flujo. El procesamiento y el razonamiento pueden retrasar el texto útil; TTFT no garantiza terminar la tarea.

¿Por qué aparece una fila para enero?

Google anuncia tarifas más altas para Gemini 3.8 Flash desde el 1 de enero de 2027. El cálculo futuro conserva el mismo volumen y se distingue claramente del precio de octubre.