VJOURNAL

IA • Mesa global • 01 de octubre de 2026

Ling 3.1 Flash muestra la diferencia entre tamaño del modelo y contexto realmente utilizable

El anuncio de Vercel del 30 de septiembre confirma un modelo disperso de 560.000 millones de parámetros. Los límites del servicio exigen matizar la promesa de un millón de tokens.

Portada de VJOURNAL para «Ling 3.1 Flash muestra la diferencia entre tamaño del modelo y contexto realmente utilizable»

Respuesta breve

El anuncio de Vercel del 30 de septiembre confirma un modelo disperso de 560.000 millones de parámetros. Los límites del servicio exigen matizar la promesa de un millón de tokens.

Corte de verificación: 3 fuentes
El anuncio del 30 de septiembre indica 560.000 millones de parámetros totales y 25.000 millones activos por token.
Vercel describe 262K de contexto y 32.768 de salida; Novita presenta una discrepancia interna.
Las especificaciones no constituyen una victoria independiente en precisión o razonamiento.

Un modelo disperso llega al catálogo

El anuncio de Vercel del 30 de septiembre confirma Ling 3.1 Flash de InclusionAI en su plataforma de modelos. Lo describe como un sistema de razonamiento híbrido con 560.000 millones de parámetros totales y 25.000 millones activos por token. Para comparar el contexto del modelo y su arquitectura, hay que distinguir esas magnitudes: una corresponde al sistema aprendido completo y otra a su activación.

El acontecimiento comprobado es esa disponibilidad fechada y sus características publicadas. Una ficha del proveedor también registra el 29 de septiembre como fecha de lanzamiento. Por tanto, la publicación del intermediario no establece toda la cronología del entrenamiento o del lanzamiento original. Ninguna de esas fechas convierte una especificación en prueba de que el modelo resuelva problemas difíciles con más exactitud que otro.

La proporción activa no es ahorro de memoria

Dividir 25 entre 560 da aproximadamente un 4,5%. Es un cálculo a partir de parámetros declarados, no una medición de ahorro energético o memoria requerida. La arquitectura dispersa de mezcla de expertos activa selectivamente partes de un modelo mayor. Los demás parámetros aprendidos siguen existiendo y el sistema debe almacenarlos, distribuir el trabajo y atender solicitudes dentro de una configuración operativa.

Puede compararse con un archivo que tiene numerosas estanterías y consulta solo unas pocas para responder una pregunta. Abrir menos no reduce el edificio al tamaño del pasillo utilizado. Del mismo modo, comparar Ling con un modelo denso de unos 25.000 millones de parámetros solo por la parte activa omite almacenamiento y servicio. El anuncio no convierte esa proporción en una factura universal.

Vercel, anuncio del 30 de septiembre; documentos de servicio consultados el 1 de octubre de 2026. Datos técnicos, no puntuaciones.
PropiedadCifra publicadaLímite interpretativo
Parámetros totales / activos560.000 / 25.000 millonesSistema completo frente a activación por token
Proporción activa calculadaAproximadamente 4,5%25 dividido por 560; no memoria
Contexto / salida en Vercel262K / 32.768 tokensEntrada y respuesta comparten ventana
Contexto en Novita1 millón al inicio; 256K en fichaDiscrepancia documental pendiente

El contexto cambia según el documento

Vercel publica una ventana de 262K tokens. Su página detallada fija una salida máxima de 32.768 tokens y explica que entrada y respuesta comparten el contexto. Novita coincide en los parámetros totales y activos, pero anuncia un millón de tokens en la introducción y 256K en las funciones admitidas. Ambas afirmaciones no forman una garantía consistente de servicio para un millón de tokens.

La discrepancia debe permanecer visible. Las expresiones próximas a 256K y 262K pueden responder a convenciones abreviadas distintas; ninguna debe transformarse silenciosamente en un millón. El usuario necesita conocer el límite aplicado por el destino concreto de sus solicitudes. Un documento puede caber en una capacidad arquitectónica anunciada y superar el ajuste del proveedor, sin que aceptar la solicitud pruebe además una recuperación fiable.

El razonamiento también consume el presupuesto

La documentación del intermediario incluye los tokens de razonamiento dentro del máximo de salida. Esto hace relevante el presupuesto incluso cuando se espera una respuesta final breve. Una pregunta difícil puede generar mucho trabajo interno antes del texto visible. Disponer de una ventana documental amplia no aclara cuánto queda para instrucciones, turnos previos, resultados de herramientas y la conclusión que se quiere obtener.

En un ejemplo de comparación de contratos, dos documentos extensos son solo parte de la entrada. También llegan criterios de comparación, modificaciones y aclaraciones anteriores. Una prueba práctica debería registrar el tamaño exacto y la salida permitida, y después verificar referencias a pasajes alejados entre sí. Es una propuesta editorial de evaluación; VJOURNAL no afirma haber probado contratos reales con Ling ni medido su precisión.

Las especificaciones no resuelven la clasificación

Las fuentes presentan programación, análisis de varios pasos y agentes con herramientas como usos previstos. Esa descripción no equivale a un experimento independiente con tareas, instrucciones, esfuerzo e infraestructura iguales para distintos modelos. Un gran número de parámetros o la aceptación de una petición larga no cubre la falta de evidencia comparativa. Tampoco demuestra que la información importante sobreviva a una historia muy extensa.

Una comparación útil separaría localizar documentos, razonar con los hechos encontrados y ejecutar correctamente una función. El modelo puede recuperar una frase y fallar al conciliar condiciones distantes. También puede producir una llamada de herramienta válida en formato pero equivocada en sus argumentos. Mantener esos resultados separados da utilidad a la discusión de arquitectura sin inventar una clasificación a partir de cifras que responden a preguntas diferentes.

La novedad ofrece un candidato comprobable

La promoción anunciada dura hasta el 13 de octubre y distingue identificadores que luego empiezan a facturar de otros que dejan de servir. Ese acceso facilita evaluar, pero un precio temporal no es una ventaja arquitectónica. La conclusión sobre el modelo se apoya en el diseño disperso y los límites documentados; cualquier decisión presupuestaria requiere las condiciones del proveedor elegido en el momento de uso.

Al 1 de octubre, Ling 3.1 Flash es una nueva opción verificable para texto largo y razonamiento, con una inconsistencia de contexto pendiente. La evidencia más sólida que falta combinaría un límite aclarado con resultados reproducibles. Nuestra interpretación es que contexto utilizable significa respuestas correctamente justificadas dentro de un presupuesto conocido, y no la mayor cifra de tokens que aparezca en alguna página comercial del producto.

Preguntas frecuentes

¿Los parámetros activos describen todo el tamaño de la máquina necesaria?

No. Indican la parte activada por token, mientras el modelo completo conserva muchos más parámetros. Memoria, enrutamiento e infraestructura de servicio también importan para desplegarlo y determinar sus costes.

¿Está confirmado el contexto de un millón de tokens?

La introducción de Novita lo menciona, pero su panel técnico dice 256K y Vercel anuncia 262K. Esa diferencia sigue sin resolverse en las fuentes consultadas; conviene comprobar el límite del servicio utilizado.

¿Demuestran estas cifras mayor precisión que otros modelos?

Los documentos confirman acceso y características. No ofrecen una comparación independiente con tareas, presupuestos de razonamiento y condiciones equivalentes que permita afirmar una superioridad general.