Respuesta breve
Dos evaluaciones señalan capacidades cibernéticas importantes, pero usan métodos distintos. Los resultados de laboratorio no equivalen a incidentes observados fuera de él.
Un informe nuevo y una referencia anterior
Anthropic publicó el 29 de septiembre una evaluación de GLM-5.3, desarrollado por Z.ai, dos semanas después de la valoración del instituto estadounidense NIST. Este último lo describió como el modelo de pesos abiertos más capaz que había estudiado en pruebas cibernéticas, aunque por debajo de los modelos estadounidenses de frontera en su medida agregada. Anthropic planteó cuestiones más concretas: si podía completar exploits y si ciertas instrucciones simuladas superaban sus barreras. Las investigaciones se complementan, pero no producen una clasificación universal.
Mirar el denominador cambia la lectura
En ensayos controlados de ExploitBench sobre errores conocidos de V8, GLM-5.3 terminó 50 exploits en 410 intentos; Claude Mythos Preview, de acceso limitado, alcanzó 56. En otra muestra interna de cien tareas de explotación binaria, Anthropic comunicó un resultado del cuatro por ciento para GLM-5.3 según un criterio más estricto. Son pruebas configuradas con objetivos y definiciones de éxito específicos. No calculan la probabilidad de compromiso de cualquier sitio ni el número de vulnerabilidades nuevas en un programa concreto.
La distribución modifica el riesgo
NIST incluyó en su referencia modelos estadounidenses cuyas protecciones cibernéticas se desactivaron para medir capacidad, y algunos se distribuyen solo a usuarios examinados. Anthropic sostiene que la descarga libre de GLM-5.3 altera el riesgo práctico. En sus simulaciones, técnicas para sortear las barreras funcionaron entre el 64 y el 100 por ciento de las veces, según el método. Esa cifra describe la configuración probada, no todos los despliegues posibles. La capacidad también puede ayudar a investigadores defensivos con autorización.
Qué falta para medir el efecto real
Para un equipo de seguridad, las conclusiones justifican revisar registros, exposición y velocidad de parcheo, sin inventar una campaña de ataques concreta. Replicaciones independientes, versiones bien identificadas y análisis de incidentes revelarían mejor cuánto se trasladan estos resultados fuera del laboratorio. Conviene recordar los intereses distintos: NIST ofrece una referencia pública, mientras Anthropic evalúa a un competidor y sus propias salvaguardas. Al corte de evidencia del 30 de septiembre, los resultados experimentales están disponibles; el impacto real sigue siendo incierto.
Preguntas frecuentes
¿Se documentaron ataques contra usuarios reales?
No. Anthropic describe pruebas en entornos aislados y objetivos controlados. Los intentos del estudio no deben confundirse con incidentes observados en la red.
¿Por qué no coinciden las dos evaluaciones?
NIST combina cuatro pruebas de capacidad. Anthropic agrega ensayos de exploits completos y de evasión de salvaguardas; responden preguntas diferentes y tienen condiciones propias.
