VJOURNAL

ИИ • Глобальная редакция • 30 сентября 2026 г.

Испытания GLM-5.3 обострили вопрос о киберрисках открытых моделей

Две организации обнаружили заметные кибервозможности модели с открытыми весами, но измеряли разное. Лабораторный результат нельзя превращать в статистику настоящих взломов.

Обложка VJOURNAL к материалу «Испытания GLM-5.3 обострили вопрос о киберрисках открытых моделей»

Короткий ответ

Две организации обнаружили заметные кибервозможности модели с открытыми весами, но измеряли разное. Лабораторный результат нельзя превращать в статистику настоящих взломов.

Дата проверки фактов: 2 источника
В изолированных испытаниях Anthropic 29 сентября модель построила работающий эксплойт в 50 из 410 попыток на известных ошибках V8; это не число реальных атак.
NIST 17 сентября назвал GLM-5.3 наиболее сильной открытой моделью в своих кибертестах, но поставил её ниже американского передового уровня по сводной оценке.
Две организации обнаружили заметные кибервозможности модели с открытыми весами, но измеряли разное. Лабораторный результат нельзя превращать в статистику настоящих взломов.

Новое испытание и более ранняя государственная оценка

29 сентября Anthropic опубликовала исследование модели GLM-5.3 компании Z.ai. За две недели до этого американский NIST представил собственную оценку. По его сводным кибертестам GLM-5.3 стала самой сильной из изученных моделей с открытыми весами, но уступила передовому американскому уровню. Anthropic изучала более узкие вопросы: может ли модель собрать работающий эксплойт и как часто в имитации обходятся её ограничения. Эти результаты дополняют друг друга, но не образуют единый рейтинг для всех задач.

Числа важны вместе с условиями

На известной группе уязвимостей движка V8 в изолированном испытании ExploitBench GLM-5.3 довела до конца 50 из 410 попыток; ограниченно распространяемая Claude Mythos Preview — 56. На выборке из ста задач собственного набора Anthropic модель GLM-5.3 получила четыре процента по критерию полного перехвата управления. Это конкретные тестовые сценарии и правила оценки. Числа не дают вероятности взлома произвольного сайта и не говорят, сколько неизвестных ошибок есть в конкретном продукте.

Возможности и доступность — разные измерения

NIST сравнивал модель с американскими системами, у которых для тестов отключали некоторые киберограничения; часть таких систем выдают только проверенным пользователям. Anthropic считает свободную загрузку GLM-5.3 важной для риска и сообщает, что в её имитации способы обхода защит срабатывали от 64 до 100 процентов в зависимости от метода. Это вывод об испытанной конфигурации, а не обо всех будущих установках. Те же технические возможности могут помогать защитникам, если работа ведётся с разрешения владельца системы.

Что ещё предстоит установить

Командам безопасности стоит проверить видимость событий, скорость исправлений и доступные средства защиты, не выдавая лабораторные результаты за сведения о конкретной атаке. Независимое воспроизведение, точная фиксация версий модели и разбор настоящих инцидентов помогут оценить переносимость тестов в реальный мир. У источников разная роль: NIST даёт публичную сравнительную шкалу, Anthropic оценивает конкурента и собственные защитные механизмы. К срезу 30 сентября цифры испытаний опубликованы, масштаб последствий вне лаборатории пока неизвестен.

Вопросы и ответы

Речь идёт о взломах реальных пользователей?

Нет. Anthropic описывает изолированные тесты и работу исследователей с контролируемыми целями. Опубликованные числа не являются статистикой атак в интернете.

Почему оценки NIST и Anthropic нельзя просто сложить?

NIST использовал сводную оценку по четырём наборам испытаний, а Anthropic отдельно проверяла завершённые эксплойты и обход защит в имитации. Условия и измеряемые величины различаются.