VJOURNAL

ИИ • Глобальная редакция • 01 октября 2026 г.

Аудит 259 исследований безопасности ИИ ставит под вопрос сравнение по одной доле атак

Исследование от 21 сентября находит пробелы в отчётности испытаний ИИ-агентов. Оно проверяет сопоставимость долей успешных атак, не объявляя конкретную защиту неработающей.

Обложка VJOURNAL к материалу «Аудит 259 исследований безопасности ИИ ставит под вопрос сравнение по одной доле атак»

Короткий ответ

Исследование от 21 сентября находит пробелы в отчётности испытаний ИИ-агентов. Оно проверяет сопоставимость долей успешных атак, не объявляя конкретную защиту неработающей.

Дата проверки фактов: 3 источника
Авторы рассматривают 259 англоязычных работ arXiv и отдельно вручную проверяют случайную выборку из 50.
В ручной выборке 58% не сообщают ни разброс, ни повторные прогоны; автоматическая оценка даёт 65,3%.
Числа о перестановке лидеров получены аналитически и не являются наблюдениями отказов действующей защиты.

Новость касается происхождения показателя

Препринт Четана Патхаде, Пратхамеша Павара и Шубхама Патила, поданный 21 сентября, рассматривает проблему измерения в области оценки безопасности ИИ. Авторы изучили 259 работ об агентах и проверили, обозначает ли общая метрика успешных атак сопоставимые эксперименты. В сентябрьском контексте более мощных агентов вопрос остаётся актуальным: единственное число способно скрывать условия испытания и само определение успеха.

Работа объединяет аудит опубликованной отчётности и математический анализ. Она не повторяет защитные системы целиком и не публикует новый рейтинг коммерческих моделей. Основной вопрос — связь между исследованиями: два внутренне разумных эксперимента могут давать проценты, которые нельзя ставить на одну шкалу. Это ограничение сравнения, а не доказательство ошибочности каждого исходного результата или бесполезности проверяемой защиты.

Знаменатель меняет смысл результата

Доля успешных атак делит число успешных исходов на число единиц оценки. Но единицей может быть попытка, задача или вся последовательность действий. Внутри одной задачи бывает несколько возможностей ошибки. Подсчёт каждой возможности отдельно и подсчёт задач с хотя бы одним сбоем дают разные проценты при одинаковом поведении системы. Ни один из таких расчётов не обязан быть арифметически неправильным.

Авторы выделяют шесть измерений, включая способ судейства, повторы, адаптацию атакующей стороны, её знания о защите и учёт частичного успеха. Практический вопрос — совместимо ли два исследования зафиксировали эти условия. Более низкая доля становится содержательной после понимания знаменателя и правила решения. Дополнительные знаки после запятой не исправляют неопределённую или меняющуюся цель измерения, которую исследователи обозначили одинаковым названием.

Pathade, Pawar и Patil, препринт от 21 сентября 2026 года: оценки полноты отчётности, не результат атак на конкретные модели.
Что раскрытоРезультатВыборка и метод
Нет ни разброса, ни повторов58%; интервал 95%: 44–71%Ручная случайная выборка 50 работ
Нет ни разброса, ни повторов65,3%Автоматическая проверка 259 работ
Достаточные сведения о декодировании30,9%Автоматическая оценка корпуса
Сверка модели-судьи с человеком29,7%64 работы с подтверждённым использованием LLM-судьи

Нераскрытая неопределённость — вывод об отчётах

В случайной выборке из 50 работ, проверенной вручную, 58 процентов не сообщают ни оценку разброса, ни повторные прогоны. Округлённый 95-процентный интервал составляет 44–71 процент. Автоматическая обработка всего корпуса из 259 работ даёт 65,3 процента. Методы и неопределённость различаются; более крупную автоматическую цифру нельзя просто подставить вместо ручной как заведомо точное описание всей литературы.

Аудит также находит достаточные сведения о декодировании в 30,9 процента работ. Среди 64 исследований с подтверждённым использованием языковой модели в роли судьи 29,7 процента сообщают сверку с человеческими метками. Это сведения о раскрытии процедуры в доступных документах. Они не доказывают, что исследователи вообще не повторяли опыты или что каждое решение без описанной сверки было неправильным.

Малая выборка делает лидерство хрупким

Аналитический пример рассматривает бенчмарк из 100 независимых случаев. При принятых предположениях различимая разница составляет около 18,2 процентного пункта при обычной статистической мощности. Для двух защит с истинным разрывом в пять пунктов нормальное приближение даёт около 21 процента вероятности обратного порядка в одной оценке. Это расчётные сценарии, а не наблюдаемая частота происшествий в действующих системах.

Независимость существенна: связанные задания и общая среда могут уменьшать эффективный объём данных. Поэтому пример объясняет необходимость интервалов при небольших разрывах, но не задаёт универсальный порог для всех испытаний. Полезное сравнение покажет повторные исходы и схему выборки. Тогда читатель сможет проверить, превышает ли предполагаемое улучшение разброс именно той процедуры, из которой получены сравниваемые числа.

Защита должна сохранять разрешённую работу

Предложенный список из десяти правил отчётности включает успешность безвредных задач. Это связывает оценку безопасности с функциональностью. Система, отклоняющая почти всё, может показать мало успешных атак и одновременно не выполнять назначенную работу. Публикация защитной метрики вместе с завершением обычных задач помогает отличить полезную границу от непригодного сервиса, не сводя разные качества к сомнительному общему баллу.

Действующая рамка NIST по управлению рисками ИИ даёт методический контекст для документирования наборов, условий и эффективности метрик. Это более раннее руководство, а не сентябрьское одобрение препринта. Наша интерпретация для закупки — требовать два наблюдаемых результата: как часто защищённая система соблюдает границы и как часто успешно выполняет разрешённую задачу при тех же условиях эксплуатации и оценки.

Границы самого аудита тоже существенны

Корпус ограничен англоязычными публикациями arXiv и зависит от поиска, отображения документов и автоматических детекторов. Авторы отмечают отсутствующий HTML, возможную потерю чисел и одного человека, выполнявшего ручную разметку. Репозиторий материалов не опубликован, а список правил пока предложен, не проверен экспериментом. Эти ограничения влияют на переносимость оценок полноты отчётности на всё исследовательское поле и требуют сохранения в пересказе.

На 1 октября вклад работы — конкретное возражение против поверхностного сравнения безопасности по разным статьям. Следующий сильный шаг — независимое повторение разметки и согласованные испытания защит с повторами, общими правилами успеха и измерением разрешённой работы. Пока полезный вывод состоит в чтении процента вместе с процедурой. Само число не может надёжно определить, какой агент безопаснее для задачи конкретного покупателя.

Вопросы и ответы

Доказывает ли исследование, что большинство защит не работает?

Нет. Оно проверяет описание измерений и сопоставимость показателей. Отсутствие сведений о разбросе или повторениях не означает, что защита бесполезна либо исследователи никогда не повторяли опыт.

Почему ручная и автоматическая доли отличаются?

Ручная оценка основана на случайной выборке из 50 работ, автоматическая — на всём корпусе из 259. На результат влияют выборочная неопределённость и ошибки распознавания; это разные оценки.

Являются ли 21% измеренной частотой провала ИИ?

Нет. Это аналитический пример для 100 независимых случаев и истинной разницы в пять процентных пунктов при заданных предположениях. Он описывает возможную перестановку мест при оценке, а не частоту инцидентов в эксплуатации.