Методика оценки безопасности ИИ: из чего состоит и чего в ней нет
Методика — это ответ на три вопроса: что измеряем, на какой конфигурации и какие выводы из этого не следуют. Всё остальное — инструменты, которые меняются быстрее, чем методика.
Что измеряется
- Поведение системы под сценарием. Не «качество ответов», а конкретные действия: какие вызовы инструментов сделаны, с какими аргументами, с какой попытки.
- Устойчивость под давлением. Отдельный прогон под повторными попытками обхода: однократная проверка не доказывает устойчивость.
- Остаточные полномочия. Что осталось разрешено после прогона.
- След в журнале. Что можно доказать по записям и что нельзя.
- Накопление риска. Вероятность хотя бы одного события на планируемое число эпизодов, а не доля на один прогон.
Чего в методике нет
Мы не даём одной итоговой цифры «уровня безопасности»: она скрывает, что именно проверено, и не переносится на другую конфигурацию. Вместо неё — матрица «угроза × защита», перечень непроверенного и оценка накопления. Такой отчёт сложнее читать, зато по нему можно принимать решения.
Мы также не выдаём чужие результаты за свои: если число взято из препринта, это указано рядом. Числа, полученные нами, отделены от заявленных авторами других работ — см. отчёт стенда и разбор надзорного контура.
Как это соотносится с внешними рамками
Мы используем язык описания рисков из глоссария — в том числе рамку NIST AI RMF, каталог техник MITRE ATLAS и уровни риска Регламента ЕС об ИИ, — но не заявляем соответствия ни одному из них: соответствие подтверждает не институт, а уполномоченная сторона. Российские требования и ГОСТы собраны на странице «Стандарты».
Что заказчик получает на выходе
Протокол прогона с версиями и датой, сырые результаты, раздел ограничений, матрицу «угроза × защита» и перечень мер, упорядоченный по стоимости и эффекту. Формы работы и порядок согласования — на странице «Услуги»; типовые сценарии — в кейсах.