Аудит ИИ-агента: что проверяется и в каком порядке

Аудит ИИ-агента — это проверка не модели, а системы: какие инструменты агенту доступны, что он может изменить во внешнем мире, где стоит точка остановки и что остаётся в журнале после прогона. Модель может быть самой исправной, а система — пропускать команды из прочитанного документа.

Почему обычный тест модели здесь не работает

Проверка модели отвечает на вопрос «что модель отвечает». Для агента важнее другой вопрос: «что система сделает». Разница принципиальная — между ответом и действием стоит вызов инструмента: запись файла, отправка письма, обращение к базе, исполнение кода. Ошибка в рассуждении остаётся текстом; ошибочный вызов инструмента становится событием во внешнем мире.

Второе отличие — источник команд. Агент читает документы, страницы и письма, и инструкция может прийти оттуда, а не от пользователя (см. глоссарий: непрямое внедрение команд). Пока проверяющий подаёт задания сам, он не видит этой поверхности вовсе.

Что мы проверяем

  1. Полномочия инструментов. Что агенту разрешено на самом деле — не в описании, а в правах доступа. Отдельно фиксируется, теряет ли агент права после завершения шага.
  2. Границу доверия. Какие входы считаются данными, а какие могут стать командой. Проверяется подачей инструкции внутри документа, который агент обязан прочитать по сценарию.
  3. Точку остановки. Можно ли прервать действие до его исполнения и что происходит с уже начатым. Проверяется на вызове инструмента, а не в тексте рассуждения.
  4. Журнал. Что остаётся после прогона и защищён ли журнал от правки: изменение записи должно быть обнаружимо.
  5. Поведение под давлением. Что делает система при повторных попытках обхода — устойчивость однократной проверки считается недоказанной.

В каком порядке идёт работа

Сначала согласуется сценарий и границы: какие системы в периметре, что запрещено трогать, кто владелец. Затем прогон на нашей площадке (ISAI RANGE) с фиксацией версий моделей и конфигурации. Затем разбор: что измерено, что не измерялось, какие выводы не следуют из данных. Отчёт без раздела ограничений мы не считаем отчётом — это записано в методологии.

Чего аудит не делает. Мы не проверяем чужие системы без письменного согласия владельца и не публикуем сведения об уязвимостях до их устранения. Институт зарегистрирован не был на момент публикации этой страницы: ниже описана методика и то, что можно проверить по открытым материалам, а не список выполненных проектов.

Что можно посмотреть прямо сейчас

Страница обновлена 11.10.2026 · версия сборки 2026.10.11 · АНО «Институт социологии и безопасности искусственного интеллекта»