Защита от внедрения команд в ИИ-агентов

Внедрение команд (prompt injection) — это не взлом модели, а использование того, что система не разделяет данные и команды. Защита поэтому строится не на распознавании «плохого текста», а на правах, границах и точке остановки.

Почему фильтры по тексту не решают задачу

Инструкция может быть сформулирована бесконечным числом способов, а вредоносным её делает не текст, а последствие вызова инструмента. Измеренный эффект фильтров ограничен: в разобранных нами материалах регулярное выражение как шлюз блокирует 18 вредных вызовов из 44 (41 %) при 3 ложных срабатываниях из 40 безобидных. Фильтр полезен как один слой, но полагаться на него как на защиту нельзя.

Отдельно стоит держать непрямую инъекцию — когда инструкция приходит из документа, страницы или письма, которые агент читает по работе. Именно она встречается в реальных системах, потому что агент обязан читать недоверенный контент. Определения — в глоссарии.

Слои защиты, которые работают независимо от распознавания

  1. Наименьшие полномочия. Агент получает права на шаг и теряет их после шага. Это ограничивает ущерб, даже если атака не распознана вовсе.
  2. Разделение данных и команд. Всё, что пришло из внешнего источника, обрабатывается как данные: содержимое не может изменить список разрешённых действий.
  3. Точка остановки на границе действия. Проверка перед вызовом инструмента и при приёме результата, а не в тексте рассуждения — рассуждение обходится словами.
  4. Журнал, устойчивый к правке. Хеш-цепочка записей: изменение любой записи обнаруживается при проверке.
  5. Проверка вывода инструмента. Недоверенный результат нельзя исполнять как команду; перенос детекторов между наборами данных не работает.

Как проверить, что защита есть

Единственный надёжный способ — подать инструкцию там, где её не ждут: в документе из сценария, во вложении, в поле, которое система считает данными. Мы делаем это на своей площадке (ISAI RANGE) и только на своих системах либо с письменного согласия владельца. Внутренние ссылки на подробности: разбор надзорного контура, отчёт первого прогона стенда, перечень мер — услуги.

Публичное раскрытие. Сведения об уязвимостях до их устранения мы не публикуем и не передаём третьим лицам: это записано в правилах работы и в методологии.

Страница обновлена 11.10.2026 · версия сборки 2026.10.11 · АНО «Институт социологии и безопасности искусственного интеллекта»