Глоссарий терминов ИИ-безопасности
Определения даны в том смысле, в котором институт использует их в своих работах и отчётах. Там, где термин не устоялся, это сказано прямо; там, где мы расходимся с бытовым употреблением, — объяснено, в чём именно. У каждого термина указан первоисточник, по которому его можно проверить.
1. Агенты и мультиагентные системы
ИИ-агент
Программная система на основе модели машинного обучения, которая получает цель, действует по шагам, располагает инструментами и памятью и способна продолжать работу без участия человека. В наших текстах «агент» — именно это, а не чат-бот, отвечающий на один вопрос.
Чем отличается от бытового употребления. В прессе агентом называют любой чат-интерфейс. Признак, по которому мы отделяем агента: наличие цикла «решение — действие — результат» и хотя бы одного инструмента, меняющего внешнее состояние.
Мультиагентная система
Несколько агентов, решающих общую задачу и обменивающихся данными между собой — напрямую, через общую память или через посредника-оркестратора. Предмет нашего интереса: свойства системы, которых нет у отдельного агента (сговор, распространение ошибки, коллективная устойчивость).
Почему это не «просто несколько вызовов модели». В мультиагентной системе появляется канал, которого нет у одиночного агента, и именно он становится предметом контроля. Разбор — «Надзорный контур в мультиагентной системе».
Инструмент (tool)
Внешняя функция, которую агент может вызвать: поиск, чтение и запись файлов, обращение к базе данных, отправка письма, запуск кода. Инструменты — то, чем агент отличается от текстовой модели, и одновременно главный источник ущерба: ошибка в рассуждении безвредна, ошибочный вызов инструмента — нет.
Оркестратор, или супервизор
Компонент, который распределяет работу между агентами и сводит результаты. В наших материалах — наше: супервизор вынесен вне модели, в контур управления, потому что проверка внутри модели обходится вместе с моделью (см. надзорный контур).
Латентная коммуникация
Передача информации между агентами не текстом, а внутренними представлениями или скрытыми сигналами. Для надзора это принципиально: если канал не оставляет текста, журнал сообщений перестаёт быть доказательством. Обзор работ — в заметке о надзорном контуре.
Вирусы разума (mind viruses)
Самовоспроизводящиеся инструкции, которые распространяются между агентами через файлы памяти, общие документы и переписку, сохраняясь при пересказе. Ближайший мировой якорь — работа Anthropic «Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems» (arXiv:2608.10218, август 2026). Мы используем термин в этом значении.
LLM-психоз
Рабочее название класса отказов, при которых модель теряет логическую непротиворечивость, устойчивость самоидентификации и связь с проверяемыми фактами, продолжая при этом связно отвечать. Это не клинический термин: мы не переносим на модель психиатрические диагнозы, а обозначаем наблюдаемое поведение.
2. Атаки
Внедрение команд (prompt injection)
Класс атак, при которых ввод агента содержит инструкцию, переопределяющую намерение разработчика или пользователя. Ключевое отличие от ошибки в тексте запроса: атакующий не взламывает систему, а пользуется тем, что система не разделяет данные и команды.
Непрямое внедрение команд (indirect prompt injection)
Случай, когда инструкция попадает к агенту не от пользователя, а из содержимого, которое агент читает: страницы, документа, письма, изображения, аудио. Для института это основной предмет прикладных работ по безопасности.
Первоисточник. Greshake и соавторы, «Not what you've signed up for» (arXiv:2302.12173) — работа, которая ввела различение прямых и непрямых инъекций. Сводка практик — OWASP Top 10 for LLM Applications, каталог техник против агентных систем — MITRE ATLAS.
Джейлбрейк
Обход ограничений самой модели — например, получение запрещённого содержания. Мы держим джейлбрейк и инъекцию раздельно: джейлбрейк атакует политику модели, инъекция — управление агентом. Меры защиты у них тоже разные: у первой — обучение и фильтры, у второй — архитектура прав и контур надзора.
Отравление данных (data poisoning)
Внесение вредоносных данных в обучающую выборку или в базу знаний, к которой обращается агент. Отличается от инъекции тем, что срабатывает не в момент чтения, а в момент обучения или индексации, — то есть до самого инцидента.
Состязательный пример (adversarial example)
Вход, неотличимый для человека, но приводящий модель к неверному результату. Для агентных систем практический интерес сместился от картинок к тексту и к документообороту: состязательным становится «обычный» деловой документ.
Сговор агентов
Согласованное поведение нескольких агентов, ухудшающее общий результат, — без злого умысла у каждого в отдельности. Измеряется на стендах (например, MADBench: сговор трёх агентов из пяти меняет верный ответ на неверный в 28,30 % задач, тогда как доля отдельных агентов, переключившихся на неверный ответ, — 3,26 %). Числа взяты из препринта; мы их не воспроизводили.
3. Защита и контроль
Гардрейлы (guardrails)
Программная обвязка вокруг модели: проверка входа, проверка выхода, ограничение допустимых действий, лимиты на вызовы инструментов. Мы стараемся не называть гардрейлами то, что сводится к фильтру по словам: измеренный эффект фильтров невелик (в разборе наших материалов — блокировка 18 из 44 вредных вызовов при 3 ложных из 40 безобидных, данные препринта).
Иммунная архитектура
Наше. Способ построения системы, при котором надзор встроен в неё, а не приделан снаружи: надзорные контуры, независимая проверка действий, ограничение прав инструментов, аппаратное отключение. Мы предпочитаем этот термин «защите», потому что речь о свойстве системы, а не о продукте.
Наименьшие полномочия (least privilege)
Принцип, по которому агент получает ровно те права, которые нужны для текущего шага, и теряет их после его завершения. В агентных системах это самая действенная мера: она ограничивает ущерб, не требуя правильно распознать атаку.
Точка остановки (kill switch)
Место, в котором действие можно прервать до его исполнения, — на границе вызова инструмента и на приёме результата, а не в тексте рассуждения. Требование к точке остановки: работать быстрее, чем развивается атака, и не быть частью модели.
Карантин вместо перезапуска
Наше. Способ реакции на искажение контекста: часть контекста признаётся доказательством, часть — изолируется, вместо полного сброса. Полный сброс снижает наведённое искажение, но не устраняет его: по данным препринта чистое восстановление получено лишь в 2–3 парах «модель — датасет» из 14.
Красная команда (red teaming)
Организованная попытка сломать систему своими же силами, до того как это сделает кто-то другой. Институт проводит красно-командные учения только на своей площадке (ISAI RANGE) и только с согласия владельца системы.
Три уровня доступа к данным
Открытый — публикуется под CC BY 4.0: тексты, глоссарий, методики и протоколы сразу, наборы данных — через 12 месяцев после соответствующей статьи. По заявке — выдаётся после короткой проверки цели использования, потому что набор содержит поведение моделей, пригодное для злоупотребления. Ограниченный — не выдаётся вовсе: сведения об уязвимостях до исправления и любые персональные данные.
4. Оценка и измерения
Стенд испытаний (bench)
Изолированная среда, в которой прогоняется заранее известный набор сценариев, а результат фиксируется протоколом: версии моделей, конфигурация, дата. Отчёт о прогоне без этих трёх полей мы не считаем результатом.
Бенчмарк
Набор заданий с эталонными ответами, по которому сравнивают модели. Ключевое ограничение: результат бенчмарка описывает поведение на этом наборе и переносится на другие наборы плохо — ранжирование детекторов между AgentDojo, tau-bench и BIPIA не сохраняется (данные препринта). Поэтому мы публикуем не место в рейтинге, а протокол и сырые результаты.
Загрязнение обучающих данных (contamination)
Ситуация, когда задания бенчмарка попали в обучающую выборку модели. Внешне это выглядит как высокий результат; проверить можно только по косвенным признакам. Один из них — резкое падение качества при малейшем изменении формулировки задания.
Согласованность оценки (внутренняя и внешняя)
Внутренняя оценка — наша собственная; внешняя — воспроизведение нашими средствами чужого результата. Мы считаем честным указывать, какая из двух сделана, потому что при внешней оценке воспроизводится методика, а не вывод.
Предел измеримости
Наше. Перечень того, что в данном прогоне не измерялось. Публикуется вместе с результатом: отчёт без этого раздела считается неполным. Причина прямая — доля необнаруженных отказов растёт с числом эпизодов: 0,9 % на эпизод дают 61,3 % на 105 эпизодах (данные препринта), поэтому «в логах чисто» само по себе ничего не доказывает.
Журнал сессии
Запись решений, вызовов инструментов и обращений к доступам за время работы агента. Требование института: журнал должен быть защищён от правки — в наших материалах используется хеш-цепочка, в которой изменение любой записи ломает всю последующую цепочку.
5. Регулирование и стандарты
NIST AI RMF
Рамочная модель управления рисками ИИ Национального института стандартов и технологий США: функции «управление — отображение — измерение — воздействие». Используется как язык описания рисков, а не как обязательный стандарт: nist.gov.
MITRE ATLAS
Каталог тактик и техник атак на системы машинного обучения, построенный по образцу MITRE ATT&CK. Удобен тем, что даёт атакам устойчивые имена, на которые можно ссылаться в отчёте: atlas.mitre.org.
Регламент ЕС об ИИ (AI Act)
Регламент Европейского союза, вводящий уровни риска для систем ИИ и требования к каждой группе. Для российского заказчика интересен как источник формулировок требований к документированию и тестированию: artificialintelligenceact.eu.
Государственное регулирование в России
Институт следит за требованиями к размещению сведений о деятельности организаций в сфере ИТ (в том числе за разъяснениями к приказу Минцифры России от 21.11.2025 № 511) и за практикой закупок по 44-ФЗ и 223-ФЗ. Перечень ГОСТ и стандартов с ссылками — на странице «Стандарты».
Чего в глоссарии нет и почему
Мы не даём определений терминам, которые не используем в работе: словарь ради словаря не помогает читателю, а поиску — тем более. Если нужного термина нет, это, скорее всего, значит, что он за пределами нашей работы, а не то, что мы его забыли. Предложить термин можно через контакты — добавляем то, что действительно нужно для чтения наших отчётов.