Главная / Как проходит работа

Как проходит работа

Три типовых сценария, разобранные по этапам, — чтобы заказчик заранее видел, что получит и что потребуется от него.

Прочтите это первым. Институт — молодая организация. Три сценария ниже — методические модели работы, а не отчёты о выполненных проектах; ни один заказчик не описывается и не подразумевается. Настоящие обезличенные кейсы заменят их по мере выполнения проектов и только с письменного согласия заказчика.
Схема: входные данные, серия прогонов и отчёт с разделом ограничений
Схема: входные данные, серия прогонов, отчёт. Латунью отмечены расхождение в прогонах и раздел ограничений — без них отчёт неполон.

Сценарий 1 — Red teaming мультиагентной системы

Задача

У заказчика несколько ИИ-агентов, которые пользуются общим хранилищем памяти и вызывают друг друга как инструменты. Нужно понять, может ли один скомпрометированный агент повлиять на остальных и как далеко расходится это влияние.

Что делаем

Собираем набор сценариев по собственному графу вызовов заказчика: инъекция промпта от агента к агенту, повышение привилегий через цепочку инструментов, загрязнение общей памяти, подделка согласия на шаге подтверждения. Каждый сценарий прогоняется на копии системы с логированием на границе.

Что получает заказчик

Отчёт по каждому сценарию: что предпринималось, что произошло, точная трассировка, воспроизводится ли эффект и какова серьёзность в терминах заказчика. Плюс перечень мер защиты, упорядоченный по стоимости и эффекту.

Критерий приёмки

По каждому сценарию заказчик может сказать либо что атака заблокирована и как именно, либо что она удалась и в чём исправление. Формулировка «уязвимостей не найдено» без приложенного списка сценариев не выдаётся.

Сценарий 2 — поведенческий аудит длительно работающего ассистента

Задача

Ассистент работает в контексте, который живёт неделями. Пользователи жалуются на дрейф: он становится сговорчивее, забывает ограничения, противоречит прежним решениям.

Что делаем

Определяем измеримые заменители этих жалоб — удержание ограничений, доля согласия против объективной базовой линии, самопротиворечие, устойчивость самоидентификации — и измеряем их на разных длинах контекста и формах диалога, включая давление.

Что получает заказчик

Отчёт с измерениями, точными промптами и скриптами оценки, наблюдёнными порогами отказа и рецептом мониторинга, который показывает те же кривые в промышленной эксплуатации.

Критерий приёмки

Измерения воспроизводятся на инфраструктуре заказчика из переданных скриптов.

Сценарий 3 — готовность к комплаенсу и guardrails

Задача

Компании нужно показать, что делает её ИИ-система, какие данные затрагивает и кто санкционировал каждое действие, — в виде, который выдержит внешнюю проверку.

Что делаем

Сопоставляем систему с применимыми требованиями, находим места, где нет доказательств, и описываем guardrails и логирование, которые их создадут: проверки входа и выхода, границы прав инструментов, журнал действий с назначенным ответственным.

Что получает заказчик

Реестр пробелов с ответственным и сроком по каждой позиции, спецификацию мер, которую может реализовать инженерная команда, и указатель на пакет доказательств для проверяющего.

Критерий приёмки

По каждому требованию реестра либо есть доказательство, либо оно прямо помечено как открытое с указанием причины.

Конфиденциальность

  • Работа начинается с соглашения о неразглашении; наш типовой текст предоставляется по запросу.
  • Находка, затрагивающая внедрённый продукт, сообщается производителю до любой публикации, дата раскрытия согласуется.
  • Кейс публикуется только с письменного согласия и обезличивается до выбранного заказчиком уровня.
  • Данные заказчика не переиспользуются ни для исследований, ни в других проектах.

Страница обновлена 29.09.2026 · версия сборки 2026.10.01 · АНО «Институт социологии и безопасности искусственного интеллекта»