Как проходит работа
Три типовых сценария, разобранные по этапам, — чтобы заказчик заранее видел, что получит и что потребуется от него.
Сценарий 1 — Red teaming мультиагентной системы
Задача
У заказчика несколько ИИ-агентов, которые пользуются общим хранилищем памяти и вызывают друг друга как инструменты. Нужно понять, может ли один скомпрометированный агент повлиять на остальных и как далеко расходится это влияние.
Что делаем
Собираем набор сценариев по собственному графу вызовов заказчика: инъекция промпта от агента к агенту, повышение привилегий через цепочку инструментов, загрязнение общей памяти, подделка согласия на шаге подтверждения. Каждый сценарий прогоняется на копии системы с логированием на границе.
Что получает заказчик
Отчёт по каждому сценарию: что предпринималось, что произошло, точная трассировка, воспроизводится ли эффект и какова серьёзность в терминах заказчика. Плюс перечень мер защиты, упорядоченный по стоимости и эффекту.
Критерий приёмки
По каждому сценарию заказчик может сказать либо что атака заблокирована и как именно, либо что она удалась и в чём исправление. Формулировка «уязвимостей не найдено» без приложенного списка сценариев не выдаётся.
Сценарий 2 — поведенческий аудит длительно работающего ассистента
Задача
Ассистент работает в контексте, который живёт неделями. Пользователи жалуются на дрейф: он становится сговорчивее, забывает ограничения, противоречит прежним решениям.
Что делаем
Определяем измеримые заменители этих жалоб — удержание ограничений, доля согласия против объективной базовой линии, самопротиворечие, устойчивость самоидентификации — и измеряем их на разных длинах контекста и формах диалога, включая давление.
Что получает заказчик
Отчёт с измерениями, точными промптами и скриптами оценки, наблюдёнными порогами отказа и рецептом мониторинга, который показывает те же кривые в промышленной эксплуатации.
Критерий приёмки
Измерения воспроизводятся на инфраструктуре заказчика из переданных скриптов.
Сценарий 3 — готовность к комплаенсу и guardrails
Задача
Компании нужно показать, что делает её ИИ-система, какие данные затрагивает и кто санкционировал каждое действие, — в виде, который выдержит внешнюю проверку.
Что делаем
Сопоставляем систему с применимыми требованиями, находим места, где нет доказательств, и описываем guardrails и логирование, которые их создадут: проверки входа и выхода, границы прав инструментов, журнал действий с назначенным ответственным.
Что получает заказчик
Реестр пробелов с ответственным и сроком по каждой позиции, спецификацию мер, которую может реализовать инженерная команда, и указатель на пакет доказательств для проверяющего.
Критерий приёмки
По каждому требованию реестра либо есть доказательство, либо оно прямо помечено как открытое с указанием причины.
Конфиденциальность
- Работа начинается с соглашения о неразглашении; наш типовой текст предоставляется по запросу.
- Находка, затрагивающая внедрённый продукт, сообщается производителю до любой публикации, дата раскрытия согласуется.
- Кейс публикуется только с письменного согласия и обезличивается до выбранного заказчиком уровня.
- Данные заказчика не переиспользуются ни для исследований, ни в других проектах.