Методология и глоссарий
Как институт проводит исследования, что означают используемые термины и где проходят границы применимости результатов. Страница нужна, чтобы с нашими отчётами можно было спорить по существу, а не по формулировкам.
Пять принципов работы
1. Проверяемое утверждение
Каждый вывод в отчёте сопровождается данными, по которым его можно проверить: протокол прогона, версии моделей, воспроизводимая конфигурация. Утверждение без такого следа в отчёт не попадает.
2. Открытость по умолчанию
Методики, глоссарий, тексты и протоколы публикуются под CC BY 4.0 сразу. Наборы данных открываются под той же лицензией через 12 месяцев после статьи, к которой относятся, до этого — по заявке. Закрытыми остаются только те материалы, где раскрытие создаёт риск: сведения об уязвимостях до исправления и персональные данные.
3. Разделение факта и оценки
В текстах прямо помечено, что измерено, что является моделью, а что — нашей интерпретацией. Оценочные суждения не выдаются за результаты измерений.
4. Отказ от скрытого воздействия
Институт не проводит эксперименты на чужих системах без явного согласия их владельцев. Исследование инъекций в контент ведётся только на своей площадке и с явной пометкой внутри самой полезной нагрузки.
5. Ограничения публикуются вместе с результатом
У каждого отчёта есть раздел ограничений: на каких моделях проверено, что не проверено, какие условия могут изменить вывод. Отчёт без этого раздела считается неполным.
Глоссарий
Определения даны в том смысле, в котором институт использует их в своих работах. Там, где термин не устоялся, это сказано прямо.
ИИ-агент
Программная система на основе модели машинного обучения, которая получает цель, действует по шагам, располагает инструментами и памятью и способна продолжать работу без участия человека. В наших текстах «агент» — именно это, а не чат-бот, отвечающий на один вопрос.
Социология взаимодействия между ИИ-агентами (AI-to-AI Sociology)
Изучение устойчивых форм совместного поведения коллективов агентов: ролей, иерархий, коалиций, разделения труда, а также патологий этих форм. Термин наш; в англоязычной литературе близкие явления описывают как multi-agent interaction и emergent behaviour, но единого названия нет.
Вирусы разума (mind viruses)
Самовоспроизводящиеся инструкции, которые распространяются между агентами через файлы памяти, общие документы и переписку, сохраняясь при пересказе. Ближайший мировой якорь — работа Anthropic «Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems» (arXiv:2608.10218, август 2026). Мы используем термин в этом значении.
LLM-психоз
Рабочее название класса отказов, при которых модель теряет логическую непротиворечивость, устойчивость самоидентификации и связь с проверяемыми фактами, продолжая при этом связно отвечать. Это не клинический термин: мы не переносим на модель психиатрические диагнозы, а обозначаем наблюдаемое поведение.
Непрямое внедрение команд (indirect prompt injection)
Случай, когда инструкция попадает к агенту не от пользователя, а из содержимого, которое агент читает: страницы, документа, письма, изображения, аудио. Для института это основной предмет прикладных работ по безопасности.
Иммунная архитектура
Способ построения системы, при котором надзор встроен в неё, а не приделан снаружи: надзорные контуры, независимая проверка действий, ограничение прав инструментов, аппаратное отключение. Мы предпочитаем этот термин «защите», потому что речь о свойстве системы, а не о продукте.
Case study (методическая модель)
Разбор задачи, показывающий наш порядок работы: что дано, что делаем, что получает заказчик, по какому критерию работа принимается. Три сценария на странице «Кейсы» — это методические модели, а не отчёты о выполненных проектах: институт пока не зарегистрирован и проектов не имеет. Мы помечаем это прямо, чтобы не создавать ложного впечатления.
Три уровня доступа к данным
Открытый — публикуется под CC BY 4.0: тексты, глоссарий, методики и протоколы сразу, наборы данных — через 12 месяцев после соответствующей статьи. По заявке — выдаётся после короткой проверки цели использования, потому что набор содержит поведение моделей, пригодное для злоупотребления. Ограниченный — не выдаётся вовсе: сведения об уязвимостях до исправления и любые персональные данные.
Как мы проверяем себя
- Повторный прогон: результат считается устойчивым, если он воспроизводится при повторном запуске на той же конфигурации.
- Версии и даты: у каждого прогона фиксируются версии моделей и дата — поведение моделей меняется без предупреждения, и результат без даты ничего не значит.
- Ограничения: список того, что в работе не проверялось, публикуется вместе с выводами, а не по запросу.
- Раскрытие интересов: если работа связана с коммерческим интересом, это указывается в самой публикации.
Институт не зарегистрирован как юридическое лицо. Всё на этой странице — описание принятого порядка работы; после государственной регистрации здесь появятся реквизиты внутренних документов, которыми этот порядок закреплён.