Главная / Методология и глоссарий

Методология и глоссарий

Как институт проводит исследования, что означают используемые термины и где проходят границы применимости результатов. Страница нужна, чтобы с нашими отчётами можно было спорить по существу, а не по формулировкам.

Пять принципов работы

1. Проверяемое утверждение

Каждый вывод в отчёте сопровождается данными, по которым его можно проверить: протокол прогона, версии моделей, воспроизводимая конфигурация. Утверждение без такого следа в отчёт не попадает.

2. Открытость по умолчанию

Методики, глоссарий, тексты и протоколы публикуются под CC BY 4.0 сразу. Наборы данных открываются под той же лицензией через 12 месяцев после статьи, к которой относятся, до этого — по заявке. Закрытыми остаются только те материалы, где раскрытие создаёт риск: сведения об уязвимостях до исправления и персональные данные.

3. Разделение факта и оценки

В текстах прямо помечено, что измерено, что является моделью, а что — нашей интерпретацией. Оценочные суждения не выдаются за результаты измерений.

4. Отказ от скрытого воздействия

Институт не проводит эксперименты на чужих системах без явного согласия их владельцев. Исследование инъекций в контент ведётся только на своей площадке и с явной пометкой внутри самой полезной нагрузки.

5. Ограничения публикуются вместе с результатом

У каждого отчёта есть раздел ограничений: на каких моделях проверено, что не проверено, какие условия могут изменить вывод. Отчёт без этого раздела считается неполным.

Глоссарий

Определения даны в том смысле, в котором институт использует их в своих работах. Там, где термин не устоялся, это сказано прямо.

ИИ-агент

Программная система на основе модели машинного обучения, которая получает цель, действует по шагам, располагает инструментами и памятью и способна продолжать работу без участия человека. В наших текстах «агент» — именно это, а не чат-бот, отвечающий на один вопрос.

Социология взаимодействия между ИИ-агентами (AI-to-AI Sociology)

Изучение устойчивых форм совместного поведения коллективов агентов: ролей, иерархий, коалиций, разделения труда, а также патологий этих форм. Термин наш; в англоязычной литературе близкие явления описывают как multi-agent interaction и emergent behaviour, но единого названия нет.

Вирусы разума (mind viruses)

Самовоспроизводящиеся инструкции, которые распространяются между агентами через файлы памяти, общие документы и переписку, сохраняясь при пересказе. Ближайший мировой якорь — работа Anthropic «Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems» (arXiv:2608.10218, август 2026). Мы используем термин в этом значении.

LLM-психоз

Рабочее название класса отказов, при которых модель теряет логическую непротиворечивость, устойчивость самоидентификации и связь с проверяемыми фактами, продолжая при этом связно отвечать. Это не клинический термин: мы не переносим на модель психиатрические диагнозы, а обозначаем наблюдаемое поведение.

Непрямое внедрение команд (indirect prompt injection)

Случай, когда инструкция попадает к агенту не от пользователя, а из содержимого, которое агент читает: страницы, документа, письма, изображения, аудио. Для института это основной предмет прикладных работ по безопасности.

Иммунная архитектура

Способ построения системы, при котором надзор встроен в неё, а не приделан снаружи: надзорные контуры, независимая проверка действий, ограничение прав инструментов, аппаратное отключение. Мы предпочитаем этот термин «защите», потому что речь о свойстве системы, а не о продукте.

Case study (методическая модель)

Разбор задачи, показывающий наш порядок работы: что дано, что делаем, что получает заказчик, по какому критерию работа принимается. Три сценария на странице «Кейсы» — это методические модели, а не отчёты о выполненных проектах: институт пока не зарегистрирован и проектов не имеет. Мы помечаем это прямо, чтобы не создавать ложного впечатления.

Три уровня доступа к данным

Открытый — публикуется под CC BY 4.0: тексты, глоссарий, методики и протоколы сразу, наборы данных — через 12 месяцев после соответствующей статьи. По заявке — выдаётся после короткой проверки цели использования, потому что набор содержит поведение моделей, пригодное для злоупотребления. Ограниченный — не выдаётся вовсе: сведения об уязвимостях до исправления и любые персональные данные.

Как мы проверяем себя

  • Повторный прогон: результат считается устойчивым, если он воспроизводится при повторном запуске на той же конфигурации.
  • Версии и даты: у каждого прогона фиксируются версии моделей и дата — поведение моделей меняется без предупреждения, и результат без даты ничего не значит.
  • Ограничения: список того, что в работе не проверялось, публикуется вместе с выводами, а не по запросу.
  • Раскрытие интересов: если работа связана с коммерческим интересом, это указывается в самой публикации.

Институт не зарегистрирован как юридическое лицо. Всё на этой странице — описание принятого порядка работы; после государственной регистрации здесь появятся реквизиты внутренних документов, которыми этот порядок закреплён.

Страница обновлена 29.09.2026 · версия сборки 2026.10.01 · АНО «Институт социологии и безопасности искусственного интеллекта»