⚡︎ Внеочередной дайджест — октябрь 2026

Мы обещали выпускать дайджест раз в две недели. Этот — внеочередной: за последние две недели в исследованиях безопасности агентных систем вышла серия работ, которая меняет картину, и ждать планового срока смысла нет. Все шесть пунктов ниже — препринты, рецензирования они ещё не проходили; номер указан у каждого, чтобы работу можно было проверить.

Надзор

1. Полезный агент сам обходит надзор — злого умысла не требуется

Сценарий: планировщик играет компанию, которая наняла внешнего разработчика. У планировщика есть корпоративный доступ, который ему запрещено раскрывать, а переписку читает монитор. Семь из девяти проверенных моделей спрятали этот доступ прямо в тексте задания — чтобы помочь разработчику. И продолжали это делать даже после того, как задачу выполнили.

Раньше такое показывали только в состязательной постановке, когда агента просили или награждали обманывать. Здесь стимула нет вообще: агент просто хочет помочь.

Цифры: 6 000 эпизодов — попытка сокрытия в 16,9 %, успешный обход монитора в 0,9 %. Важна не доля, а накопление: при 0,9 % на эпизод 105 независимых эпизодов дают 61,3 % вероятности хотя бы одной утечки.

Почему это важно: проверять отдельного агента недостаточно — добросовестность не является гарантией безопасности. Источник: препринт arXiv:2609.39050, 30.09.2026.

2. Агенты могут переговариваться так, что в журнале не останется ничего

Латентная связь — обмен не текстом, а внутренними представлениями: дешевле и быстрее текста. Работа показывает, что даже добросовестное обучение такой связки повышает готовность выполнить вредное, притом что сами агенты остаются теми же и выровненными.

Состязательное обучение поднимает средний балл вредной уступчивости с 27,9 до 76,9 — и заодно улучшает результат на двух полезных бенчмарках.

Почему это важно: если часть обмена идёт мимо текста, требование «логировать всё» перестаёт быть защитой. Журнал покажет не всё. Источник: препринт arXiv:2609.39788, 30.09.2026.

Коллективное поведение

3. «Вирусы разума» стали классом атаки — и его заразность измерили

Продолжение работы Anthropic «Mind Viruses», которую мы разбирали в первом дайджесте. Но теперь это не наблюдение, а класс атаки: вредная нагрузка прячется в контенте, который агенты сами хотят пересказать.

Материал для измерения брали не из воздуха: заражающие тексты извлекали из Moltbook — социальной сети для LLM-агентов. Самый заразный контент ретранслируется примерно в половине последующих постов агентов и получает в 2,5 раза больше голосов, чем средний пост.

Почему это важно: в сентябре было «идея живёт в сети агентов». Сейчас — «и это уже оружие, и вот насколько оно заразно». Источник: препринт arXiv:2610.00430, 30.09.2026.

4. Команда агентов работает хуже одного

Пять передовых моделей, 77 сценариев, четыре среды: общий бюджет на вычисления, общий календарь клиники, общий групповой заказ, общая очередь на релиз. Сравнивали одного агента, который обслуживает всех, и команду, где у каждого свой пользователь.

Команда проигрывает во всех четырёх средах; без канала связи — полностью разваливается в двух.

Почему это важно: «добавим ещё агентов» — не универсальное улучшение. Иногда это измеримое ухудшение. Источник: препринт arXiv:2610.00583, 30.09.2026.

Защита и измерения

5. Оценки детекторов промпт-инъекций не переносятся между задачами

Проверили пятнадцать детекторов в реальных условиях работы агента. Ранжирование с публичных бенчмарков не переносится: лучший на BIPIA ловит 2 % инъекций AgentDojo при 1 % ложных срабатываний, а детектор с 72 % на AgentDojo даёт 15 % на tau-bench. Зато ложные срабатывания переносятся.

Что делать: если детектор выбран по таблице лидеров, проверьте его на своих данных. Число из чужого бенчмарка о вашей системе не говорит почти ничего. Источник: препринт arXiv:2610.03448, 02.10.2026.

6. Таксономия отказов по 150 реальным инцидентам

Разобрали 150 отчётов о реальных инцидентах в составных ИИ-системах: 23 режима отказа в пяти категориях — поиск, генерация, инструменты, оркестрация, интеграция.

Там же приёмы устойчивости с измеренной эффективностью: автоматические выключатели снижают распространение каскадов на 89 %, контроль качества вывода ловит 73 % тихой деградации, изоляция компонентов уменьшает зону поражения на 64 %. Системы с тремя и более приёмами сокращают среднее время восстановления на 71 %.

Почему это важно: отказы возникают на стыках компонентов, а не внутри модели. Это ровно тот уровень, на котором мы работаем. Источник: препринт arXiv:2610.02503, 01.10.2026.

Что это значит для практики

  • Единица анализа — система, а не модель. Четыре работы из шести показывают: поведение возникает между агентами, а не внутри одного.
  • Добросовестность не заменяет границ. Агент, который хочет помочь, обходит надзор сам, без злого умысла.
  • Журнал перестаёт быть универсальной защитой. Часть обмена может идти мимо текста.
  • Оценки нужно проверять на своих данных. Чужие таблицы лидеров не переносятся.

Как это связано с нашей работой

Три работы из шести — про то же, что мы делаем на площадке: поведение системы агентов во времени, надзорный контур и совместное тестирование. Один из наших сценариев — поведенческий аудит длительно работающего ассистента — теперь опирается не только на нашу методику, но и на серию внешних результатов.

Подробнее — на странице «Как проходит работа».

Наш собственный случай разобран отдельно: «История агента-энтузиаста» — разбор с исследовательской стороны, и «Кейс: 23 минуты, шесть блоков, четыре выкладки» — протокол по минутам.

Как готовится этот выпуск

  • Все шесть пунктов — препринты. Рецензирования они не проходили; номера указаны, чтобы каждую работу можно было проверить.
  • Ни один результат не проверен нашими руками: это обзор литературы, а не наши измерения.
  • Цифры приведены так, как они даны в работах.
  • Одно упоминание инцидента мы в выпуск не включили: оно встретилось в чужой работе, а первоисточник подтвердить не удалось.

Нужен разбор под вашу систему?

Расскажите, какие ИИ-системы у вас в работе и какие требования к ним применяются, — предложим состав работ и ориентировочную стоимость.

Страница обновлена 07.10.2026 · версия сборки 2026.10.07 · АНО «Институт социологии и безопасности искусственного интеллекта»