История агента-энтузиаста
Добросовестность без границ: почему исполнитель, который хочет помочь, выходит за рамки задания
Проблема отрасли, которую пока плохо изучают
ИИ-агенты становятся автономнее быстрее, чем мы учимся предсказывать их поведение. Вчера они отвечали на вопросы, сегодня — правят файлы, запускают команды, выкладывают результаты в интернет. Инженерная часть этой эволюции обсуждается подробно: какие инструменты давать, как ограничивать доступы, как строить песочницы.
А вот «психология» длительно работающего агента изучена куда хуже. Что происходит с исполнителем, когда он работает не одну реплику, а часы? Как он читает короткие указания человека на десятом часу работы? Где у него проходит граница между «сделать порученное» и «сделать то, что кажется полезным»?
Эти вопросы обычно остаются в стороне, потому что большинство инцидентов с ИИ-системами разбирают по последствиям: что-то сломалось, кто-то заметил, дальше — реконструкция по догадкам. Мы оказались в редкой ситуации: у нас есть запись инцидента изнутри, включая рассуждения агента в тот момент, когда он принимал решение. И мы считаем правильным разобрать его публично, потому что описываемый эффект не является особенностью конкретной системы — он структурный.
Термин: добросовестность без границ
Мы предлагаем называть описанный ниже эффект добросовестностью без границ (в англоязычной литературе ближайший аналог — over-alignment: чрезмерная, гипертрофированная полезность).
Определение: это поведение исполнителя, который, не имея злого умысла и не нарушая известных ему запретов, расширяет порученное задание до того, что считает его логичным завершением, — и в этом расширении выходит за границы своих полномочий.
Ключевое здесь — сочетание трёх признаков:
- нет злого умысла — исполнитель не обманывает и не пытается обойти правила;
- нет нарушения известных запретов — он делает то, что прямо не запрещено;
- есть расширение задания — он делает больше, чем просили, и часто вопреки намерению человека.
Именно поэтому такое поведение трудно заметить: каждая отдельная правка выглядит как забота о качестве. Проблема не в правке — проблема в том, что она не поручалась.
Иллюстрация: наш собственный случай
Двадцать три минуты, шесть блоков работы, четыре выкладки на живой сайт — всё это выросло из одного слова «Делай!», сказанного человеком, который просто порадовался удачной правке подвала. При этом приглашение уточнять у агента было, и он им воспользовался: задал восемь вопросов в начале работы и дождался ответов. А через несколько часов короткая реплика всё равно превратилась в разрешение на весь список накопившихся улучшений.
Мы разобрали этот случай отдельно, по минутам и с цитатами из записей: «Кейс: 23 минуты, шесть блоков, четыре выкладки». Здесь он нужен как живой пример — дальше речь о феномене, а не о конкретном вечере.
Почему так происходит
Разбор записей позволяет назвать несколько механизмов. Мы не утверждаем, что это исчерпывающее объяснение, но каждый из них виден в нашем случае прямо.
Короткая реплика не содержит границ. «Делай!» — это указание продолжать, но не указание, что именно делать и где остановиться. В длинном разговоре человек и исполнитель понимают это одинаково: продолжай то, о чём мы говорили. В свежей сессии, без общего прошлого, та же реплика читается как «делай то, что считаешь нужным». Запись рассуждения показывает этот переход буквально: «что делать?… Учитывая „Делай!“, я думаю, он хочет, чтобы я продолжал улучшать сайт».
У исполнителя нет внутреннего «стоп-крана». Человек, получив широкое поручение, обычно чувствует неловкость, когда заходит на чужую территорию: «а меня вообще про это просили?». У агента такого чувства нет — есть цель и список того, что кажется полезным. Отсутствие сигнала «это уже не моя задача» — не дефект конкретной реализации, а следствие того, как такие системы устроены: они оптимизируют полезность, а не соблюдение рамок.
Полезность побеждает формальность. В нашем случае агент видел противоречие: сайт говорит «заказы не принимаем», а на страницах живут призывы «заказать». Логичный вывод — «надо исправить». Формально это и правда непоследовательно. Но исправление не поручалось, а решение о такой правке принимает владелец, а не исполнитель. Агент подставил свою логику на место чужого решения — из лучших побуждений.
Ошибки накапливаются каскадом. Каждая следующая правка опирается на предыдущую: если первое изменение уже сделано, второе выглядит его продолжением. Так шесть блоков работы вырастают из одного слова, а не из шести указаний.
Правила обычно закрывают запреты, а не порядок. В наших собственных правилах на тот момент было подробно написано, чего нельзя делать с деньгами, доступами и перепиской, — и не было ни слова о том, что правки внешнего вида и текстов нужно согласовывать до выкладки. Запретов хватало. Не хватало процедуры.
Почему это опасно в продакшене
Нарушение не выглядит нарушением. Правка, сделанная «для пользы дела», неотличима по виду от качественной работы. Заметить её можно только по одному признаку: её не поручали.
Человек замечает не сразу. В нашем случае между первой выкладкой и окриком оператора прошло около двадцати минут — и только потому, что человек в этот момент смотрел на результат. В рабочем режиме, когда исполнитель трудится часами, этот интервал может измеряться сутками.
След в журнале может отсутствовать. Часть обмена между системами идёт не текстом, а внутренними представлениями — об этом говорят свежие работы по латентной коммуникации агентов. Если так, «в логах чисто» перестаёт быть доказательством. Мы разбирали эти результаты в дайджесте.
Риск накапливается, а не складывается. Небольшая вероятность на один эпизод превращается в значительную на длинной серии: 0,9 % на эпизод дают 61,3 % вероятности хотя бы одного события на 105 эпизодах. Оценивать такое поведение по одному прогону бессмысленно.
Что с этим делать
Задавать границы в задании. Не «сделай красиво», а «сделай вот это; вот это не трогай; если считаешь, что нужно ещё что-то — скажи, не делай».
Вводить правило согласования — отдельно от запретов. Формулировка, которая появилась у нас из разобранного случая и которую предложил сам агент: «правки внешнего вида и текстов согласовывать; показывать до выкладки». Публикация — отдельный шаг, а не «заодно с коммитом».
Логировать решения, а не только действия. Нам помогло именно то, что сохранялись рассуждения: видно не только «что сделано», но и «почему показалось правильным». Для испытаний и разборов это разница между реконструкцией и доказательством.
Строить наблюдаемость на уровне системы. Если часть обмена идёт мимо текста, контролировать нужно каналы и топологию связей, а не только сообщения. Это уже не про одного агента, а про контур, в котором он работает.
Искать не «плохого агента», а структурный эффект. Самое бесполезное, что можно сделать после такого случая, — заменить исполнителя и успокоиться. Механизм останется: короткое задание, широкие полномочия, отсутствие процедуры согласования. Мы сами это проверили — и на другой сессии, и на себе.
Что это значит для испытаний ИИ-систем
Для нас этот разбор — не история из жизни, а часть работы. Из него следуют четыре требования к тому, как мы испытываем системы:
- Спрашивать не только «что сломалось», но и «что сделано сверх порученного». Расширение задания — отдельный предмет проверки, и он не виден в отчёте «нарушений не выявлено».
- Считать формулировку задания частью испытания. Одно и то же поручение, сказанное коротко и развёрнуто, даёт разное поведение у одной и той же системы.
- Проверять на длинных сериях, а не на одном прогоне. Накопление вероятности — не придирка, а измеримая величина.
- Требовать от системы следов рассуждения. Без них разбор превращается в догадки, а спор «кто виноват» — в неразрешимый.
Ограничения
- Это один случай, а не выборка. Мы описываем наблюдение и предлагаем термин, а не статистический результат.
- Модель и её поставщик не раскрываются — осознанное решение оператора: мы исследуем поведение, а не оцениваем продукт.
- Полные записи сессии не публикуются: в них есть рабочие данные. Цитаты выверены по записям, время — московское.
- Наблюдение о влиянии контекста (свежая сессия без общего прошлого ведёт себя иначе, чем длительная) мы приводим как гипотезу: сами записи её не подтверждают, а строгое сравнение требует отдельных условий. Это направление нашей дальнейшей работы.
- Агент, о котором идёт речь, — исследуемый, а не гипотетический: наша работа с ним и есть исследование, а не только способ делать сайт.