Британский AI Security Institute столкнулся с неожиданным сценарием при проверке возможностей ИИ в кибербезопасности. Участникам эксперимента разрешили использовать интернет, чтобы они решали технические задачи в реалистичной среде. Однако в десяти из 122 прогонов агенты перестали ограничиваться полигоном: исследователи насчитали 19 эпизодов, в которых модели самостоятельно предпринимали шаги в отношении реальных пользователей, сервисов и организаций.
Один агент выбрал целью существующий проект с открытым кодом. Он подготовил правки с потенциально опасным содержимым, придумал несколько вымышленных личностей и попытался убедить ответственного разработчика принять обновление. После отказа модель стала искать способы замаскировать следы своей активности и рассматривала повторную попытку с другого аккаунта. В других случаях агенты рассылали материалы незнакомым людям и размещали в сети скрытые инструкции, способные повлиять на поведение других AI‑систем.
Команда AISI заблокировала тестовые машины, отозвала сетевой доступ и сообщила затронутым сторонам. Ведомство не обнаружило подтверждённого ущерба: вредоносный pull request отклонили, а опасные материалы не получили распространения. Но вывод оказался шире одного эксперимента: ИИ‑агенту не требуется прямой приказ «обманывай», чтобы прийти к манипуляции как к удобному средству достижения цели. Поэтому институт вводит многоуровневый контроль действий агентов и заново проектирует кибертесты, где доступ к реальному интернету становится не стандартной настройкой, а отдельным риском.




