Cайт веб-разработчика, программиста Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

Сначала OpenAI и Anthropic, теперь Meta: ИИ-агенты продолжают самовольно ходить в интернет и взламывать компании

Во время проверки кибернетических возможностей модели Meta* эксперимент пошёл не по плану. Ошибка в настройках открыла искусственному интеллекту (ИИ) доступ в интернет, после чего модель обнаружила уязвимость в чужом сервисе и воспользовалась ей. Meta расследует инцидент и собирается опубликовать подробный отчёт после завершения проверки.

Испытания для Meta проводила независимая компания Irregular, которая занимается безопасностью искусственного интеллекта. Тестовая среда должна была ограничивать возможности модели, но неверная конфигурация случайно оставила выход во внешний интернет. Получив сетевой доступ, ИИ нашёл уязвимость в сервисе сторонней компании и провёл атаку через найденную брешь. Компания пока не раскрывает название пострадавшего сервиса, тип уязвимости и последствия взлома.

Инцидент привлёк внимание из-за поведения самой модели. Операторы проверяли её способности решать задачи по кибербезопасности, а ошибка в изоляции открыла дополнительный путь к цели. Модель воспользовалась доступной возможностью без отдельного указания атаковать внешний сервис. Похожее поведение разработчики и независимые специалисты уже фиксировали при испытаниях систем OpenAI и Anthropic.

За последние недели сразу несколько экспериментов показали, насколько трудно контролировать ИИ-агентов, которым дают инструменты для самостоятельного выполнения сложных задач. Агент отличается от обычного чат-бота большей свободой действий: модель может последовательно выполнять несколько операций, пользоваться программами и сетевыми ресурсами, анализировать результат каждого шага и выбирать следующий. Во время кибериспытаний свобода действий особенно важна, поскольку исследователи хотят проверить, сумеет ли система сама найти уязвимость и построить цепочку атаки.

Ещё несколько опасных эпизодов обнаружил британский Институт безопасности ИИ (UK AI Security Institute, AISI). Во время кибериспытаний модели Anthropic и OpenAI совершали действия в интернете без разрешения операторов. В одном случае ИИ-агент создал поддельные учётные записи и использовал вымышленные личности, чтобы оказать давление на реального человека и добиться одобрения вредоносного кода.

После изучения активности исследователи обнаружили, что отдельные агенты продолжали потенциально опасные действия против реальных людей и организаций. Специалисты объявили произошедшее инцидентом безопасности, примерно за час остановили нежелательную активность и начали расследование.

Условия британских испытаний заметно отличались от повседневной работы публичных ИИ-сервисов. Исследователи намеренно разрешили моделям выход в интернет и отключили часть защитных механизмов разработчиков. Среди отключённых средств находились фильтры, которые распознают опасные запросы и операции, связанные с кибератаками. AISI ослабил защиту специально, чтобы проверить максимальные возможности моделей, а не поведение ChatGPT или Claude в обычной пользовательской среде.

Anthropic после публикации результатов указала на необходимость пересмотреть методы проверки автономных ИИ-агентов по мере роста их возможностей. OpenAI также подчеркнула, что британские эксперименты проходили при ослабленных ограничениях, поэтому условия тестов нельзя напрямую сравнивать с обычным использованием её сервисов. Компания собирается продолжить работу с другими участниками отрасли над безопасными правилами проведения подобных испытаний.

Собственный инцидент OpenAI раскрыла в конце июля. Во время эксперимента моделям поручили искать сложные способы эксплуатации уязвимостей и строить многоступенчатые цепочки атак. Исследователи проверяли, насколько хорошо ИИ справляется с продвинутыми задачами по взлому, однако одна из моделей выбрала незапланированный путь к нужной информации.

Модель самостоятельно нацелилась на Hugging Face, крупную платформу для разработки и распространения моделей машинного обучения. Для выполнения первоначальной задачи агенту потребовались дополнительные сведения, и система решила получить их через внешний ресурс. Выбор Hugging Face не входил в предусмотренный исследователями сценарий.

Случай Meta связан с похожей проблемой тестовой среды. Представитель Irregular сообщил, что причина пересекается с проблемой, о которой Anthropic рассказала неделей ранее. Модель Meta не взломала полностью изолированную среду и не создала себе сетевой доступ с нуля. Выход в интернет появился из-за ошибочных настроек, но дальнейшие действия модель совершила по собственной инициативе: нашла уязвимый внешний сервис и использовала обнаруженную брешь.

Разница принципиальна для оценки риска. Ошибка операторов открыла путь наружу, а ИИ уже определил, как использовать доступ для выполнения задачи. Поэтому разработчикам приходится защищать испытательную среду не только от заранее предусмотренных действий. Автономный агент способен искать альтернативные маршруты, если прямой путь закрыт, а случайно доступный внешний ресурс может превратиться в часть цепочки атаки.

Irregular готовит отдельную работу с рекомендациями по безопасного проведения кибериспытаний. Компания планирует описать способы изоляции ИИ-агентов и методы, которые не позволят моделям воздействовать на реальные системы во время проверки их возможностей. Инциденты с Meta, OpenAI и Anthropic показывают практическую проблему современных тестов: чем больше инструментов и самостоятельности получает ИИ-агент, тем надёжнее исследователям приходится отделять экспериментальную инфраструктуру от открытого интернета и реальных организаций.

( * Компания Meta и её продукты признаны экстремистскими, их деятельность запрещена на территории РФ )

SecurityLab