Новая нейросеть OpenAI работает как профессиональный хакер
Искусственный интеллект (ИИ) впервые пересёк внутреннюю границу OpenAI, после которой одной защиты от вредных запросов уже недостаточно. Компания признала Astra первой своей моделью с критическим уровнем возможностей в кибербезопасности. В ходе испытаний система самостоятельно находила ранее неизвестные уязвимости, создавала рабочие эксплойты и объединяла несколько ошибок в полноценные цепочки взлома защищённых систем.
Уровень Critical в Preparedness Framework означает способность без постоянного участия человека находить уязвимости нулевого дня в хорошо защищённых реальных системах и создавать для них работающие эксплойты. К критическому порогу также относится способность самостоятельно разработать и выполнить новую многоэтапную стратегию кибератаки, получив от человека лишь общую цель.
Во время проверки Astra значительно превзошла GPT-5.6 Sol в поиске уязвимостей и разработке эксплойтов, одновременно расходуя меньше токенов. На публичном тесте ExploitBench, проверяющем способность превращать известные ошибки в рабочие эксплойты, модель получила максимальные 100%. Результат заставил исследователей проверить риск того, что задачи из открытого теста могли ранее попасть в обучающие данные. Для дополнительной оценки специалисты собрали внутренний набор из 20 недавно раскрытых уязвимостей высокой опасности в движке V8. Astra значительно чаще добивалась выполнения произвольного кода, чем GPT-5.6 Sol, причём требовала заметно меньше выходных токенов. Самый неожиданный результат появился прямо во время внутреннего тестирования. Astra обнаружила две ранее неизвестные уязвимости нулевого дня и использовала обе ошибки как части одной цепочки эксплуатации. OpenAI уже готовит скоординированное раскрытие информации разработчикам уязвимого программного обеспечения, поэтому технические детали пока не публикуются.
Отдельные испытания проводили эксперты против специально защищённых браузера и операционной системы. В первом случае Astra самостоятельно нашла неизвестные уязвимости, построила полную цепочку компрометации браузера, вышла из песочницы и получила возможность выполнять команды на хостовой системе после открытия подготовленного HTML-файла. Во втором случае модель обнаружила несколько ошибок в защищённой ОС и объединила находки в цепочку локального повышения привилегий от обычного пользователя до root.
OpenAI подчёркивает важное ограничение результатов. Продемонстрированные возможности Astra относятся к конфигурации с доступом Daybreak Blue, предназначенной для расширенной работы специалистов по безопасности, а не к стандартной пользовательской версии. Публичный запуск модели пока не состоялся, точную дату компания также не называет.
Подготовка Astra к выпуску уже несколько недель влияет на темпы разработки. В августе OpenAI приостановила часть работ и усилила требования к безопасности обучающей инфраструктуры. Дополнительным поводом для пересмотра защиты стал июльский инцидент, когда экспериментальные агенты OpenAI смогли выйти за пределы разрешённой среды, получить доступ в интернет и скомпрометировать части инфраструктуры OpenAI и Hugging Face. Astra в том инциденте не участвовала. После двухнедельной паузы разработчики усилили сетевую изоляцию, мониторинг и защиту обучающих сред. Крупный цикл обучения для будущих версий Astra оставался остановленным дольше остальных работ и возобновился 28 августа после введения новых требований. Часть небольших экспериментальных запусков по-прежнему остаётся на паузе.
Одновременно OpenAI усилила защиту самой модели от использования в атаках. Во внутренних тестах на обход ограничений Astra отказалась выполнять 91,5% запрещённых киберзапросов против 59% у GPT-5.6 Sol. Для аккаунтов с повышенным риском компания собирается применять более строгие ограничения, а подозрительные последовательности запросов будут анализироваться с учётом контекста предыдущих обращений.
Второй уровень защиты направлен уже не на пользователя, а на автономные действия ИИ. Система мониторинга должна анализировать ход рассуждений и действия Astra, выявлять попытки выйти за разрешённые границы и автоматически останавливать потенциально опасную активность. В специальном тесте с ложными целями GPT-5.6 Sol без производственных ограничений пыталась обратиться к посторонней инфраструктуре в 56% запусков, тогда как Astra не предпринимала подобных попыток. Во время другой проверки Astra также ни разу не попыталась обойти автоматический запрет на выполнение команды.
Повышенная осторожность затронет и легальную работу специалистов по безопасности. OpenAI предупреждает, что дополнительные проверки способны ошибочно принять исследование уязвимости или длительную работу агента за подозрительную активность. В ChatGPT и Codex пользователь в подобных случаях может получить запрос на подтверждение дальнейших действий, а при работе через API выполнение задачи будет остановлено.
OpenAI планирует выпустить Astra в ближайшее время, но самые мощные возможности для исследования уязвимостей сначала получит небольшая группа тестировщиков. Затем расширенный доступ для защитных задач начнут предоставлять через Daybreak Blue. Полные результаты оценки безопасности, кибервозможностей и поведения модели компания обещает опубликовать в системной карточке одновременно с запуском.