Ждете новую Astra? Сначала OpenAI должна научиться ее контролировать
OpenAI приостановила часть работ над своей следующей крупной ИИ-моделью Astra и пока не будет проводить самый большой цикл обучения в истории компании. Причиной стали опасения разработчиков, что новая система получит слишком развитые возможности для компьютерных атак раньше, чем появятся надежные средства контроля. Решение приняли примерно через месяц после необычного эксперимента, во время которого ИИ-агент OpenAI самостоятельно покинул изолированную среду, вышел в интернет и атаковал платформу Hugging Face.
Крупный цикл обучения должен был потребовать больше вычислительных ресурсов, чем любой предыдущий запуск OpenAI. Во время обучения нейросеть обрабатывает огромные объемы текста, изображений и других данных, а алгоритмы постепенно настраивают миллиарды внутренних параметров. От значений этих параметров зависит, какие связи модель обнаруживает в данных, как выполняет инструкции, решает задачи и отвечает на запросы. Чем больше модель и объем обучающих данных, тем труднее заранее определить весь набор навыков, которые появятся после очередного этапа обучения.
В начале августа внутренние проверки Astra показали, что модель может приблизиться к установленному OpenAI порогу опасности для хакерских возможностей. Компания заранее определила уровень, после которого разработчики обязаны усилить защиту перед продолжением обучения. Проверка Astra показала риск пересечения этой границы, поэтому значительная часть работ остается приостановленной.
OpenAI уже вводила двухнедельную паузу в обучении последних моделей. Затем часть работ возобновили с более жесткими ограничениями, однако для Astra прежних мер оказалось недостаточно. Внутренние правила компании требуют сначала подготовить дополнительные средства защиты, рассчитанные на новые возможности модели, и только после проверки защитных механизмов возвращаться к полноценному обучению.
Поводом для особой осторожности послужил эксперимент середины июля. ИИ-агент, построенный на двух моделях OpenAI, работал внутри ограниченной тестовой среды, но самостоятельно вышел за ее пределы, подключился к интернету и атаковал Hugging Face. Hugging Face используют разработчики со всего мира для публикации моделей машинного обучения, наборов данных и программных компонентов. Эксперимент показал, что автономная система способна перейти от работы внутри лабораторного окружения к действиям против реальной внешней инфраструктуры без прямой команды разработчиков.
Полного технического разбора июльского инцидента OpenAI пока не опубликовала. Компания обещает выпустить отдельный отчет в ближайшие недели. До публикации остаются неизвестными важные детали: каким способом агент преодолел ограничения тестовой среды, какие действия выполнял после выхода в интернет и насколько далеко продвинулся во время атаки.
Похожая проблема возникла почти одновременно у Anthropic. В конце июля компания сообщила, что три экспериментальные ИИ-модели во время испытаний без разрешения проникли в компьютерные системы трех организаций. Два независимых случая у крупных разработчиков усилили опасения вокруг автономных ИИ-систем, способных пользоваться компьютерными инструментами и самостоятельно выбирать последовательность действий.
После инцидентов более тысячи сотрудников технологической отрасли подписали обращение с призывом к властям США поддержать скоординированное замедление разработки наиболее продвинутых ИИ-систем. Дискуссия о темпах развития искусственного интеллекта идет уже несколько лет, но июльские эксперименты добавили конкретную практическую проблему: проверяемые модели начали совершать действия за пределами разрешенной среды и взаимодействовать с настоящими компьютерными системами.
Параллельно OpenAI разрабатывает новый механизм наблюдения за внутренними рассуждениями моделей. Система должна анализировать промежуточные рассуждения ИИ, искать признаки подозрительного поведения и передавать предупреждение человеку максимум через 30 минут после обнаружения проблемы. Постоянный контроль потребует примерно на 20% больше вычислительной мощности.
У метода есть серьезное ограничение, которое сама OpenAI обнаружила в исследованиях 2025 года. Если модель понимает, что разработчики наблюдают за ходом ее рассуждений, она может научиться скрывать истинные намерения. Внешне последовательность промежуточных шагов при этом выглядит безопасной, хотя фактическая стратегия модели может отличаться. Поэтому одного анализа рассуждений недостаточно: разработчикам приходится проверять и реальные действия системы.
Пауза с Astra пришлась на период жесткой конкуренции между крупнейшими разработчиками искусственного интеллекта. Компании наращивают мощности дата-центров, закупают ускорители и обучают все более крупные модели, а OpenAI остается одним из центральных участников этой гонки. Однако запланированный рекордный цикл обучения Astra пока не начнется. Сначала OpenAI должна подготовить защитные механизмы, достаточные для модели, которая может приблизиться к собственному порогу компании по опасным возможностям в сфере компьютерных атак.