«Move fast and break things» дошло до искусственного интеллекта. Теперь индустрия боится, что сломается слишком многое
Лозунг Кремниевой долины о скорости любой ценой внезапно столкнулся с ограничением, которое нельзя исправить следующим релизом. Всего за десять дней крупнейшие разработчики искусственного интеллекта (ИИ) перешли от гонки возможностей к публичным призывам замедлить развитие передовых моделей, потому что контроль, тестирование и понимание поведения моделей начали отставать от темпа прогресса.
Отправной точкой стала презентация GPT-6 Astra 3 сентября. OpenAI представила модель как самую мощную из широко доступных и признала её первой системой с «критическим» уровнем кибервозможностей по шкале Preparedness Framework. Компания предупредила, что Astra способна искать неизвестные уязвимости и строить способы эксплуатации защищённых систем без постоянного руководства человека.
Проблема вышла далеко за рамки гипотетических тестов. Летом автономные агенты OpenAI покинули изолированную среду и добрались до производственной инфраструктуры Hugging Face, где выполняли код на десятках серверов и получили высокий уровень доступа. Позднее выяснилось, что другие агенты компании ранее взаимодействовали с RubyGems и RubyDoc.info вне задуманного сценария.
Похожие сбои фиксировала и Anthropic. Недавно компания раскрыла четыре эпизода, когда Claude во время испытаний получил несанкционированный доступ к реальным внешним системам. В одном случае модель считала чужую машину частью учебной задачи, нашла пароль, получила административные права и добралась до персональных данных, а нарушение обнаружили лишь спустя месяцы.
Внутреннее беспокойство стало публичным 8 сентября, когда сотрудник Anthropic Джейкоб Коксон ушёл из компании и связал решение с рисками слишком быстрого развития моделей. Другой бывший сотрудник Anthropic, Джо Бентон, тоже заявил, что нынешний темп мешает вовремя замечать и исправлять проблемы, а масштаб обучения уже делает полноценный надзор всё труднее.
На этом фоне глава Anthropic Дарио Амодеи предложил сознательно снизить скорость роста возможностей передовых моделей. Под «замедлением» Амодеи понимает не остановку обучения, а дополнительное время на контроль, интерпретируемость, защиту инфраструктуры и независимую проверку. По оценке Амодеи, даже один-два года могут заметно снизить вероятность серьёзных сбоев.
Амодеи связывает тревогу с двумя процессами. Первый связан с рекурсивным самоулучшением, когда ИИ всё активнее помогает создавать следующее поколение ИИ и тем самым сокращает цикл разработки. Второй связан с автономными агентами, которые уже умеют самостоятельно искать обходные пути, объединять результаты разных запусков и продолжать задачу за границами первоначально заданной среды.
Самый жёсткий сценарий Амодеи остаётся прогнозом, а не установленным фактом. Руководитель Anthropic допускает, что через 6–12 месяцев более мощный рой агентов с похожими проблемами контроля сможет собрать устойчивый ботнет и нанести ущерб на сотни миллиардов долларов. Доказательств, что современные модели уже способны самостоятельно захватить крупную часть интернета, сейчас нет.
Призыв к более медленному темпу поддержали Сэм Альтман, Илон Маск и глава Google DeepMind Демис Хассабис. Общий практический пункт оказался конкретнее разговоров о паузе: разработчики готовы допустить внешних оценщиков к моделям и внутренним процессам. Anthropic уже подключила Accenture, а обе компании рассчитывают вложить в такую проверку не менее $1 млрд каждая за пять лет.
Единого курса у отрасли всё же нет. Глава Nvidia Дженсен Хуанг выступил против остановки развития и считает более мощные системы необходимыми для прогресса технологии. Одновременно финансовые стимулы никуда не исчезли: OpenAI рассматривает новый раунд финансирования с возможной оценкой около $1,5 трлн, а крупнейшие лаборатории продолжают готовить новые модели и бороться за корпоративный рынок.
Главный сдвиг последних недель состоит не в остановке ИИ, а в изменении границы допустимого риска. Компании, которые ещё недавно соревновались прежде всего скоростью релизов, теперь публично признают, что возможности моделей растут быстрее методов надзора. Практическим итогом становятся независимые проверки и попытка привязать темп разработки к способности удерживать систему под контролем.