Хочешь проверить эксплойт — сначала докажи искусственному интеллекту, что не злодей
Защитные ограничения в коммерческих ИИ-моделях начали мешать специалистам, которые ищут уязвимости и проверяют безопасность программ. Системы могут отказаться анализировать эксплуатацию ошибки даже тогда, когда исследователь работает с разрешения владельца продукта и пытается подтвердить, что найденная проблема действительно представляет угрозу.
Разработчики передовых моделей оказались перед сложной задачей. Один и тот же запрос может использоваться как для защиты, так и для нападения. Инструкция по созданию рабочего примера эксплуатации помогает инженеру проверить исправление, но способна предоставить злоумышленнику готовый путь для атаки.
Для решения этой проблемы Anthropic и OpenAI создали программы с проверкой пользователей. Anthropic предлагает Cyber Verification Program, а OpenAI — Trusted Access for Cyber. Одобренные специалисты получают модели с меньшим числом автоматических отказов, хотя основные запреты на заведомо вредоносные действия сохраняются.
OpenAI относит к допустимым задачам поиск и первичную оценку уязвимостей, анализ вредоносного ПО, обратную разработку программ, создание средств обнаружения атак и проверку исправлений. Для более рискованных операций, включая контролируемую разработку эксплойтов, предусмотрены дополнительные уровни допуска.
Однако представители отрасли утверждают, что даже после проверки модели ведут себя непоследовательно. Один и тот же запрос в разные дни может получить подробный ответ, безопасно сокращённую версию или полный отказ. В результате специалисту приходится подбирать формулировки и доказывать системе законность своей работы вместо непосредственного анализа кода.
Главный научный сотрудник NCC Group Крис Энли отметил, что без попытки использовать найденную ошибку трудно подтвердить её опасность. Предполагаемая уязвимость может оказаться недостижимой на практике, зависеть от редкой конфигурации или не позволять выполнить действие, которого опасаются разработчики.
Поэтому наступательная проверка служит частью защиты. Исследователь создаёт контролируемую атаку, чтобы определить последствия ошибки, оценить срочность исправления и затем убедиться, что обновление действительно перекрывает опасный путь. Автоматический фильтр не всегда способен отличить такую работу от подготовки реального взлома.
Некоторые команды после отказа облачного сервиса переходят на открытые модели, которые можно запускать локально. У таких систем обычно нет централизованной проверки личности, постоянного контроля запросов и ограничений, устанавливаемых американскими ИИ-компаниями.
Локальный запуск решает и проблему конфиденциальности. Неизвестная уязвимость может стоить сотни тысяч или миллионы долларов, а её преждевременное раскрытие позволяет преступникам атаковать пользователей до выпуска исправления. Передача кода, отчёта или черновика эксплойта внешнему сервису создаёт риск утечки чувствительных сведений.
Технический директор Crowdfense Паоло Станьо рассказал, что его коллеги применяют передовые облачные модели преимущественно для обратной разработки. Поиск ошибок и создание средств их эксплуатации компания предпочитает выполнять с помощью локальных систем, чтобы материалы не покидали контролируемую инфраструктуру.
Другие исследователи не считают фильтры серьёзным препятствием, поскольку используют искусственный интеллект (ИИ) только на подготовительных этапах. Модель может объяснить незнакомый участок кода, восстановить назначение функций, упростить рутинный анализ или написать вспомогательный инструмент, оставляя обнаружение самой уязвимости человеку.
Особенно заметными ограничения становятся в организациях, которые не вошли в программы проверенного доступа. Сотрудник производителя компонентов для смартфонов сообщил, что модель прекращает работу, как только распознаёт в запросе задачу по информационной безопасности. В таком режиме она почти бесполезна для полноценного поиска ошибок.
Руководитель компании RemoteThreat Крис Томпсон считает, что подобная политика подталкивает законопослушных специалистов к китайским открытым моделям, включая семейство GLM. Их можно свободно загрузить, развернуть внутри собственной сети и использовать без предварительного одобрения со стороны поставщика.
Возникает парадокс: американские компании ограничивают свои наиболее мощные инструменты, чтобы затруднить работу злоумышленникам, но преступники всё равно могут обратиться к открытым альтернативам. Защитники при этом теряют время, сталкиваются с непредсказуемыми отказами или полностью меняют используемую платформу.
Anthropic объясняет систему проверенного доступа необходимостью блокировать вымогательское ПО, массовое похищение данных и другие явно вредоносные операции, не отрезая исследователей от двойных по назначению возможностей. Компания направляет часть запросов повышенного риска через Cyber Verification Program.
OpenAI придерживается похожего принципа: объём доступных возможностей зависит от подтверждённой личности, организации, характера работы и дополнительных мер защиты учётной записи. При этом участие в Trusted Access for Cyber уменьшает число блокировок, но не отменяет все фильтры и правила использования.
Спор фактически идёт не о полном снятии ограничений, а о точности их применения. Исследователи предлагают расширить доступ для проверенных команд, чётче описать допустимые операции и реагировать на конкретные злоупотребления вместо запрета целых категорий технических запросов.
Цена ошибки будет расти по мере того, как ИИ научится быстрее находить уязвимости и строить цепочки атак. Чрезмерно свободная модель упростит работу преступников, а чрезмерно осторожная оставит защитников без инструментов, необходимых для проверки тех же угроз. Поэтому результат гонки может зависеть не только от мощности алгоритмов, но и от того, кому и на каких условиях разрешат применять их наиболее опасные возможности.