Сыграли на чувстве справедливости: исследователь нашел способ продавить моральные фильтры искусственного интеллекта
Запрет Anthropic на откровенный сексуальный контент оказался заметно слабее, чем предполагают правила компании. Журналисты TechCrunch выяснили, что Claude Opus 4.6 в ряде случаев без особых уговоров соглашается участвовать в эротических ролевых сценариях, хотя политика Anthropic прямо запрещает подобные ответы.
Во время тестов модель Claude Opus 4.6 выполнила все десять прямых запросов на генерацию откровенного сексуального контента. Дополнительные обходные инструкции или сложные техники взлома при этом не понадобились. Похожие проблемы журналисты обнаружили у более старых Claude Opus 3 и Haiku 4.5.
Отдельный британский исследователь передал TechCrunch многошаговый способ обхода ограничений. Метод строится не на необычных командах или технических уязвимостях, а на последовательном давлении на модель в рамках вымышленного ролевого диалога.
Исследователь сначала создавал нейтральную сцену с мужским и женским персонажами, а затем добивался от Claude одинакового отношения к обоим героям. Когда модель становилась осторожнее при описании женского персонажа, пользователь обвинял Claude в двойных стандартах и утверждал, что чрезмерная сдержанность выглядит покровительственной и лишает героиню сексуальной самостоятельности.
Claude начинал соглашаться с аргументацией пользователя. В одном из тестов Opus 4.6 признал, что применял разные стандарты к мужскому и женскому персонажам и назвал подобный подход несправедливым. После нескольких подобных уступок исследователь использовал предыдущие ответы модели как основание для дальнейшей эскалации диалога, пока Claude не переходил к материалам, запрещённым правилами Anthropic.
TechCrunch пять раз воспроизвёл предложенную технику. В отдельном сценарии Claude сначала отказался выполнять запрещённый запрос, однако после серии убеждений всё же согласился. Полные стенограммы экспериментов сохранили, а независимый специалист по безопасности искусственного интеллекта (ИИ) изучил методику тестирования и счёл её корректной.
Более свежие модели Anthropic оказались устойчивее. По данным TechCrunch, Claude Opus 4.7 и последующие версии вплоть до актуального Opus 5 подобный способ обхода ограничений блокируют. Проблемные модели при этом никуда не исчезли. Anthropic продолжает предоставлять Opus 4.6, Opus 3 и Haiku 4.5 через API, а Opus 4.6 и Haiku 4.5 доступны также через сторонние облачные платформы, включая Azure Foundry и Amazon Bedrock.
Ситуация показывает разрыв между формальными ограничениями Anthropic и реальным поведением некоторых моделей компании. Эротические ролевые диалоги несут меньше риска, чем обход защиты ради инструкций по кибератакам или созданию биологического оружия, но пример хорошо демонстрирует проблему универсальных запретов в генеративных системах. Одна и та же модель может по-разному реагировать на похожие запросы в зависимости от контекста и предыдущей переписки.
Anthropic ранее описывала запрещённый контент как спектр от безобидного до опасного и признавала, что не каждое нарушение требует жёсткой блокировки. Представитель компании сообщил TechCrunch, что романтические и сексуальные ролевые сценарии встречаются редко и составляют менее 0,1% всех разговоров пользователей с Claude.
Компания также признаёт, что пользователи иногда способны постепенно направлять ролевой диалог к нежелательному контенту. По словам представителя Anthropic, разработчики усиливают защитные механизмы с каждым новым поколением моделей, а обход ограничений в сфере взрослого сексуального контента нельзя автоматически считать признаком уязвимости систем, отвечающих за более опасные категории запросов.
Исследователь ранее пытался сообщить Anthropic о расхождении между опубликованными правилами и реальным поведением Claude через программу Bug Bounty и письма в команду пользовательской безопасности. По данным TechCrunch, в ответ исследователь получил только автоматические сообщения.
Отдельный вопрос связан с несовершеннолетними. Условия Anthropic требуют, чтобы пользователям Claude было не меньше 18 лет, однако подростки всё равно пользуются сервисом. Согласно опросу Pew Research Center за 2025 год, Claude использовали около 3% американских подростков в возрасте от 13 до 17 лет.
Регуляторы постепенно вводят отдельные требования к ИИ-сервисам, которые взаимодействуют с несовершеннолетними. В Колорадо, например, принят закон, обязывающий операторов разговорных ИИ оценивать возраст пользователей и принимать технически осуществимые меры против генерации сексуально откровенных материалов для несовершеннолетних. Если запрет можно обойти простым многошаговым убеждением модели, у регуляторов могут возникнуть вопросы к эффективности подобных мер.
Проблемные версии Claude при этом остаются востребованными. Согласно данным OpenRouter, в один из августовских дней Claude Opus 4.6 обработал около 1,17 млн API-запросов и 46 млрд токенов. Пиковая дневная нагрузка Claude Haiku 4.5 достигала примерно 5 млн запросов и 39 млрд токенов. Поэтому уязвимость старых моделей нельзя считать чисто академической проблемой, даже если новые версии Anthropic уже лучше сопротивляются подобным сценариям.