Cайт веб-разработчика, программиста Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

«Яндекс», Сбер и VK хотят учить ИИ на ваших данных без вашего разрешения — и объясняют, почему это безопасно

Российские технологические компании предложили изменить закон о персональных данных, чтобы получить больше возможностей для разработки и обучения искусственного интеллекта. Ассоциация больших данных направила третьего августа обращение в Минцифры с просьбой разрешить обработку персональной информации без согласия граждан при помощи специальных технологий защиты. С документом ознакомился «Коммерсантъ».

В Ассоциацию больших данных входят «Авито», «Сбер», «Ростелеком», «Яндекс», HeadHunter, VK и другие крупные компании. Участники объединения предлагают закрепить в законодательстве технологии повышения приватности, или Privacy Enhancing Technologies. Математические и программные методы позволяют обрабатывать, передавать и хранить информацию, снижая риск утечки, раскрытия персональных сведений и идентификации конкретного человека.

Ассоциация утверждает, что при корректном применении зрелые технологии повышения приватности полностью исключают возможность установить личность владельца данных. Однако действующее законодательство не выделяет PETs в самостоятельную категорию. Любое математическое или алгоритмическое преобразование персональной информации сейчас относится к методам обезличивания. В результате технологии, обеспечивающие полноценную защиту человека, юридически не отличаются от промежуточных способов обработки, которые могут сохранять риск идентификации.

Компании предлагают разрешить применение PETs без согласия граждан только при соблюдении нескольких условий. Риск раскрытия личности должен равняться нулю или не превышать малых долей процента. Данные можно будет использовать исключительно для разработки, обучения и применения искусственного интеллекта. Обработку должны проводить российские компании на территории России.

Ассоциация также предлагает ввести понятие доверенного посредника. Аккредитованная государственными органами организация будет эксплуатировать информационную систему для хранения обезличенных персональных данных и предоставления разработчикам искусственного интеллекта (ИИ) доступа к таким массивам. Кроме того, участники рынка предлагают разделить данные на бесплатные, необходимые для исполнения требований законодательства, и платные, предназначенные для коммерческого использования. Минцифры не ответило на запрос издания.

Представители отрасли связывают необходимость изменений с нехваткой качественной информации для обучения современных моделей. Российский рынок данных пока развит слабо, а большинство доступных наборов остаётся внутри крупных цифровых экосистем. Понятные правовые требования и гарантии защиты граждан могут расширить доступ разработчиков к информации и ускорить развитие российского рынка искусственного интеллекта.

До недавнего времени компании преимущественно использовали наборы из внутренних источников, дочерних организаций и партнёрских проектов. Доступных материалов уже недостаточно для дальнейшего развития моделей, поэтому корпорации ищут дополнительные источники. Особенно востребованы качественные отраслевые данные, необходимые для корпоративных систем и специализированных ИИ-продуктов.

Для практических задач разработчикам нужны не сведения, позволяющие определить конкретного человека, а крупные обезличенные массивы с полезными закономерностями. Ценность представляют данные о поведении пользователей, медицинская статистика и информация из отдельных отраслей экономики.

Часть потребности в материалах для обучения закрывают синтетические данные. Специальные методы позволяют создавать репрезентативные наборы, которые не содержат сведений о реальных гражданах и не нарушают право на защиту личной информации. Однако расширение законных возможностей для работы с надёжно защищёнными массивами может ускорить разработку прикладных систем искусственного интеллекта.

SecurityLab