ADG Оставить заявку
Блог Регуляторика 7 мин чтения

Законно ли ИИ-компании собирают данные из открытых источников, и что это значит бизнесу

Массовый сбор открытых данных для обучения моделей: как на это смотрят 152-ФЗ и GDPR и почему это касается данных ваших клиентов.

Контекст момента

Пользователи и компании всё чаще возмущаются, что их открытые публикации уходят в обучение коммерческих моделей

Где-то в начале этого года один из наших клиентов обнаружил, что его публичные статьи с описанием инфраструктурных решений попали в обучающий корпус коммерческой языковой модели. Юридически формально ничего не нарушено: материалы были открыты, лицензия допускала воспроизведение. Только вот среди этих статей встречались описания конфигураций, в которых косвенно фигурировали данные клиентов. И никакого согласия на это, разумеется, никто не давал.

Именно такой сценарий сейчас становится распространённым поводом для разговора о законности массового автоматического сбора данных для обучения моделей. Мы попробуем разобрать, как на это смотрит регулирование, почему «открыто» не равно «можно использовать как угодно» и что из этого следует для вашего бизнеса. Это не юридическая консультация, а ориентир: финальные решения стоит принимать вместе с юристом.

Массовый автоматический сбор данных: что это такое

Языковые модели обучаются на огромных корпусах текстов. Эти тексты собирают автоматически из публично доступных источников: веб-страницы, форумы, репозитории кода, новостные сайты, открытые базы знаний. Процесс выглядит похоже на работу поисковых роботов, только цель другая: не индексирование для поиска, а формирование обучающего набора данных.

Техническая доступность ресурса роботу-краулеру не означает правовой разрешённости сбора. Это различие принципиально, и именно здесь возникают регуляторные вопросы.

Как на это смотрит российское регулирование

152-ФЗ «О персональных данных» регулирует обработку персональных данных в России. Под его действие подпадают сведения, которые прямо или косвенно относятся к конкретному физическому лицу.

Принципиальный момент: открытость данных сама по себе не снимает требований о согласии на обработку. Человек, разместивший информацию о себе в открытом профиле или публикации, соглашается с условиями конкретной площадки, но не даёт автоматического разрешения на сбор этих данных в произвольных целях третьими сторонами.

Когда компания собирает такие данные для формирования обучающего набора, с точки зрения закона речь идёт об обработке персональных данных. Правомерность такой обработки зависит от наличия законного основания: согласия субъекта, договора или иного основания, предусмотренного законом. «Данные были открыты» как самостоятельное основание в законе не фигурирует.

Как именно это применяется к обучению моделей на практике, регуляторная практика пока только формирует. Прецеденты появляются, но устоявшихся позиций пока нет. Именно поэтому вопрос стоит держать в поле зрения.

Как на это смотрит европейское регулирование

GDPR ставит те же вопросы, но в европейском контексте. Принципы обработки персональных данных по этому регламенту включают ограничение цели: данные должны собираться для конкретных, явно указанных и законных целей. Использование данных, собранных в одних целях, для обучения моделей в совершенно других целях создаёт вопрос о соответствии этому принципу.

Ряд надзорных органов в Европе уже выпустили разъяснения и в отдельных случаях предписания, касающиеся использования публичных данных для обучения. Позиции не единообразны, практика продолжает складываться. Но общий вектор: «общедоступно» не значит «можно использовать для любых целей без ограничений».

Для компаний, работающих с данными европейских пользователей или клиентов, это означает, что вопрос о правомерности обработки при использовании внешних моделей стоит не в абстрактной плоскости, а вполне конкретно.

«Открыто» не значит «можно как угодно»

Это различие стоит зафиксировать отдельно, потому что оно неочевидно на интуитивном уровне.

Когда человек публикует что-то в открытом доступе, он обычно подразумевает определённый контекст использования: чтение другими людьми, цитирование в материалах по теме, индексирование поисковиком для нахождения. Массовый автоматический сбор с последующим использованием для обучения коммерческой модели выходит за рамки этого разумного ожидания.

Юридически это выражается в том, что открытость публикации не создаёт автоматического разрешения на обработку в любых целях. Требования к наличию правового основания обработки, заложенные в 152-ФЗ и GDPR, применяются независимо от того, закрыты данные или открыты.

Для бизнеса из этого следуют два практических вопроса.

Что это значит, если вы публикуете данные клиентов

Первый вопрос касается ваших собственных публикаций.

Компании публикуют кейсы, отзывы, примеры работ. В этих материалах нередко встречаются, прямо или косвенно, сведения о клиентах: название компании, отрасль, характер задачи, контактные лица. Даже если публикация открыта, оператором персональных данных остаётесь вы, и именно вы отвечаете за то, в каких целях эти данные могут быть использованы.

Если внешняя модель собрала ваши публикации и включила их в обучающий набор данных, данные ваших клиентов теперь присутствуют в этом наборе. Никто из сторон не спрашивал согласия у ваших клиентов на такое использование. Вопрос о том, чья это ответственность и насколько это правомерно, пока решается в каждом случае отдельно.

Практический вывод: при подготовке открытых публикаций стоит явно разграничивать, какие сведения о клиентах в них фигурируют и на каком основании. Согласие клиента на публикацию кейса ещё не включает согласие на попадание этих данных в обучающий корпус третьей стороны.

Что это значит, если вы используете внешние модели

Второй вопрос касается обратной стороны: когда вы сами пользуетесь внешними языковыми моделями.

Публичные провайдеры моделей применяют разные политики в отношении обработки запросов. Некоторые из них оставляют за собой право использовать данные запросов для дообучения или улучшения моделей. Условия политик меняются, и то, что было прописано при подключении полгода назад, может отличаться от текущей версии.

Когда сотрудники отправляют в такую модель данные клиентов, внутренние документы или чувствительную бизнес-информацию, эти данные потенциально попадают в инфраструктуру провайдера. Регуляторно оператором персональных данных по-прежнему остаётесь вы. Передача данных третьей стороне создаёт отдельные требования к правовому основанию и информированию субъектов.

Это не гипотетический риск: мы разбирали типичные сценарии утечки через внешние сервисы, а изменения 152-ФЗ в 2026 году сделали вопрос контроля над передачей данных ещё более актуальным.

Честный разговор о неопределённости

Было бы нечестно представлять ситуацию как полностью прояснённую. Это не так.

Регулирование в части искусственного интеллекта и обработки данных для обучения моделей находится в активной стадии формирования. Ни в России, ни в большинстве других юрисдикций нет готовых норм, которые бы прямо и исчерпывающе отвечали на вопрос о законности конкретных практик сбора данных для обучения. Общие принципы защиты персональных данных применяются, но их применение к конкретным случаям ещё вырабатывается через решения надзорных органов и судебную практику.

Это означает, что решения здесь нужно принимать в условиях неопределённости, с пониманием рисков и с привлечением юриста, который следит за актуальной практикой. Мы можем помочь с технической стороной вопроса, но правовые позиции должны формироваться специалистами в праве.

Что можно сказать с уверенностью: ждать полной ясности регулирования, чтобы начать думать об управлении рисками, не лучшая стратегия. Практика складывается, и компании, которые уже выстроили контроль над передачей данных, оказываются в лучшей позиции.

Итог

Открытость данных не отменяет требований к правомерности их обработки. Массовый автоматический сбор для обучения моделей поднимает вопросы, которые 152-ФЗ и GDPR ставят в повестку, даже если прямых ответов в этих законах пока нет. Для бизнеса это означает два встречных направления: контроль над тем, что публикуется и с какими оговорками, и контроль над тем, что отправляется во внешние модели.

Выстроить второе направление технически можно уже сейчас: корпоративный шлюз с маскированием персональных данных и журналированием запросов позволяет работать с внешними моделями, не завися от политик сбора конкретного провайдера. Ваши данные остаются в вашем контуре независимо от того, что прописано в условиях использования модели на другом конце.

Подробнее о том, как это устроено на практике, на странице корпоративного шлюза для языковых моделей.

Контакт

Нужна такая же инженерная работа?

Опишите задачу и контекст. Ответим в течение рабочего дня, при необходимости подпишем NDA.