ADG Оставить заявку
Блог Информационная безопасность 5 мин чтения

ИИ и приватность: три мифа, из-за которых бизнес принимает неверные решения

Удаление данных из обученной модели, фоновый анализ ИИ-ассистентов и ИИ-поисковики: три распространённых мифа и что за ними стоит на самом деле.

Контекст момента

Вокруг приватности ИИ накопилось много страхов, часть из которых мешает принимать взвешенные решения

За последний год к нам регулярно приходят с одними и теми же вопросами о языковых моделях и приватности. Вопросы звучат по-разному, но в основе лежат три устойчивых представления, которые мешают принять взвешенное решение: либо заставляют отказаться от полезного инструмента без реальных оснований, либо, наоборот, оставляют без внимания риски, которые действительно требуют работы.

Разберём каждый из них.

Миф 1. «Можно попросить удалить свои данные из уже обученной модели»

Звучит логично: если компания передавала данные провайдеру, значит, можно потребовать их удалить. Права субъекта персональных данных по 152-ФЗ распространяются на операторов, обрабатывающих эти данные. Почему бы не распространить их и на модель?

Проблема в том, что обученная языковая модель хранит не записи, а веса. Это числовые параметры, которые формируются в процессе обучения на большом корпусе текстов. Конкретная строка из вашей базы данных не лежит в весах модели в виде, который можно найти и удалить. Информация из обучающих данных растворяется в миллиардах параметров, влияя на поведение модели статистически, а не как отдельная запись.

Технически существуют методы, которые позволяют частично «разучить» модель, то есть скорректировать её поведение относительно определённых сведений. Но это дорогостоящий процесс переобучения, а не удаление строки из таблицы. На практике публичные провайдеры не предоставляют такой возможности отдельным корпоративным клиентам.

Что это значит для бизнеса. Вопрос об удалении данных из обученной модели перестаёт быть актуальным, если данные в обучение вообще не попадают. Корпоративный контур с маскированием персональных данных решает задачу на входе: запросы проходят через шлюз, чувствительная информация заменяется синтетическими значениями до отправки провайдеру, и в обучение уходит обезличенный текст, если уходит вообще. Организационно это надёжнее, чем пытаться что-то изъять после факта.

Подробнее о том, как устроен корпоративный шлюз с маскированием, мы разбирали в отдельном материале.

Миф 2. «ИИ-ассистенты в операционных системах и смартфонах читают всё в фоновом режиме»

Этот страх понятен: ассистенты встроены в систему, работают постоянно и выглядят так, будто «слышат» контекст. Версия о тотальной слежке кажется правдоподобной.

На практике картина устроена иначе. Встроенные ассистенты на большинстве платформ активируются по голосовой команде или явному жесту, а не слушают непрерывно. Фоновый сбор данных существует, но он ограничен конкретными сигналами: запросами пользователя, историей взаимодействия с ассистентом, контекстом приложений при явном разрешении. Это не значит, что сбора нет, но это не то же самое, что сплошная запись экрана и клавиатуры.

Однако для корпоративных устройств «не тотальная слежка» не равнозначна «никаких проблем». Даже избирательный сбор данных может включать содержание запросов к ассистенту, которые сотрудник делает с рабочего устройства. Если сотрудник использует встроенного ассистента для рабочих задач, часть этих данных может отправляться на серверы производителя операционной системы.

Что это значит для бизнеса. На корпоративных устройствах под управлением Windows или macOS встроенные ИИ-функции настраиваются через политики. В корпоративных редакциях Windows доступно централизованное отключение Copilot и связанных функций через групповые политики. В macOS аналогичные настройки присутствуют в профилях управления устройствами. На мобильных устройствах под управлением корпоративного решения по управлению устройствами (MDM) голосовые ассистенты и облачный анализ данных отключаются на уровне профиля.

Рабочий регламент здесь не лишний: сотрудники должны понимать, какие функции включены на их устройствах и к каким данным они имеют доступ. Это не параноя, а обычная гигиена, которая входит в стандартный периметр информационной безопасности.

Миф 3. «ИИ-поисковики собирают досье на компанию по каждому запросу»

Появление поисковых сервисов на основе языковых моделей породило отдельный класс опасений: компании боятся, что одного запроса достаточно, чтобы система сформировала подробное досье на организацию или её сотрудников.

Здесь важно понять, с чем именно работают такие сервисы. Языковая модель в поиске агрегирует и переформатирует публично доступную информацию: сайты, новости, публичные реестры, открытые документы. Если о компании есть данные в открытых источниках, эти данные модель может собрать и связно пересказать. Это, безусловно, удобный инструмент для конкурентной разведки, но не доступ к закрытым базам. Модель не знает больше, чем есть в открытом доступе.

Реальная уязвимость другая: сами запросы. Если сотрудник задаёт конкретные вопросы о внутренней ситуации компании, планах, персоналиях или структуре, эти запросы могут сохраняться у провайдера поисковика. Типовые риски для систем на основе языковых моделей включают сценарии, когда именно формулировка запроса становится источником утечки информации, а не ответ системы.

Что это значит для бизнеса. Контроль здесь работает не на уровне «запретить поиск», а на уровне регламентов. Сотрудникам стоит понимать: в запросе к любому внешнему сервису не должны появляться закрытые сведения, внутренние названия проектов, имена клиентов и другие данные, которые не предназначены для публичного пространства. Это правило одинаково применимо к обычному поисковику, к языковой модели и к любому другому внешнему инструменту.

Для чувствительных задач, где нужна уверенность, что запросы не покидают контур, ответ архитектурный: поиск и аналитика на закрытых корпусах, локальные модели, корпоративный шлюз с журналированием. Инструментальный уровень контроля надёжнее, чем только организационный.

Итог

Три мифа разные по природе, но объединяет их одно: каждый из них либо преувеличивает угрозу там, где её нет, либо уводит внимание от того, что реально требует контроля.

Данные нельзя «изъять» из весов обученной модели, но правильно выстроенный контур не отдаёт их в обучение. ИИ-ассистенты не читают всё подряд, но на корпоративных устройствах их поведение стоит явно настроить через политики. ИИ-поисковики не имеют доступа к закрытым базам, но запросы к ним нуждаются в тех же ограничениях, что и любой другой внешний сервис.

Большинство реальных рисков, связанных с языковыми моделями и приватностью, решается на уровне контура, политик и дисциплины работы с данными. Не отказом от инструментов, которые уже прочно вошли в рабочие процессы, а осознанным выбором архитектуры и правил, которые делают использование этих инструментов управляемым.

Контакт

Нужна такая же инженерная работа?

Опишите задачу и контекст. Ответим в течение рабочего дня, при необходимости подпишем NDA.