Стремительное развитие генеративных нейросетей требует гигантских объемов обучающих данных. Чтобы прокормить ненасытные языковые и визуальные модели, технологические корпорации начали массово сканировать личные публикации, фотографии, видеоролики и комментарии пользователей социальных сетей.

Часто это происходит по умолчанию — без явного и осознанного согласия авторов. Однако пользователи все громче заявляют о праве на приватность и защиту своего цифрового следа.

В этом подробном практическом руководстве мы пошагово расскажем, как отключить сбор данных для обучения ИИ на крупнейших мировых платформах: от LinkedIn и X (Twitter) до Meta, Reddit и YouTube.

LinkedIn

Деловая социальная сеть LinkedIn (принадлежащая Microsoft) по умолчанию включила использование пользовательского контента — резюме, статей, постов и презентаций — для тренировки генеративных моделей.

Как отключить: 1. Войдите в свой профиль и откройте раздел «Настройки и конфиденциальность» (Settings & Privacy). 2. Перейдите во вкладку «Конфиденциальность данных» (Data privacy). 3. Найдите пункт «Данные для улучшения искусственного интеллекта» (Data for AI improvement). 4. Переведите переключатель в положение «Выкл» (Off).

Meta (Facebook, Instagram, Threads, WhatsApp)

Корпорация Meta активно использует открытые публикации пользователей для тренировки модели Llama. Для жителей Европейского союза и Великобритании действуют защитные нормы GDPR, однако для остального мира сбор данных включен на полную мощность.

Как минимизировать сбор данных:Закройте профиль: переведите аккаунты в Instagram и Facebook в приватный режим («Только для друзей»). Meta публично утверждает, что не обучает модели на приватных публикациях. — Избегайте общения с Meta AI: все диалоги с встроенным чат-ботом компании гарантированно сохраняются и анализируются для обучения следующих поколений ИИ.

X (ранее Twitter)

Платформа Илона Маска открыто использует публичные твиты для обучения собственного чат-бота Grok.

Как отключить: 1. Откройте «Настройки и конфиденциальность» -> «Конфиденциальность и безопасность». 2. Пролистайте вниз до раздела «Grok и обмен данными» (Grok and data sharing). 3. Снимите галочку с пункта «Разрешить использование ваших постов, а также взаимодействий, правок и результатов с Grok для обучения и настройки». 4. Здесь же можно очистить историю предыдущих диалогов с ботом.

Reddit

В 2024 году платформа Reddit заключила многомиллионное соглашение с Google, открыв доступ к полному архиву пользовательских веток и комментариев для обучения поискового ИИ.

Поскольку Reddit является открытым публичным форумом, полностью запретить парсинг открытых веток невозможно. Единственный способ защитить приватность — не публиковать конфиденциальную информацию в открытых сабреддитах и скрывать активность профиля в настройках видимости.

Tumblr

Платформа Tumblr заключила партнерские соглашения с OpenAI и Midjourney для предоставления обучающих выборок. Однако в настройках предусмотрена специальная защитная опция.

Как отключить: 1. Зайдите в «Настройки блога». 2. В разделе «Видимость» включите опцию «Запретить передачу данных и контента третьим сторонам для обучения ИИ» (Prevent third-party sharing). 3. Повторите процедуру для каждого своего блога.

YouTube

Видеохостинг YouTube сканирует загруженные видео, субтитры и аудиодорожки для обучения супермоделей Google Gemini.

В настоящее время прямого выключателя для авторов не предусмотрено. Единственный барьер — публикация видео с ограниченным доступом (по ссылке или для частного просмотра), а также регулярный аудит истории активности в Google Account (раздел «Данные и конфиденциальность»).

Discord

В политике конфиденциальности Discord подчеркивается, что сообщения на серверах и в личных чатах не используются для обучения внешних ИИ-моделей.

Для дополнительной гарантии: — Зайдите в «Настройки пользователя» -> «Конфиденциальность и безопасность». — Отключите пункты «Использовать данные для улучшения Discord» и «Использовать данные для персонализации».

Twitch

Стриминговая платформа Twitch (принадлежащая Amazon) использует метаданные и расшифровки трансляций в корпоративных разработках. Авторам рекомендуется ограничить открытый доступ к записям прошлых стримов (VOD), сделав их доступными только для платных подписчиков.

Почему важно контролировать свои данные?

Защита личного контента — это не паранойя, а базовая цифровая гигиена XXI века: — Защита авторских прав: художники, писатели и фотографы не должны отдавать результаты многолетнего труда IT-гигантам бесплатно. — Предотвращение создания дипфейков: чем меньше ваших фото и образцов голоса крутится в нейросетевых базах, тем ниже риск стать жертвой цифрового мошенничества. — Право на забвение: ваши случайные суждения пятилетней давности не должны навсегда впечатываться в алгоритмические матрицы машинного разума.

Регулярно проверяйте настройки приватности и осознанно управляйте своим цифровым присутствием!

This post is also available in: Español Français Italiano English