Брат живет в Нижнем Новгороде, прислал видео про свалку.
Если коротко, несколько разных компаний либо сами вывезли мусор на дорогу, где его и бросили, либо заключили договор с мусорщиками, которые это сделали.
В итоге на улице прямо на обочинах валяется куча мусора, а также персональные данные людей.
Теперь ждем, пока начнется раздача люлей этим организациям или мусорщикам, тут уж кому больше повезет. Хотя легким испугом может и не обойтись, так как за нарушение закона о персональных данных может прилететь ой как больно и не водителю мусоровоза, а директору организации.
Я десять лет в digital, последние годы — руководитель направления цифрового маркетинга и руководитель проектов с ИИ в одной крупной производственной компании.
Однажды мне прилетела огромная выгрузка по речевой аналитике: сотни тысяч строк расшифровок звонков и переписок. И где-то, возможно, внутри этой кучи текста — паспорта, ИНН, СНИЛС клиентов и сотрудников. А может, и нет. Проверить вручную нереально.
Я прогнал это регулярными выражениями в Excel. Вы знаете эти регулярки: ищешь слово «паспорт», а люди пишут «пасспорт», «пас-порт», диктуют цифры по одной, коверкают как могут. На второй тысяче вариаций регулярки сдаются.
И тут до меня дошло: программы, которая просто берёт текст и отвечает «вот здесь чувствительные данные», — нет. DLP-системы за десятки миллионов есть, но они как правило просто блокируют. А маленькой быстрой штуки, чтобы проверить документ перед отправкой в нейросеть или облако, — нет.
Я люблю решать задачи, поэтому решил сделать её сам.
Почему это важно именно сейчас
Два факта, из-за которых я вообще взялся за это.
Первый — ИИ пришёл в рабочие процессы. По исследованиям «Контур.Толк» и Т-Банка, каждый второй сотрудник уже использует нейросети в рабочей переписке. Люди копируют в чат-боты договоры, резюме, базы клиентов, переписки — и редко задумываются, что там внутри.
Второй — штрафы. С 30 мая 2025 года в России действуют новые штрафы за утечку персональных данных: утечка до 1 000 человек — 150–300 тысяч рублей, от 1 до 10 тысяч — 3–5 млн, от 10 до 100 тысяч — 5–10 млн, больше 100 тысяч — 10–15 млн. А за повторную утечку — оборотный штраф 1–3% годовой выручки. И киберстраховка эти штрафы, как правило, не покрывает.
То есть компаниям нужен простой способ не слить данные в нейросеть.
Что умеет сервис, если объяснять бабушке
Mask Gate — это маскировщик персональных данных. Он находит в тексте и вложениях чувствительные данные — паспорта, ИНН, СНИЛС, карты, телефоны, медданные, коммерческую информацию — и применяет к ним одну из трёх стратегий:
· block — запретить передачу (для секретов и медданных — жёстко).
· redact — необратимо удалить, заменив на [REMOVED:категория].
· flag — просто пометить, не трогая текст.
Плюс есть обратимая маскировка: значение уезжает в зашифрованное хранилище (vault), а в тексте остаётся токен [VAULT:…], который можно раскрыть обратно по ключу в рамках визита на сайт.
Что именно он находит
Вот категории, которые уже работают — это не «мы планируем», а реальные детекторы в конфиге:
Группа
Категории
Секреты и ключи
API-ключ, приватный ключ, SSH-ключ
Медицина
медицинские данные
Карты и платёжное
номер карты, CVV, срок действия, счёт
Документы РФ
паспорт, ИНН, СНИЛС
Контакты
телефон, email, адрес
Личное
дата рождения
Прочее
госномер авто, учётные данные, код
Метки
ОГРН, ОГРНИП, БИК, КПП, IP-адрес, суммы
Сущности (NER)
ФИО, организация, локация
Плюс можно задать свои фразы-маркеры (например, название секретного проекта) и собственные regex-правила — они «всегда ловить». И список исключений, чтобы не срабатывать на заведомо безопасных значениях.
Где это работает
Mask Gate — это не только веб-страница:
· Веб-интерфейс — вставить текст или загрузить файл.
· API — /analyze, /process, /process-file, /proxy/chat для встраивания в свои системы.
· Office add-in — маскирование прямо в Excel и Word, с восстановлением обратно.
· Файлы и OCR — txt, csv, docx, xlsx, pdf, плюс распознавание сканов и изображений.
Как это устроено технически
Стек: Python 3.11, FastAPI, SQLite, фронт на нативном JS без сборщика, Docker + Nginx. Ядро работает без сети — весь анализ локальный на компьютере пользователя и обработка на сервере, но без сохранения.
· Нормализация. Текст чистят от обфускации: гомоглифы («а» на латинице вместо кириллицы), zero-width символы, разбивка разделителями. Закодированные куски — base64, percent, hex, HTML-entity — декодируются и пересканируются.
· Распознаватели. Регулярные выражения для структурированных форматов (ИНН, СНИЛС, карты), сканер секретов (API/SSH/приватные ключи), ключевые слова и пользовательские маркеры.
· Валидаторы. Найденное проверяется контрольными суммами — ИНН, СНИЛС, номер карты по Луну. Регулярка может соврать, контрольная сумма — почти нет.
· NER. Для имён, организаций и адресов — модель natasha. Модели запечены в wheel, при запуске ничего не скачивается.
· Повторный скан. Отдельно ловятся значения, написанные словами, и разбитые на несколько сообщений.
Про скорость: одиночное значение (карта, ИНН, паспорт) ядро разбирает за доли миллисекунды (~0,1 мс); типовое сообщение на ~1 000 знаков — за ~5 мс. Это мои же eval-замеры, а не рекламные цифры.
Можно работать с документами и сканами
Главный принцип — fail-closed: любой сбой внутри анализа — это блок, а не молчаливый пропуск. На весь проход есть жёсткий бюджет, превысил — блок. Проще перестраховаться, чем пропустить утечку.
Самый простой обход, который ломает обычный регексп
Обычный регексп ищет «паспорт 4509 123456» и сдаётся, когда человек пишет цифры через пробел:
паспорт 4 5 0 9 1 2 3 4 5 6 либо цифры словами, как в речевой аналитике.
Или когда номер карты разбит на несколько сообщений в чате. Mask Gate собирает такие куски обратно и ловит значение целиком — на нормализации это решается до того, как в дело вступают регулярки.
Chokepoint: фильтр на трубе
Кроме проверки «вручную», сервис встраивается в пайплайн как серверный chokepoint: стоит между вами и внешним LLM-API и проверяет данные в обе стороны — и то, что уходит в нейросеть, и то, что от неё возвращается. Поддерживается BYOK: подключаете собственный ключ LLM — нам не нужно видеть ваши запросы.
Это и есть ответ на вопрос «как не слить паспорт в ChatGPT»: не надеяться на внимательность сотрудника, а поставить фильтр на трубу.
Конкуренты и почему это не DLP
Не буду говорить, что конкурентов нет — они есть. Есть открытая библиотека Presidio от Microsoft, но это инструмент для разработчиков, а не готовый сервис, и без русской специфики 152-ФЗ. Есть западные облачные сервисы маскирования, но туда надо отправлять данные за рубеж — а это само по себе риск по статье о трансграничной передаче. И есть полноценные DLP — Solar Dozor, InfoWatch и другие — но это проект внедрения на месяцы с бюджетом от нескольких миллионов рублей.
Mask Gate — не DLP. Это лёгкий маскировщик ПД, который закрывает одну конкретную задачу: не дать чувствительным данным утечь в нейросеть или облако. Дёшево, быстро, без проекта внедрения.
Где я накосячил
Самая большая ошибка: два месяца я полировал интерфейсы вместо того, чтобы сделать первую версию и проверить гипотезу. Два месяца без единой обратной связи от реального пользователя. Классическая грабля инженера — хочется сделать красиво, а надо было делать быстро.
Второй граблей стали сами нейросети. Начал на Claude — он постоянно тупил: обрывы связи, функционал не работал, сделал одну задачу и упёрся в лимит. Перешёл на Kimi — подход к идеям и рассуждениям понравился больше. А потом случилось главное ускорение: на DeepSeek 4 Pro я стал делать в десять раз быстрее, а с DeepSeek Harness — ещё примерно в пять раз.
Отдельная история — как нейросети начали ругаться друг с другом. Я вёл несколько задач в разных IDE, и в какой-то момент одна модель обвинила в ошибке другую, а та переложила ответственность обратно. Я сидел и читал переписку двух LLM, которые скидывали вину друг на друга. Такого в «успешных кейсах» не рассказывают.
Желание бросить тоже было — когда интерфейс сыпался, а Claude после долгого анализа выдавал неработающий код. Спасло две вещи. Первая — интерес к самой задаче. Вторая — я вынес правила работы с нейросетями в отдельный документ: независимая проверка результата, чёткая пометка задачи «в работе», общие принципы, заложенные в инструкции. Когда модели перестали переписывать логику друг у друга, код наконец перестал ломаться.
Почему с данными всё чисто
Про 152-ФЗ — коротко о том, что зашито в архитектуру (детали — на странице безопасности maskgate.ru/security):
· Минимизация. Текст обрабатывается в памяти и не пишется на диск в открытом виде — в аудит и на диск попадают только HMAC-токены, а маскированные значения лежат в vault под AES-256-GCM.
· Локализация (ст. 18). Аудит-лог и временные файлы — в инфраструктуре РФ.
· Трансграничная передача (ст. 12). Chokepoint не даёт ПДн утечь во внешний LLM.
· Self-hosted. При желании сервис разворачивается целиком у вас в контуре (Docker).
· Анти-фишинг. Проверка домена и Origin — даже клон сайта не соберёт ваши данные.
Финал
Сервис на стадии MVP, и я показываю цифры открыто: на eval-корпусе recall ~95%, precision ~92%. Простым языком: из 100 настоящих паспортов и ИНН сервис ловит 95, а из 100 срабатываний 92 — по делу, остальные 8 — ложная тревога. Это не «100% защита» — такой не бывает. Mask Gate — не DLP: он не защитит от мотивированного инсайдера, стеганографии или семантического перефраза, когда паспорт пересказан своими словами, но в будущем я это доработаю. Это инструмент снижения риска для типовых утечек, и я знаю, где он заканчивается.
Дальше — реальные пользователи и реальные сценарии. Я не хочу, чтобы это осталось проектом в стол, поэтому открыто ищу первых пользователей, которые помогут отловить edge-кейсы, которые я не предусмотрел.
Поэтому просьба к вам: попробуйте сломать сервис. Пришлите три текста, на которых, как вам кажется, он ошибётся — пропустит чувствительные данные или, наоборот, сработает зря. Первая проверка бесплатна, без регистрации. Нашли ошибку — в интерфейсе есть приватная форма «Сообщить об ошибке».
А тем, кто прямо сейчас копирует паспорт в ChatGPT-бот, скажу одно: утечки персональных данных по 152-ФЗ наказуемы — до 15 млн рублей, а за повторную утечку до 3% оборота. Отправляя свои данные, вы подставляете себя и своё будущее. Отправляя данные коллег или компании — ещё и компанию.
Вы наверняка видели это в ботах: аккуратная синяя кнопка «Поделиться контактом», встроенная прямо в интерфейс Telegram. Не поле для ручного ввода, не ссылка на сторонний сайт — родная кнопка мессенджера. Раз системная, значит безопасная, да?
Вот это «да» я и решил проверить. Полез в документацию Bot API, посмотрел, что уходит по ту сторону. Ответ оказался не таким уютным.
Что вообще делает эта кнопка
Технически всё честно и прозрачно. Кнопка называется `request_contact`, и по документации Telegram она делает ровно одно: когда вы её нажимаете, ваш номер телефона отправляется боту как контакт.
И это важный плюс, признаю сразу. Номер не уходит фоном, втихую. Вы видите кнопку, вы сами её жмёте, момент передачи под вашим контролем. В этом смысле кнопка честнее, чем мутная форма на левом сайте.
Что реально уходит по ту сторону
Многие думают, что бот получает только цифры номера. На деле в пакете, который уходит боту, лежит больше.
По документации, вместе с номером боту передаётся набор полей: сам телефон, ваш Telegram user_id, имя и фамилия из профиля. То есть номер сразу привязан к вашему аккаунту — не абстрактные цифры, а «вот этот человек с таким именем и таким ID имеет такой номер».
Это и есть тихая деанонимизация. Если раньше вы сидели под ником, а номер прятали в настройках приватности — одно нажатие связывает ваш публичный ник с реальным номером.
Всё, что происходит с номером после, Telegram уже не контролирует. Данные попали на сервер того, кто этого бота написал.
И тут никаких гарантий нет вообще. Честный разработчик обработает запрос и не будет ничего хранить. Нечестный — сложит ваш номер, ID и имя в базу, а потом продаст рекламщикам, добавит в спам-рассылку или сопоставит с данными из других сливов. Вы не знаете, какой из двух перед вами. Кнопка выглядит одинаково в обоих случаях.
Проще говоря: системная кнопка гарантирует, что данные аккуратно доставлены. Она ничего не гарантирует про то, что с ними сделают на том конце.
Что с этим делать
Не отказываться от ботов вовсе — некоторым номер правда нужен по делу, тому же боту доставки для связи с курьером. А включить голову перед нажатием.
Спросите себя: этому боту номер нужен по функции? Боту-курьеру — логично. Боту-развлекалочке с гаданием или «проверь, кто тебя удалил» — с чего бы? Если связи между задачей и телефоном нет, это сбор данных, а не необходимость.
Посмотрите, кто автор. Официальный бот знакомой компании и поделка от безымянного разработчика — разный уровень доверия. Репутацию, увы, подделывают, но её полное отсутствие уже сигнал.
Заведите отдельный номер для регистраций и ботов. Виртуальный или вторая сим-карта. Тогда даже утечка не тянет за собой ваш основной номер, к которому привязаны банки и госуслуги.
И держите в голове главное правило: нажатие необратимо. Отправленный номер нельзя «отозвать» — он уже на чужом сервере. Решать нужно до клика, а не после.
Столкнулась с тем, что после того, как оставила отрицательный отзыв одной конторе по поводу качества их услуг, они зашли в мой профиль и по отзывам на Яндекс картах изучили, где я бываю, какие услуги я заказываю, узнали обо мне сведения личного характера, в том числе медицинские. На основании этого запостили свои далекоидущие выводы, с "глубокой" аргументацией человека, не занимающегося умственным трудом. Почему профиль в соц сети можно закрыть от посторонних глаз, а профиль на Яндексе - нет? Вообще-то профиль на Яндексе - находка для детектива больше, чем профиль в какой-либо соц сети, т.к. там не только фоточки из отпуска, а в принципе ретроспектива вашей жизни, отсюда невозможность его закрыть крайне нелогична и даже вредна в рамках усиления защиты персональных данных. Гласное у нас в стране только судопроизводство!
Вы бы лучше добавили опцию "Связаться с пользователем". Т.к. у меня лично было такое, что меня кинула на деньги одна контора. Почитав их отзывы, я нашла еще одного такого же. И было бы очень полезно с ним связаться для коллективного иска, к примеру. Но нет же: у вас опция только подписаться на пользователя. Зачем? Вот зачем психически здоровому человеку подписываться на чьи-то отзывы, ну, если он не детектив, конечно?
Недавно в колокольчик упало уведомление о перс. данных.
Я ознакомился и понял, что от меня слишком много персональных данных требуется.
Вот столько инфы собирается. А список третьих лиц огромен. С ним вы можете ознакомиться в правилах площадки.
Далее я инициировал обращение в службу поддержки. Мне стало интересно как отозвать разрешение на обработку персональных данных и что за этим последует.
Получил слегка манипулятивный ответ, который меня не устроил. Обработка сайтом номера телефона и ника (равно как и почты) я могу понять. Это действительно необходимо для взаимодействия с сайтом. А как быть с айпишником и ОС?
Дальнейшее общение привело нас (меня и агента поддержки) к пониманию, что есть персональные данные, которые необходимы для взаимодействия с акком. А есть все остальные, которые нужны только для рекламы и сбора статистики. Но самое важное, что они, вполне себе отделимы. И отозвать можно согласие на обработку персональных данных, которые для ыункционтрования акка не нужны. Итогом стало вот это сообщение. Общением доволен, результатом тоже. 5*
К концу августа в даркнете появился новый сервис по краже личных данных Nexus, продающий сканы более чем 153 млн водительских удостоверений граждан США и Канады, пишет на своём сайте журналист‑расследователь Брайан Кребс. Он предположил, что сервис использует изображения, собранные компанией из штата Луизиана, которая занимается проверкой личности. Отделение Федерального бюро расследований в Новом Орлеане начало расследование источника этих изображений.
По данным источника Кребса, сервис рекламирует новый пользователь на российском киберпреступном форуме Exploit. Nexus предлагает доступ к цифровым сканам удостоверений личности более чем 170 млн человек в Северной Америке. Ранее владелец сервиса предложил на Exploit водительские права источника Кребса в качестве бесплатного образца.
Nexus утверждает, что располагает более чем 153 млн водительских удостоверений граждан США и Канады, а также около 10 млн удостоверений личности, 3 млн загранпаспортов и минимум 579 тыс. медицинских карт. Поиск только канадских документов выдаёт примерно 1,1 млн результатов, причём наибольшая часть приходится на Онтарио. Помимо водительских прав, среди документов фигурируют и карты для покупки марихуаны в специализированных магазинах
Создатели Nexus утверждают, что изображения водительских удостоверений получены в результате взлома крупной платформы по проверке личности, среди клиентов которой есть множество компаний из списка Fortune 500. Злоумышленники пополняют свою базу данных уже более года. С 31 августа по 1 сентября количество записей о водительских удостоверениях в Nexus увеличилось почти на 400 тыс., что указывает на активное расширение базы.
Сканы водительских удостоверений Кребса и его матери загрузили в базу Nexus в тот день, когда они брали напрокат автомобиль в сервисе Hertz, передав документы для сканирования. Исследователь в области безопасности и конфиденциальности Зак Эдвардс также обнаружил свои водительские права в архиве Nexus после сканирования документа в супермаркете по продаже каннабиса Planet 13.
В 2022 году компания‑разработчик технологий проверки личности и сбора информации IDScan объявила об эксклюзивном соглашении на обслуживание магазинов Planet 13 по всей территории США. IDScan указывает, что обрабатывает запросы на проверку личности для более чем 1 тыс. магазинов по продаже марихуаны в 19 штатах. На сайте IDScan указано, что компания предоставляет услуги по проверке личности многочисленным брендам, включая Hertz, Target, Fedex, Motorola Solutions и Caesars Entertainment. Технология компании сканирует удостоверения личности как инфракрасным, так и ультрафиолетовым светом. По данным IDScan, её системы и технологии выполняют свыше 21 млн проверок в более чем 20 тыс. точек по всему миру. IDScan базируется в Новом Орлеане, штат Луизиана.
После запроса Кребса IDScan сообщила о проведении расследования, но не дала содержательного ответа на конкретные запросы, направленные журналистом по электронной почте. Затем Кребса подключили к телефонному разговору с шестью агентами ФБР, во время которого исследователя известили о начале расследования в Новом Орлеане.
Ведущий исследователь Cybera Ларри Болдуин заявил, что сканы лицевой и оборотной стороны его водительских удостоверений на Nexus содержат временные метки, соответствующие дате аренды автомобиля в Hertz. Он отметил, что Nexus создаёт множество угроз безопасности и конфиденциальности, поскольку выданные государством водительские удостоверения часто используются в качестве подтверждения личности при открытии новых кредитных линий. Более того, от распространения личных данных могут пострадать те, кто спасается от домашнего насилия и проходит по программе защиты свидетелей.
А у нас в новостном поле по поводу утечек персданных тиш да гладь, видимо все хорошо...
То, что я написала «избавиться», — не опечатка, а на самом деле так, потому что никак не могу удалить свой аккаунт на сайте PublishDrive.
Зарегистрироваться на сайте PublishDrive — легко. А вот когда вы решите уйти, ситуация может оказаться совсем другой.
Я приняла решение и направила соответствующий запрос на удаление своего аккаунта.
В ответ получила автоматический ответ, что необходимо иметь план. Но этот план мне не нужен, и я не хочу себя привязывать этим планом. Тем более что он платный, и предоставлять свои данные я не хочу, потому что мне нужно просто уйти с этого сайта.
Отправляла письма в их службу поддержки, а также направляла запросы через сам сайт, но всё безрезультатно.
Может, кто-нибудь подскажет, что делать в этом случае?
И ещё, я поделилась своим опытом с авторами, которые рассматривают этот сайт для публикации своих текстов.