Обсудить задачу
W
worksetup.ruИльдар, автоматизация бизнес-процессов
Подписаться

Нейросеть и персональные данные: как обезличивать тексты, прежде чем отправлять их в ИИ

Резюме звонков и разбор заявок требуют отправлять тексты в нейросеть, а в них имена и телефоны клиентов. Как это делать аккуратно.

Данные и безопасность 6 мин чтения Комментарии
Нейросеть и персональные данные: как обезличивать тексты, прежде чем отправлять их в ИИ
Содержание
  1. Что такое обезличивание текста
  2. Что именно маскируется
  3. Как это встраивается в систему
  4. Что эта мера не делает
  5. Где это особенно полезно
  6. Альтернатива: локальная модель
  7. Как подготовиться
  8. Как проверить шлюз на примерах
  9. Кому подойдёт, а кому нужен другой путь
  10. До и после: что видит нейросеть
  11. Разбор: чек-лист перед подключением нейросети к клиентским данным
  12. Итог

Сценарий знаком многим. Вы подключили нейросеть, чтобы она делала резюме звонков или разбирала обращения клиентов. Всё работает отлично, пока кто-то не задаёт вопрос: «А что именно мы отправляем во внешний сервис?» Оказывается, в текстах есть фамилии, номера телефонов, адреса, иногда паспортные данные.

И тут возникает пауза. Нейросеть полезна, но отправлять ей чужие данные тревожно.

Что такое обезличивание текста

Идея простая. Перед тем как отправить текст нейросети, мы заменяем персональные данные метками. Вместо «Иванов Пётр Сергеевич, телефон 8 900…» нейросеть видит «ЧЕЛОВЕК_1, телефон ТЕЛЕФОН_1». Она делает свою работу: делает резюме, разбирает, отвечает. А когда ответ возвращается, метки снова заменяются настоящими значениями.

В итоге внешний провайдер получает текст без имён и номеров, а вы получаете ответ с привычными данными.

Нейросети не нужно знать, как зовут вашего клиента, чтобы понять, чего он хочет. Поэтому эти сведения можно просто не отправлять.

Что именно маскируется

Базовый набор покрывает то, что встречается в большинстве обращений:

  • ФИО;
  • телефоны и email;
  • адреса;
  • ИНН, СНИЛС, паспортные данные и ОГРН;
  • номера карт и счетов;
  • даты.

Кроме шаблонов, настраивается распознавание имён и словарь ваших клиентов: названия компаний, фамилии постоянных контактов, внутренние обозначения. Всё это подгоняется под ваши реальные тексты.

Как это встраивается в систему

Обезличивание работает как шлюз между вашей системой и нейросетью. Он стоит как отдельный сервис в Docker на вашем сервере. Ваша программа обращается к нему вместо обращения напрямую к ИИ. Шлюз маскирует данные, отправляет текст, получает ответ, подставляет значения обратно и возвращает результат.

Для вашего кода это выглядит как обычный вызов нейросети: меняется только адрес. Шлюз ведёт журнал-счётчик: сколько данных замаскировано, чтобы вы видели, что механизм работает.

Что эта мера не делает

Самое важное в этой статье вот это, поэтому скажем прямо.

  1. Она не гарантирует полное отсутствие пропусков. Люди пишут по-разному, и теоретически в тексте может остаться что-то, чего правила не распознали.
  2. Она не заменяет юридическое оформление. Соответствие 152-ФЗ остаётся за вами и вашим юристом.
  3. Это техническая мера, а не юридическое заключение.

Мы не обещаем «полной безопасности», потому что её нет ни у одной системы. Мы даём инструмент, который заметно уменьшает объём персональных данных, уходящих наружу.

Где это особенно полезно

  • Резюме звонков и переписок. В разговорах постоянно звучат имена и телефоны. Об этом мы писали в статье про расшифровку звонков нейросетью.
  • Разбор входящих заявок. Клиенты пишут свободным текстом, а нейросеть достаёт из него суть. Подробнее: AI-разбор заявок.
  • Ответы клиентам. ИИ-ассистент может отвечать на письма, не получая лишних данных.

Альтернатива: локальная модель

Бывает, что обезличивания недостаточно или требования строже. Тогда можно поставить нейросеть прямо на ваш сервер, и тексты вообще не покидают периметр. Это дороже по железу, но отвечает самым строгим запросам. Выбор зависит от задачи, объёма и бюджета, и его удобно обсудить заранее.

Как подготовиться

Чтобы настроить шлюз, нужно знать:

  • откуда идут тексты: звонки, чаты, формы;
  • в какую нейросеть вы их отправляете;
  • какие данные вы считаете персональными;
  • 5–20 тестовых примеров. Важно: без реальных данных, обезличенные или придуманные.

На примерах шлюз проверяется, и вы видите, что маскируется и что нет, до того как система начнёт работать.

Как проверить шлюз на примерах

Самый надёжный способ убедиться, что обезличивание работает, — прогнать через него тексты, похожие на ваши реальные. Для этого собирают от пяти до двадцати тестовых примеров: обезличенных или придуманных, но с таким же типом данных, как в жизни.

Дальше смотрят на результат: какие данные заменены метками, а какие остались. Если что-то пропущено, правила дописывают: добавляют шаблоны, расширяют словарь, настраивают распознавание имён. Этот цикл повторяется, пока результат на примерах вас не устроит. В базовом объёме тест проходит на двадцати примерах.

Для контроля шлюз ведёт журнал-счётчик: сколько данных каждого типа заменено. По нему легко заметить, если что-то вдруг перестало работать.

Кому подойдёт, а кому нужен другой путь

Подойдёт, если вы хотите пользоваться внешней нейросетью, но не хотите отправлять ей имена, телефоны и реквизиты клиентов. Шлюз заметно уменьшает объём персональных данных, которые уходят наружу.

Нужен другой путь, если требования строже: например, данные вообще не должны покидать ваш периметр. Тогда обсуждают локальную модель на вашем сервере.

В любом случае юридические вопросы решаются с юристом. Шлюз закрывает техническую часть, но не заменяет документы и согласия.

До и после: что видит нейросеть

Покажем на условном тексте с придуманными данными. Допустим, в расшифровке звонка есть такая фраза.

До обезличивания: «Здравствуйте, это Сидоров Алексей Петрович, мой телефон 8 900 000-00-00, адрес: Москва, ул. Примерная, 1. Хочу уточнить по заказу».

После обезличивания: «Здравствуйте, это ЧЕЛОВЕК_1, мой телефон ТЕЛЕФОН_1, адрес: АДРЕС_1. Хочу уточнить по заказу».

Нейросеть делает свою работу над вторым текстом. А в ответе, например, в резюме, метки снова заменяются настоящими значениями.

Что происходитДоПосле
Что получает внешняя нейросетьТекст с именами, телефонами и адресамиТекст с метками вместо данных
Что видите выОтвет с даннымиОтвет с теми же данными: метки подставлены обратно
КонтрольНепонятно, что именно ушло наружуЖурнал-счётчик по типам данных
Где работает механизмНигде, данные уходят как естьНа вашем сервере, как сервис в Docker

Это типовой процесс для иллюстрации. Конкретные сроки и эффект зависят от вашего бизнеса, поэтому цифр в таблице нет сознательно.

Разбор: чек-лист перед подключением нейросети к клиентским данным

Прежде чем отправлять тексты клиентов в любую внешнюю нейросеть, пройдите по короткому списку.

  1. Какие данные в текстах? Имена, телефоны, адреса, документы, номера карт.
  2. Кто их получит? Какой провайдер нейросети и где он обрабатывает данные.
  3. Нужны ли они модели? Часто для резюме и разбора имена и телефоны вообще не нужны.
  4. Есть ли юридические требования? Согласия, уведомления, внутренние регламенты. Это вопрос к юристу.
  5. Что с ошибками? Как вы заметите, если что-то не замаскировалось.
  6. Нужна ли локальная модель? Если ответ на первый вопрос тревожный, возможно, данные не должны покидать ваш сервер.

Этот список полезен независимо от того, используете вы шлюз или нет: он помогает понять, где у вас риск.

Итог

Нейросети и персональные данные не враги, если между ними стоит аккуратный посредник. Он не решает всех вопросов, но убирает самые острые: имена и телефоны не уходят наружу, а ваша система продолжает работать как обычно.

Решение называется «Защита персональных данных при работе с нейросетью». Цену, срок и опции смотрите на странице, там же можно собрать заказ и отправить расчёт.

Защита ПД для нейросети

Маскировка данных перед отправкой. от 15 000 ₽, срок: 4 дня.

Ещё по теме: Расшифровка звонковAI-разбор заявок

Частые вопросы

Это гарантирует соответствие 152-ФЗ?

Нет. Это техническая мера. Полного исключения пропусков она не гарантирует, юридическое оформление и соответствие закону остаются за вами и вашим юристом.

Где работает шлюз?

Локально, на вашем сервере, как сервис в Docker. Ваша система обращается к шлюзу, а шлюз к нейросети.

Какие данные маскируются?

ФИО, телефон, email, адрес, ИНН, СНИЛС, паспорт, ОГРН, номера карт и счетов, даты. Дополнительно можно настроить словарь ваших клиентов.

Что нужно для настройки?

Откуда идут тексты, в какую нейросеть вы их отправляете и какие данные считаете персональными, а также 5–20 тестовых примеров без реальных данных.

Оцените статью

Оценка статьи от 1 до 5

Была ли статья полезной? Выберите оценку.

Комментарии

Задайте вопрос или поделитесь опытом: сообщение придёт автору в Telegram или на почту. Полезные вопросы и ответы мы публикуем под статьёй.

Сайт ничего не хранит: сообщение открывается в вашем Telegram или почтовом приложении.

Читайте также