Защита от утечек данных: DLP с классификацией документов на LLM
Локальные LLM и OCR понимают смысл документов и переписки, а не только ключевые слова, и выявляют утечки конфиденциальной информации.
Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.
Что решаем
Классические DLP-системы ищут утечки по словарям, регулярным выражениям и цифровым отпечаткам файлов. Переформулированный текст, скриншот договора, фотография экрана, таблица без заголовков или чертёж проходят мимо. Одновременно система заваливает офицера безопасности ложными срабатываниями на безобидные письма с «конфиденциальными» словами, и реальные инциденты тонут в потоке.
Компании с интеллектуальной собственностью, персональными данными клиентов и гостайной должны понимать содержание каждого исходящего документа, при этом сам анализ не может выполняться внешним сервисом — это была бы утечка по определению. Требуется вычислительный узел внутри периметра, который читает документы, изображения и переписку с пониманием смысла.
Что делает ИИ
vLLMQwen/LlamaPaddleOCRSentence-TransformersQdrantPostgreSQL
Перехваченные каналы — почта, мессенджеры, файловые хранилища, печать, съёмные носители — передают содержимое на локальный узел, где OCR извлекает текст из сканов и скриншотов, а LLM классифицирует документ по категориям конфиденциальности организации, находит персональные данные, коммерческую тайну, исходный код и определяет, допустима ли передача данному адресату. Поведенческие модели выявляют нетипичные действия сотрудников: массовое скачивание, ночные выгрузки.
- Семантическая классификация документов, включая перефразированные и частичные копии.
- OCR скриншотов, фотографий и сканов с извлечением реквизитов.
- Поведенческая аналитика: отклонения от обычного профиля работы с данными.
- Объяснимые вердикты с указанием фрагмента и категории для офицера безопасности.
- Дообучение классификатора на документах и политике организации.
Какие данные нужны
- Перехваченный трафик каналов DLP
- Классификатор конфиденциальности и эталонные документы
- Журналы доступа к файлам и системам
Какая инфраструктура нужна
Профиль ai: классификация десятков тысяч документов и сообщений в сутки LLM среднего размера с OCR и векторным сравнением требует одной-двух GPU с большой памятью и низкой задержки, чтобы не тормозить отправку писем. Компании на 1–5 тысяч сотрудников подходит сервер R7 ULTRA из раздела GPU-серверов; для холдинга с несколькими десятками тысяч пользователей — платформа LM TEK 4U8GPU10KW. Пилот на одном канале запускается со станции RX ULTRA из рабочих станций. Узел размещается в контуре безопасности рядом с существующей DLP и интегрируется с ней через API как модуль анализа.
Как идёт проект
- 01
Данные и цель
Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.
- 02
Пилот на нашей конфигурации
Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.
- 03
Инфраструктура
Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.
- 04
Сопровождение
Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.
Что ещё автоматизируют в отрасли «Безопасность и видеонаблюдение»
Опишите задачу и данные.
Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.


