Интегратор GPU-серверов и рабочих станций · Россия и СНГ
8 (800) 350-70-73 · бесплатно по России  |  Условия поставки
Безопасность и видеонаблюдение · LLM и генеративный ИИ · Обработка документов и OCR · Обнаружение аномалий

Защита от утечек данных: DLP с классификацией документов на LLM

Локальные LLM и OCR понимают смысл документов и переписки, а не только ключевые слова, и выявляют утечки конфиденциальной информации.

Ложные срабатывания DLP−60–85 %
Выявление утечек в изображениях и перефразированном тексте+30–60 % к словарным методам
Задержка анализа письма1–3 с

Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.

Задача

Что решаем

Классические DLP-системы ищут утечки по словарям, регулярным выражениям и цифровым отпечаткам файлов. Переформулированный текст, скриншот договора, фотография экрана, таблица без заголовков или чертёж проходят мимо. Одновременно система заваливает офицера безопасности ложными срабатываниями на безобидные письма с «конфиденциальными» словами, и реальные инциденты тонут в потоке.

Компании с интеллектуальной собственностью, персональными данными клиентов и гостайной должны понимать содержание каждого исходящего документа, при этом сам анализ не может выполняться внешним сервисом — это была бы утечка по определению. Требуется вычислительный узел внутри периметра, который читает документы, изображения и переписку с пониманием смысла.

Как работает

Что делает ИИ

vLLMQwen/LlamaPaddleOCRSentence-TransformersQdrantPostgreSQL

Перехваченные каналы — почта, мессенджеры, файловые хранилища, печать, съёмные носители — передают содержимое на локальный узел, где OCR извлекает текст из сканов и скриншотов, а LLM классифицирует документ по категориям конфиденциальности организации, находит персональные данные, коммерческую тайну, исходный код и определяет, допустима ли передача данному адресату. Поведенческие модели выявляют нетипичные действия сотрудников: массовое скачивание, ночные выгрузки.

  • Семантическая классификация документов, включая перефразированные и частичные копии.
  • OCR скриншотов, фотографий и сканов с извлечением реквизитов.
  • Поведенческая аналитика: отклонения от обычного профиля работы с данными.
  • Объяснимые вердикты с указанием фрагмента и категории для офицера безопасности.
  • Дообучение классификатора на документах и политике организации.

Какие данные нужны

  • Перехваченный трафик каналов DLP
  • Классификатор конфиденциальности и эталонные документы
  • Журналы доступа к файлам и системам
Железо · Инференс LLM и ассистенты · Один узел в стойке

Какая инфраструктура нужна

Профиль ai: классификация десятков тысяч документов и сообщений в сутки LLM среднего размера с OCR и векторным сравнением требует одной-двух GPU с большой памятью и низкой задержки, чтобы не тормозить отправку писем. Компании на 1–5 тысяч сотрудников подходит сервер R7 ULTRA из раздела GPU-серверов; для холдинга с несколькими десятками тысяч пользователей — платформа LM TEK 4U8GPU10KW. Пилот на одном канале запускается со станции RX ULTRA из рабочих станций. Узел размещается в контуре безопасности рядом с существующей DLP и интегрируется с ней через API как модуль анализа.

Сравнить конфигурации →  ·  Подобрать по ускорителю →

Внедрение

Как идёт проект

  1. 01

    Данные и цель

    Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.

  2. 02

    Пилот на нашей конфигурации

    Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.

  3. 03

    Инфраструктура

    Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.

  4. 04

    Сопровождение

    Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.

Смежные решения

Что ещё автоматизируют в отрасли «Безопасность и видеонаблюдение»

Все решения для отрасли →

Запрос КП · ответ в течение рабочего дня

Опишите задачу и данные.

Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.

Обсудить внедрение