Дообучение отраслевой языковой модели на данных финансовой организации
Собственная LLM, дообученная на документах и диалогах банка, для ассистентов и автоматизации — без выхода данных наружу.
Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.
Что решаем
Открытые языковые модели хорошо понимают общий язык, но плохо знают продуктовую линейку банка, внутреннюю терминологию, форматы документов и стиль общения с клиентами. RAG закрывает часть проблемы, но не учит модель рассуждать в терминах организации и следовать её регламентам.
Дообучение в облаке означает передачу корпуса внутренних документов и диалогов внешнему провайдеру, что для банка и страховщика неприемлемо: банковская тайна, персональные данные, требования регулятора к локализации.
Без собственной вычислительной базы команда ML ограничена экспериментами на маленьких моделях, которые не дают нужного качества.
Что делает ИИ
PyTorchHugging Face TRL / PEFTDeepSpeedvLLMMLflowWeights & Biases
Мы поставляем вычислительную платформу для дообучения открытых моделей в контуре организации и помогаем выстроить процесс: от подготовки корпуса до выкатки модели в сервисы.
- Подготовка данных: очистка и деперсонализация документов, диалогов контакт-центра, базы знаний; формирование инструктивных наборов.
- Дообучение методами LoRA/QLoRA и полное дообучение для моделей 7–70 млрд параметров; выравнивание на предпочтениях экспертов.
- Оценка на внутренних тестах: точность по продуктам, следование регламентам, отсутствие утечек данных в ответах.
- Выкатка в сервисы: ассистент сотрудника, чат-бот клиента, разбор документов — один узел обслуживает обучение и инференс.
Цикл переобучения при обновлении продуктов занимает дни, а не кварталы, и остаётся под контролем команды банка.
Какие данные нужны
- Внутренние документы и база знаний
- Деперсонализированные диалоги контакт-центра
- Инструктивные наборы, размеченные экспертами
Какая инфраструктура нужна
Профиль «обучение»: дообучение модели на 70 млрд параметров даже методом LoRA требует нескольких GPU с 80–141 ГБ памяти, быстрой связи между ними и часов непрерывной нагрузки. Базовая конфигурация — узел на 8 GPU: платформа LM TEK 4U8GPU10KW с жидкостным охлаждением, которая ставится в обычную серверную, или Supermicro B300 из раздела GPU-серверы для максимальной производительности.
Для моделей 7–14 млрд параметров и методов с квантизацией достаточно W9 ULTRA или RX MAX с 4 GPU. Заложите NVMe-массив на десятки ТБ под корпус, чекпойнты и датасеты. Все данные и веса модели остаются в периметре банка.
Как идёт проект
- 01
Данные и цель
Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.
- 02
Пилот на нашей конфигурации
Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.
- 03
Инфраструктура
Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.
- 04
Сопровождение
Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.
Что ещё автоматизируют в отрасли «Финансы и страхование»
Опишите задачу и данные.
Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.


