Чат-бот поддержки покупателей на локальной языковой модели
Ассистент в чате, мессенджерах и по телефону отвечает на вопросы о заказах, доставке и возвратах и передаёт сложные случаи оператору.
Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.
Что решаем
Большая часть обращений в поддержку однотипна: где заказ, как вернуть, есть ли размер, работает ли магазин в праздники. Операторы тратят на них время, очередь в чате растёт в пиковые дни, а доля обращений, решённых с первого контакта, падает.
Кнопочные боты раздражают покупателей и не понимают вопросов, сформулированных своими словами. Облачные LLM-сервисы решают проблему понимания, но требуют передавать во внешний сервис персональные данные и историю заказов, что расходится с требованиями закона о персональных данных и внутренней политикой безопасности.
Голосовой канал остаётся самым дорогим: колл-центр масштабируется только людьми.
Что делает ИИ
vLLMQwen / LlamaWhisperLangGraphQdrantRasa
Решение — ассистент на открытой языковой модели, развёрнутой на сервере компании, с доступом к базе знаний и системам заказов через защищённые API.
- RAG по базе знаний: условия доставки, возвратов, программы лояльности, описания товаров.
- Интеграции: статус заказа, наличие в магазине, оформление возврата, запись на примерку.
- Голосовой контур: распознавание речи, LLM, синтез — для телефонной линии и голосовых сообщений.
- Передача оператору с готовым резюме диалога; контроль качества ответов и запрет на тематики вне компетенции.
Пилот запускается на одном канале, например в чате приложения, с ограниченным набором сценариев, затем расширяется.
Какие данные нужны
- База знаний и регламенты поддержки
- История диалогов с операторами
- Доступ к статусам заказов и каталогу через API
Какая инфраструктура нужна
Профиль «инференс LLM»: главное — память GPU. Для модели 30–70 млрд параметров с несколькими десятками параллельных диалогов нужен сервер R7 ULTRA с H200 NVL или RX ULTRA из раздела GPU-серверы. Голосовые модели (распознавание и синтез) добавляют нагрузку и лучше работают на отдельной GPU того же узла.
Для крупного ритейлера с тысячами обращений в час и голосовым каналом целесообразна платформа LM TEK 4U8GPU10KW на 8 GPU: она обслуживает LLM, речевые модели и векторную базу в одном шасси в обычной серверной. Персональные данные покупателей и история заказов не покидают периметр компании.
Как идёт проект
- 01
Данные и цель
Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.
- 02
Пилот на нашей конфигурации
Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.
- 03
Инфраструктура
Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.
- 04
Сопровождение
Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.
Что ещё автоматизируют в отрасли «Ритейл и e-commerce»
Опишите задачу и данные.
Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.


