Интегратор GPU-серверов и рабочих станций · Россия и СНГ
8 (800) 350-70-73 · бесплатно по России  |  Условия поставки
Ритейл и e-commerce · LLM и генеративный ИИ · Речевые технологии

Чат-бот поддержки покупателей на локальной языковой модели

Ассистент в чате, мессенджерах и по телефону отвечает на вопросы о заказах, доставке и возвратах и передаёт сложные случаи оператору.

Доля обращений без оператора40–70 % по типовым сценариям
Время первого ответасекунды вместо минут ожидания
Нагрузка на операторовснижение на 30–50 %
Одновременных диалогов на узел50–200 в зависимости от модели

Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.

Задача

Что решаем

Большая часть обращений в поддержку однотипна: где заказ, как вернуть, есть ли размер, работает ли магазин в праздники. Операторы тратят на них время, очередь в чате растёт в пиковые дни, а доля обращений, решённых с первого контакта, падает.

Кнопочные боты раздражают покупателей и не понимают вопросов, сформулированных своими словами. Облачные LLM-сервисы решают проблему понимания, но требуют передавать во внешний сервис персональные данные и историю заказов, что расходится с требованиями закона о персональных данных и внутренней политикой безопасности.

Голосовой канал остаётся самым дорогим: колл-центр масштабируется только людьми.

Как работает

Что делает ИИ

vLLMQwen / LlamaWhisperLangGraphQdrantRasa

Решение — ассистент на открытой языковой модели, развёрнутой на сервере компании, с доступом к базе знаний и системам заказов через защищённые API.

  • RAG по базе знаний: условия доставки, возвратов, программы лояльности, описания товаров.
  • Интеграции: статус заказа, наличие в магазине, оформление возврата, запись на примерку.
  • Голосовой контур: распознавание речи, LLM, синтез — для телефонной линии и голосовых сообщений.
  • Передача оператору с готовым резюме диалога; контроль качества ответов и запрет на тематики вне компетенции.

Пилот запускается на одном канале, например в чате приложения, с ограниченным набором сценариев, затем расширяется.

Какие данные нужны

  • База знаний и регламенты поддержки
  • История диалогов с операторами
  • Доступ к статусам заказов и каталогу через API
Железо · Инференс LLM и ассистенты · Один узел в стойке

Какая инфраструктура нужна

Профиль «инференс LLM»: главное — память GPU. Для модели 30–70 млрд параметров с несколькими десятками параллельных диалогов нужен сервер R7 ULTRA с H200 NVL или RX ULTRA из раздела GPU-серверы. Голосовые модели (распознавание и синтез) добавляют нагрузку и лучше работают на отдельной GPU того же узла.

Для крупного ритейлера с тысячами обращений в час и голосовым каналом целесообразна платформа LM TEK 4U8GPU10KW на 8 GPU: она обслуживает LLM, речевые модели и векторную базу в одном шасси в обычной серверной. Персональные данные покупателей и история заказов не покидают периметр компании.

Сравнить конфигурации →  ·  Подобрать по ускорителю →

Внедрение

Как идёт проект

  1. 01

    Данные и цель

    Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.

  2. 02

    Пилот на нашей конфигурации

    Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.

  3. 03

    Инфраструктура

    Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.

  4. 04

    Сопровождение

    Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.

Смежные решения

Что ещё автоматизируют в отрасли «Ритейл и e-commerce»

Все решения для отрасли →

Запрос КП · ответ в течение рабочего дня

Опишите задачу и данные.

Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.

Обсудить внедрение