ИИ-операторы контакт-центра: чат-боты и голосовые ассистенты
Локальные LLM и речевые модели обрабатывают обращения абонентов в чате и по телефону — без передачи данных во внешние облака.
Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.
Что решаем
Контакт-центр оператора связи принимает миллионы обращений в месяц, и 60–70 % из них — типовые: баланс, тариф, настройка роутера, статус заявки. Кнопочные IVR и сценарные боты раздражают абонентов и не снимают нагрузку: клиент всё равно пробивается к оператору, а время ожидания в пиковые часы уходит за 10 минут.
Облачные LLM-сервисы для этой задачи ограничены: разговоры содержат персональные данные и детали договоров, а требования регуляторов в России и странах СНГ предписывают хранить и обрабатывать их локально. К тому же тарификация по токенам при миллионах диалогов быстро перестаёт быть экономичной по сравнению с собственным узлом.
Что делает ИИ
vLLMQwen/LlamaWhisperNVIDIA Riva/NeMoLangChainQdrant
Ассистент строится на локальной LLM с RAG по базе знаний оператора: тарифы, регламенты, инструкции по оборудованию. Для телефонного канала добавляются распознавание и синтез речи с задержкой, при которой диалог звучит естественно. Ассистент выполняет действия через API биллинга и CRM: меняет тариф, создаёт заявку, проверяет статус подключения.
- Понимание свободной речи, а не ключевых слов; уточняющие вопросы вместо ошибочных маршрутов.
- Передача оператору с готовым резюме диалога и предложенным решением.
- Автоматическое заполнение карточки обращения и тегирование причин.
- Суфлёр для операторов: подсказки и черновики ответов в реальном времени.
Какие данные нужны
- База знаний: тарифы, регламенты, инструкции
- История обращений и их разметка
- Доступ к API биллинга и CRM
Какая инфраструктура нужна
Профиль ai: сотни одновременных диалогов требуют инференса LLM с высокой пропускной способностью по токенам, а голосовой канал добавляет речевые модели с жёсткими требованиями к задержке. Для контакт-центра на 200–500 операторов подходит сервер R7 ULTRA с двумя-четырьмя H200 NVL из раздела GPU-серверов; федеральному оператору с миллионами диалогов в месяц — платформа LM TEK 4U8GPU10KW, где восемь ускорителей охлаждаются жидкостью в обычной серверной. Пилот на одном канале обслуживания стартует со станции RX ULTRA. Узел работает 24/7, поэтому резервирование питания и второй узел для отказоустойчивости входят в проект.
Как идёт проект
- 01
Данные и цель
Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.
- 02
Пилот на нашей конфигурации
Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.
- 03
Инфраструктура
Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.
- 04
Сопровождение
Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.
Что ещё автоматизируют в отрасли «Телеком и медиа»
Опишите задачу и данные.
Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.


