Интегратор GPU-серверов и рабочих станций · Россия и СНГ
8 (800) 350-70-73 · бесплатно по России | Условия поставки
Решение · Инференс LLM

GPU-сервер для инференса LLM в собственной серверной.

Запуск открытых языковых моделей внутри периметра организации: внутренние ассистенты, RAG по корпоративным документам, агентные сценарии с вызовом инструментов. GPU-сервер для инференса LLM собираем под сценарий: от одного узла R7 ULTRA с H200 NVL до RX ULTRA на шестнадцать H200 NVL и платформы LM TEK 4U8GPU10KW с жидкостным охлаждением, которая ставит восемь ускорителей в 4U и работает в обычной серверной без CDU.

GPU-сервер для инференса LLM LM TEK 4U8GPU10KW
8 × 700 Втслотов GPU PCIe Gen 5 в 4U
2 → 8GPU в одном шасси: рост вместе с числом пользователей
Без CDUконтур замкнут внутри шасси, воды из здания не нужно
5–30 °Cштатные условия серверной
Задача

Инференс LLM: память под модель и токены в секунду на пользователя.

У сервера инференса два ограничителя. Первый — суммарная память GPU: в неё должны поместиться веса модели и контекст всех одновременных сессий. Второй — скорость генерации на одного пользователя при заданной конкурентности. Медленный чат — мёртвый чат, поэтому нагрузку задаёт число одновременных пользователей, а не средняя за день.

Что это значит для железа. Класс модели выбирает объём памяти на карту, конкурентность — число карт. Меньшая, хорошо подобранная модель часто обслуживает больше людей, чем одна избыточно большая. Если поверх стоит RAG, добавляются три нагрузки: эмбеддинг-модель, векторная база и сам LLM, и тогда важны NVMe и CPU не меньше, чем GPU.

Отсюда три пути. Один узел 4U с одной H200 NVL для пилота. Восемь или шестнадцать H200 NVL в одном сервере для корпоративного сервиса. Или платформа LM TEK с жидкостным охлаждением, где старт с двух GPU и добавление карт по мере роста нагрузки происходят в том же шасси.

Рекомендуемая конфигурация

Три уровня сервера для запуска языковых моделей.

УровеньСерия · пример конфигурацииДля чего
Пилот одной командыR7 ULTRA · 1 × NVIDIA H200 NVL · Threadripper 7970X · 256 ГБ ECC · 4UКвантованная открытая модель, один сценарий, ограниченный круг пользователей, проверка «работает ли внутри периметра»
Корпоративный инференсASUS ESC8000A-E13P · 8 × NVIDIA H200 NVL · 2 × AMD EPYC 9965 · 3 ТБ ECC · 4UКрупные модели, чат плюс RAG, несколько сценариев на одном узле, инференс как сервис для организации
Максимум конкурентностиRX ULTRA · 16 × NVIDIA H200 NVL · 2 × Xeon 8592+ · 8 ТБ ECC · 10UСамые крупные открытые модели, сотни одновременных сессий, несколько моделей на одном сервере
Плотность с СЖОLM TEK 4U8GPU10KW · от 2 до 8 GPU с водоблоками, например 8 × H200 NVL · 2 × Xeon Platinum 8580 · 1 ТБ ECC · 4UВосемь GPU в 4U без CDU, рост от двух карт до восьми в том же шасси

Конфигурации — примеры, не фиксированная спецификация; все позиции собираются под заказ. Итоговый BOM задаётся под внедрение. Ожидаемая скорость генерации для конкретной модели и числа пользователей уточняется при запросе.

AI-сервер LM TEK 4U8GPU10KW
Вендор LM TEK · платформа с СЖО для инференса

LM TEK 4U8GPU10KW

Barebone-платформа: восемь слотов GPU полной высоты в 4U, замкнутый контур жидкостного охлаждения с радиатором внутри шасси, пять блоков питания 2000 Вт 80 PLUS Titanium с резервированием. Плату, CPU, GPU и память подбираем под ваш сценарий инференса.

Количество GPU
до 8 (конфигурации от 2 до 8)
Мощность на слот GPU
До 700 Вт на слот, длительно
Поддерживаемые сокеты CPU
AMD SP5, Intel LGA 4677, Intel LGA 4710, Intel LGA 4710-2 (в зависимости от выбранной платы)
Блоки питания
5 × 2000 Вт CRPS, 80 PLUS Titanium, с резервированием
Охлаждение

Почему жидкостное охлаждение для инференса.

Нагрузка круглосуточная

Сервис инференса не останавливается ночью. В стресс-тестах LM TEK при 30 °C в помещении температура GPU держалась в диапазоне 76–81 °C — без троттлинга, который тихо съедает токены в секунду у воздушных систем.

Плотность там, где стоит стойка

Однослотовые водоблоки позволяют поставить восемь карт в 4U, где воздушный сервер того же класса занимает 6U или 8U. Это важно, когда серверная одна и место в ней ограничено.

Рост без переезда

На платформе LM TEK стартовая конфигурация на две карты и конечная на восемь — одно и то же шасси, тот же контур, та же силовая часть. Наращивание конкурентности не требует новой площадки.

Что прислать для КП

Три пункта, и мы вернёмся с конфигурацией.

  1. 01 · Модель и сценарий

    Что запускаете

    Класс модели или конкретные веса, сценарий (чат, RAG, агенты, извлечение), число одновременных пользователей и требования к задержке.

  2. 02 · Данные и стек

    Что вокруг модели

    Объём корпуса документов для RAG, runtime инференса, требования к хранилищу и сети, планы по дообучению.

  3. 03 · Площадка

    Где будет стоять

    Стойка, доступная мощность, температура в серверной, страна поставки: Россия, Казахстан, Беларусь или Узбекистан.

Планируете инференс внутри периметра?Пришлите модель и число пользователей — предложим стартовую конфигурацию, с которой вложения не пропадут при росте.
Запросить КП