Интегратор GPU-серверов и рабочих станций · Россия и СНГ
8 (800) 350-70-73 · бесплатно по России  |  Условия поставки
Решение · Обучение моделей

Сервер для обучения нейросетей с жидкостным охлаждением.

Дообучение открытых моделей на собственных данных, LoRA и QLoRA, обучение своих сетей для зрения и прогнозирования. Сервер для обучения нейросетей собираем от рабочей станции W9 ULTRA на четыре RTX PRO 6000 Blackwell до стоечных узлов RX MAX и Supermicro B300 на восемь ускорителей — и платформы LM TEK 4U8GPU10KW, которая держит восемь GPU до 700 Вт под полной нагрузкой часами в стандартной серверной, без внешнего CDU.

Сервер для обучения нейросетей LM TEK 4U8GPU10KW, контур охлаждения
8 × 700 ВтGPU полной высоты PCIe Gen 5 в 4U
8 000 Втдлительная мощность: 5 × 2000 Вт 80 PLUS Titanium с резервированием
6 800–7 000 Втизмерено под полной нагрузкой в стресс-тесте LM TEK
76–81 °CGPU при 30 °C в помещении
Задача

Обучение — это пиковая нагрузка на всё сразу и надолго.

Инференс нагружает GPU рывками, обучение — сплошным фронтом. Все ускорители работают на пределе часами и сутками, и в этот момент решают три вещи: память и её пропускная способность на карте, обмен между GPU внутри узла и стабильность питания и температуры. Любой троттлинг удлиняет эпоху, а сбой питания на десятом часу обнуляет её.

Честный масштаб: полное дообучение крупных моделей — задача многоузлового кластера с быстрым интерконнектом и общим хранилищем. Параметрически-эффективные методы (LoRA, QLoRA) на моделях среднего класса реалистичны на одном узле. Нагрузка пачечная: тяжёлая во время обучения, тихая между циклами, поэтому тот же сервер между запусками отдаётся под инференс и эксперименты.

Под это подбираем узел: двухпроцессорные платформы AMD EPYC или Intel Xeon с многоканальной ECC-памятью от 1 ТБ, восемь GPU в одном корпусе, NVMe U.2 под наборы данных и чекпойнты, сетевые адаптеры для объединения нескольких узлов.

Рекомендуемая конфигурация

От дообучения на одном узле до небольшого кластера.

УровеньСерия · пример конфигурацииДля чего
Дообучение и экспериментыW9 ULTRA · 4 × RTX PRO 6000 Blackwell · Threadripper PRO 9995WX · 2 ТБ RDIMM ECCLoRA/QLoRA на моделях среднего класса, обучение сетей компьютерного зрения, исследовательская группа без серверной
Production-дообучениеRX MAX · 8 × RTX PRO 6000 Blackwell · 2 × AMD EPYC 9555 · 1,5 ТБ ECC · 7UРегулярные циклы дообучения, оценка на своих наборах, инференс обученной модели на том же узле
Крупные моделиSupermicro B300 · NVIDIA HGX B300 NVL8, 8 GPU · 2 × Xeon 6767P · 2 ТБ DDR5-6400 ECC · 8UПолное дообучение и обучение больших моделей, узел кластера с общим хранилищем и планировщиком
Плотность с СЖОLM TEK 4U8GPU10KW · 8 × H200 NVL с водоблоками · 2 × Xeon Platinum 8580 · 1 ТБ ECC · 4UДлительные циклы на полной мощности в обычной серверной, без CDU

Примеры, а не фиксированные спецификации; все позиции собираются под заказ. Итоговый BOM, включая сетевые адаптеры и хранилище для кластера, задаётся под внедрение. Оценка времени обучения для вашей модели и данных уточняется при запросе.

AI-сервер LM TEK 4U8GPU10KW
Вендор LM TEK · платформа с СЖО для обучения

LM TEK 4U8GPU10KW

Шасси 4U, спроектированное вокруг замкнутого контура жидкостного охлаждения GPU и CPU, с силовой частью уровня платформы: пять блоков 2000 Вт 80 PLUS Titanium с резервированием и PDU, независимый от VRM материнской платы. Стартуйте с двух GPU, доводите до восьми.

Количество GPU
до 8 (конфигурации от 2 до 8)
Мощность на слот GPU
До 700 Вт на слот, длительно
Поддерживаемые сокеты CPU
AMD SP5, Intel LGA 4677, Intel LGA 4710, Intel LGA 4710-2 (в зависимости от выбранной платы)
Блоки питания
5 × 2000 Вт CRPS, 80 PLUS Titanium, с резервированием
Охлаждение

Почему жидкостное охлаждение для обучения.

Полная мощность без снижения частот

Обучение — единственная нагрузка, которая держит все восемь карт на максимуме одновременно. Водоблоки на каждой GPU и CPU снимают тепло напрямую, и в стресс-тесте при 30 °C карты остались в диапазоне 76–81 °C.

Питание, рассчитанное на 8 GPU

Бюджет мощности задан на уровне шасси: до 8000 Вт длительно с резервированием. Измеренное потребление полной конфигурации 6800–7000 Вт — эту цифру закладывайте в питание и охлаждение стойки.

Следующее поколение GPU

Шасси и контур, заложенные под жидкостное охлаждение на старте, дешевле, чем перестройка серверной на третьем этапе роста.

Что прислать для КП

Три пункта для расчёта.

  1. 01 · Модель и метод

    Что обучаете

    Базовая модель или архитектура, метод (полное дообучение, LoRA, обучение с нуля), объём и тип данных, желаемая длительность цикла.

  2. 02 · Узлы и хранилище

    Один узел или кластер

    Число узлов, требования к сети между ними, объём набора данных и чекпойнтов, планы по инференсу обученной модели.

  3. 03 · Площадка

    Питание и тепло

    Доступная мощность на стойку, охлаждение помещения под 7 кВт тепла на узел, температура воздуха, страна поставки.

Считаете GPU-сервер для обучения моделей?Пришлите модель, данные и число узлов — вернёмся с конфигурацией и условиями поставки в Россию и СНГ.
Запросить КП