Интегратор GPU-серверов и рабочих станций · Россия и СНГ
8 (800) 350-70-73 · бесплатно по России | Условия поставки
Образование и наука · Компьютерное зрение · ML на табличных данных

Обработка экспериментальных данных: микроскопия, геномика, спектры

Конвейер от прибора до таблиц для статьи: сегментация изображений, геномные пайплайны, активное обучение.

Время анализа сеансас дней до часов
Точность сегментации после дообучения+10–20 п. п. к универсальной модели
Объём ручной разметки−60–80 % при активном обучении
Воспроизводимость результата100 % при версионировании пайплайна

Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.

Задача

Что решаем

Современные приборы генерируют данные быстрее, чем их успевают анализировать. Один сеанс на конфокальном или электронном микроскопе — сотни гигабайт изображений, прогон секвенатора — терабайты ридов, телескоп или синхротрон — потоки в десятки терабайт в сутки. Ручная сегментация клеток, разметка спектров, отбор событий занимает у аспирантов месяцы и плохо воспроизводится между людьми.

Готовые нейросетевые инструменты (Cellpose, AlphaFold, DeepVariant и им подобные) существуют, но требуют GPU с большим объёмом памяти и дообучения под конкретный тип образцов, для чего в лаборатории обычно нет ни оборудования, ни инженера.

Как работает

Что делает ИИ

PyTorchCellpose / MONAINVIDIA ParabricksDVCNextflow

Мы строим конвейер обработки данных под задачи лаборатории: от приёма файлов с прибора до готовых таблиц и графиков для статьи. Обучение и дообучение моделей выполняется локально на собственных размеченных данных, что даёт точность выше универсальных моделей.

  • Автоматический приём данных с приборов, каталогизация и контроль качества.
  • Сегментация и классификация изображений: клетки, частицы, дефекты, треки.
  • Геномные пайплайны на GPU: выравнивание, вызов вариантов, аннотация.
  • Активное обучение: модель предлагает для разметки самые неопределённые примеры.
  • Воспроизводимость: версии данных, моделей и параметров в едином реестре.

Какие данные нужны

  • Изображения микроскопии, томографии, спектры
  • Риды секвенирования и референсные геномы
  • Размеченные выборки лаборатории
  • Метаданные экспериментов и протоколы
Железо · Обучение и дообучение · Один узел в стойке

Какая инфраструктура нужна

Профиль «train», масштаб «rack-small». Дообучение сегментационных сетей на изображениях 2048×2048 и выше и обработка геномных данных требуют ускорителей с большим объёмом памяти и быстрым локальным хранилищем. Рабочая станция W9 ULTRA с четырьмя GPU из раздела рабочие станции подходит группе из 5–10 исследователей и ставится рядом с прибором. Если данных больше — потоки с нескольких приборов, обучение фундаментальных моделей по микроскопии, — нужен сервер RX MAX из раздела GPU-серверы с восемью ускорителями, NVMe-массивом от 30 ТБ и сетью 100 Гбит/с к хранилищу института. Оперативная память от 512 ГБ критична для геномики. Поставка в Россию и СНГ, конфигурация под приборы заказчика.

Сравнить конфигурации →  ·  Подобрать по ускорителю →

Внедрение

Как идёт проект

  1. 01

    Данные и цель

    Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.

  2. 02

    Пилот на нашей конфигурации

    Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.

  3. 03

    Инфраструктура

    Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.

  4. 04

    Сопровождение

    Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.

Смежные решения

Что ещё автоматизируют в отрасли «Образование и наука»

Все решения для отрасли →

Запрос КП · ответ в течение рабочего дня

Опишите задачу и данные.

Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.

Обсудить внедрение