ИИ в клинических испытаниях: подбор пациентов и контроль данных
LLM и ML ускоряют набор участников, проверку данных и подготовку регуляторных документов в клинических исследованиях.
Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.
Что решаем
По отраслевым оценкам около 80 % клинических исследований не укладываются в сроки набора участников, а каждый месяц задержки III фазы стоит спонсору значительные суммы. Критерии включения описаны в протоколах на десятках страниц, а подходящие пациенты «спрятаны» в неструктурированных медкартах и выписках — координаторы просматривают их вручную.
Вторая проблема — качество данных. Мониторы находят расхождения в CRF месяцами после ввода, а подготовка отчётов и досье для регулятора превращается в ручную сборку сотен документов. Все эти данные конфиденциальны и не могут обрабатываться во внешних облачных LLM.
Что делает ИИ
vLLMLlama/QwenLangChainPaddleOCRPostgreSQLQdrant
Локальная LLM извлекает из протокола критерии включения и исключения, а затем сопоставляет их с медкартами пациентов по данным МИС и OCR-распознанным выпискам. Координатор получает ранжированный список кандидатов с обоснованием по каждому критерию.
- Скрининг участников: сопоставление критериев с ЭМК и выписками.
- Контроль данных: модели аномалий находят несоответствия в CRF и лабораторных данных на этапе ввода.
- Генерация черновиков разделов отчётов и ответов на запросы регулятора с проверкой человеком.
- Полный журнал действий модели для аудита GCP.
Важно: MIARCH поставляет вычислительную инфраструктуру и помогает развернуть модели. Само ПО для постановки диагноза является медицинским изделием и проходит регистрацию отдельно — на стороне разработчика или клиники.
Какие данные нужны
- Протоколы исследований и поправки
- ЭМК и выписки участников
- Данные CRF и лабораторий
Какая инфраструктура нужна
Профиль ai: основа решения — инференс LLM на 30–70 млрд параметров с длинным контекстом (протоколы и медкарты), а это 80–140 ГБ памяти GPU и высокая пропускная способность HBM. Для CRO или исследовательского центра подходит сервер R7 ULTRA с H200 NVL из раздела GPU-серверов; при обслуживании десятков исследований одновременно — платформа LM TEK 4U8GPU10KW. Отдельный пул CPU и NVMe нужен под OCR и векторную базу документов. Разграничение доступа по исследованиям и журнал запросов к модели встроены в контур с самого начала.
Как идёт проект
- 01
Данные и цель
Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.
- 02
Пилот на нашей конфигурации
Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.
- 03
Инфраструктура
Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.
- 04
Сопровождение
Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.
Что ещё автоматизируют в отрасли «Здравоохранение и фарма»
Опишите задачу и данные.
Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.


