Интегратор GPU-серверов и рабочих станций · Россия и СНГ
8 (800) 350-70-73 · бесплатно по России  |  Условия поставки
Образование и наука · Речевые технологии · LLM и генеративный ИИ

Транскрибация лекций, автоматические конспекты и поиск по видеоархиву

Распознавание речи с терминологией дисциплин, конспекты, субтитры и семантический поиск по архиву лекций.

Точность распознавания терминовWER 5–10 % после адаптации словаря
Скорость обработки×20–50 к реальному времени на GPU
Время студента на конспект−50–70 %
Доступность архива100 % записей с поиском по содержанию

Диапазоны по отраслевым публикациям и типовым внедрениям; результат зависит от данных и процессов заказчика.

Задача

Что решаем

Университет за семестр записывает тысячи часов лекций, вебинаров и защит, но этот архив почти не используется: найти нужный фрагмент невозможно, конспекты студенты ведут вручную, а для слабослышащих и иностранных студентов материал недоступен. Преподаватели повторяют одно и то же из года в год, тратя время, которое могло бы пойти на обновление курса.

Облачные сервисы транскрибации плохо справляются с терминологией по узким дисциплинам, ошибаются на формулах и именах, а передача аудио с закрытых занятий и защит диссертаций вовне нежелательна. Запросы студентов с особыми потребностями на текстовые версии занятий приходится закрывать вручную.

Как работает

Что делает ИИ

Whisper / NeMopyannotevLLMElasticsearch / QdrantFFmpeg

Локальный конвейер обработки записей: распознавание речи с адаптацией к словарю дисциплины, разделение говорящих, выделение структуры лекции, генерация конспекта и вопросов для самопроверки. Результат публикуется в LMS рядом с видео с навигацией по темам.

  • Пакетная транскрибация архива и потоковая для новых записей.
  • Словари терминов по кафедрам, коррекция формул и латинских обозначений.
  • Разбиение на главы, ключевые тезисы, глоссарий, тесты по лекции.
  • Семантический поиск по всему архиву: «где объясняли теорему Байеса».
  • Субтитры и перевод для иностранных студентов.

Какие данные нужны

  • Записи лекций, вебинаров, защит
  • Словари терминов по дисциплинам
  • Расписание и привязка записей к курсам
  • Презентации лекторов для сопоставления
Железо · Инференс LLM и ассистенты · Под столом или в лаборатории

Какая инфраструктура нужна

Профиль «ai», масштаб «desk». Распознавание речи моделью класса Whisper large на современном GPU идёт в 20–50 раз быстрее реального времени, поэтому одна рабочая станция обрабатывает семестровый архив за несколько дней, а новые записи — в течение часа после занятия. W9 с RTX PRO 6000 Blackwell (96 ГБ) из раздела рабочие станции совмещает ASR, диаризацию и LLM для конспектов на одной карте. При потоке в сотни занятий в день на несколько корпусов ставят сервер R7 ULTRA на H200 NVL из раздела GPU-серверы, который также обслуживает семантический поиск по архиву для тысяч студентов. Хранилище — сетевое, под видео от 50 ТБ. Поставка в Россию и страны СНГ. Обработка идёт ночью по расписанию, не мешая другим задачам станции.

Сравнить конфигурации →  ·  Подобрать по ускорителю →

Внедрение

Как идёт проект

  1. 01

    Данные и цель

    Фиксируем метрику успеха, источники данных и ограничения: on-premise, персональные данные, сроки.

  2. 02

    Пилот на нашей конфигурации

    Стартовая машина под задачу и подтверждённый профиль нагрузки перед закупкой кластера.

  3. 03

    Инфраструктура

    Поставка серверов, станций и охлаждения, монтаж, ввод в эксплуатацию, ПО и мониторинг.

  4. 04

    Сопровождение

    Масштабирование, обновление ускорителей в том же шасси, сервис и запчасти.

Смежные решения

Что ещё автоматизируют в отрасли «Образование и наука»

Все решения для отрасли →

Запрос КП · ответ в течение рабочего дня

Опишите задачу и данные.

Вернёмся с профилем нагрузки, конфигурацией и коммерческим предложением на поставку в вашу страну.

Обсудить внедрение