Перейти к основному содержимому

Обработка видео

Рассмотрим основные задачи, решаемые нейросетями при обработке видео-данных.

Определение действий на видео

В задаче определения действия (activity recognition) по входному видео необходимо понять, какое событие на нём происходит. У алгоритма могут быть быть следующие выходы:

  • Класс одного из заданных действий.

    • Например, при игре на игровой приставке по жесту игрока нужно осуществить то или иное действие, при этом жесты заранее определены и заданы. Эта задача также известна как распознавание жестов (gesture recognition [1]).
  • Текстовое описание видео (video captioning [2]).

    • Это полезно, например, в системе поиска релевантных видео по текстовому запросу.

3D-реконструкция

В задаче 3D-реконструкции по видеосъёмке объекта из разных позиций и ракурсов необходимо восстановить 3D-модель объекта (3D reconstruction from multi-view video).

Модели, решающие эту задачу, используются в автономных транспортных средствах для построения 3-D карты местности и лучшей ориентации машины в пространстве. Также модели используются для воссоздания 3D-моделей зданий для создания их цифровых макетов в системах дополненной реальности и перед их архитектурными реконструкциями.

Трекинг объектов

Задача трекинга объектов на видео (object tracking) представляет собой задачу детекции объектов динамически по серии видеокадров. При этом детекция производится точнее за счёт использования информации с более ранних и более поздних детекций и интерполяции движения объекта. Обычно для интерполяции используется фильтр Калмана [3]. Интерполяция движения позволяет обнаруживать движущийся объект более устойчиво, даже если на некоторых кадрах он загораживается другими объектами. Трекинг объектов используется в следующих задачах:

  • контроль пассажиропотока, подсчёт числа вошедших и вышедших пассажиров;

  • наблюдение за машинами, автоматическое определение превышения допустимой скорости и аварий на дорогах.

  • отслеживание игроков во время футбольного матча для расчёта их эффективности и вклада в игру;

  • слежение за быстро движущимися объектами, например, теннисным мячом во время соревнований, автоматическое определение аута (когда мяч коснулся земли за пределами поля);

Трекинг может быть совмещён с другой задачей, например, можно не только следить за собеседниками на совещании, но и определять, когда говорит каждый из собеседников, чтобы камера могла автоматически на нём фокусироваться.

Генерация видео

В задачах генерации видео (video generation) необходимо сгенерировать видео с заданными свойствами:

  • Генерация видео по текстовому описанию (text-to-video generation)

    • Пример: создание видеоролика по сценарию, описанному в виде текста.
  • Предсказание будущих кадров по уже известному видео (video prediction, frame prediction).

    • Примеры: по карте движения атмосферных циклонов предсказывать погоду в будущем; предсказание поведения объектов для систем автопилотирования.
  • Генерация видео по изображению (image-to-video generation).

    • Пример: анимация фотографии (оживление портрета).
  • Заполнение испорченных фрагментов видео (video inpainting / completion).

    • Примеры: удаление нежелательного объекта (логотипа, человека, птицы), восстановление повреждённых фрагментов старых фильмов.
  • Стилизация видео (video style transfer): в этой задаче необходимо перерисовать видео в стиле, задаваемом некоторым изображением (обычно картиной известного художника).

    • Примеры: создание ярких клипов или промо-роликов, видео-фильтры в социальных сетях.

Также генерация видео используется для повышения качества исходного видео:

  • Повышение разрешения (video super-resolution, VSR).

  • Повышение частоты кадров (frame interpolation, FPS enhancement).

Поскольку видео - это последовательность кадров, представляющих собой изображения, они часто обрабатываются свёрточными операциями, описанными в отдельном разделе, но которые задействуют не только пространственную, но и временную окрестность обрабатываемого кадра.

Литература

  1. Wikipedia: Gesture recognition.

  2. Abdar M. et al. A review of deep learning for video captioning //IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2024.

  3. Википедия: фильтр Калмана.