960.90K
AI

Algoritmy-poiska-videofajlov (1)

1.

НГУ · 4 КУРС · ИНФОРМАЦИОННЫЙ ПОИСК
Алгоритмы поиска
видеофайлов
СЕМИНАР ПО СОВРЕМ ЕН Н Ы М IR-СИСТЕМАМ
От классических визуальных дескрипторов к фундаментальным
мультимодальным нейросетям.
Семантический разрыв · Общие эмбеддинги · Векторные индексы

2.

ПОСТАНОВКА ЗАДАЧИ
В чём сложность поиска видео?
Три фундаментальных барьера отделяют пиксельный поток от релевантной выдачи.
01
СЕМАНТИКА
02
ВРЕМЯ
Семантический разрыв
Временная динамика
Огромная дистанция между
матрицами пикселей RGB и
высокоуровневым смыслом
сцены в запросе
пользователя.
Смысл действия
раскрывается только в
последовательности
кадров во времени, а не в
статичной фотографии.
03
ВЫЧИСЛЕНИЯ
Вычислительная
сложность
Колоссальная
избыточность сырого
потока при 30 FPS требует
агрессивного
сэмплирования и сжатия
признаков.
VIDEO RETRIEVAL CHALLENGES · MULTIMODAL INFORMATION RETRIEVAL
02

3.

ЦВЕТОВАЯ СЕТКА
КЛАССИЧЕСКИЙ ПОДХОД
Color Layout Descriptor (CLD)
Поиск по
глобальным
признакам
Кадр разбивается на блоки 8×8; для каждого блока вычисляется средний
цвет в пространстве YCbCr с последующим DCT-преобразованием.
Стандарт MPEG-7: эвристические
дескрипторы цвета, текстур и
движения.
ГРАНИ И ТЕКСТУРЫ
Ключевое ограничение:
алгоритм фиксирует физический
сигнал, но остаётся абсолютно
«слепым» к абстрактному
смыслу происходящего в кадре.
Edge Histogram Descriptor (EHD)
Пространственное распределение пяти типов граней: вертикальные,
горизонтальные, диагонали 45°/135° и ненаправленные контуры.
ДИНАМИКА КАДРА
Motion Activity Descriptor
Интенсивность и направление векторов движения между соседними
кадрами; отличает статичную сцену от быстрой погони.
MPEG-7 VISUAL STANDARD (ISO/IEC 15938 -8)
03

4.

ЛОКАЛЬНЫЕ ДЕСКРИПТОРЫ
SIFT и Bag of Visual Words
Адаптация классического текстового поиска к визуальным ключевым точкам.
01
02
03
04
Детекция SIFT
Словарь K-Means
Квантование
ЭТАП 1
ЭТАП 2
ЭТАП 3
Инвертированный
индекс
Поиск экстремумов DoG,
расчет градиентов и
генерация инвариантных
128-мерных векторов
ключевых точек.
Кластеризация миллионов
дескрипторов обучающей
выборки; центроиды
кластеров становятся
«визуальными словами».
Каждый SIFT-дескриптор
кадра проецируется на
ближайший центроид.
Кадр превращается в
мешок визуальных слов.
ВЫХОД
ОБЪЁМ
ФОРМАТ
МЕТРИКА
{vᵢ} ∈ ℝ¹²⁸
K центроидов
Гистограмма токенов
TF-IDF Скоринг
ЭТАП 4
Ранжирование кадров по
весам TF-IDF визуальных
слов с использованием
стандартного обратного
индекса из IR.
SIVIC & ZISSERMAN (ICCV 2003) · VIDEO GOOGLE ARCHITECTURE
04

5.

МУЛЬТИМОДАЛЬНЫЙ ПОДХОД
Общее векторное пространство
Текстовый и видеокодировщики проецируют запрос и последовательность кадров в единое пространство ℝᴰ. Косинусное
сходство превращает семантическую близость в сигнал ранжирования.
TEXT ENCODER
VIDEO ENCODER
NEAREST NEIGHBORS
Вектор запроса
Вектор видео
Релевантные результаты
05

6.

СЕТЕВАЯ АРХИТЕКТУРА
CLIP4Clip: стратегии агрегации кадров
Как собрать эмбеддинги отдельных кадров в единое векторное представление сцены?
ТИП 1 · БЕЗ ПАРАМЕТРОВ
ТИП 2 · ПОСЛЕДОВАТЕЛЬНЫЙ
ТИП 3 · ПЛОТНОЕ ВЗАИМОДЕЙСТВИЕ
Parameter-Free Type
Sequential Type
Tight Type
Mean Pooling: простое
покомпонентное усреднение
векторов кадров. Крайне
эффективно для инференса, но
полностью теряет порядок
событий во времени.
Temporal Transformer / LSTM
поверх кадров. Учитывает
хронологию и динамику
действий, создавая
контекстуализированный
глобальный вектор.
Cross-Attention между каждым
словом запроса и каждым
кадром видео. Даёт
максимальное качество
ранжирования ценой
медленного попарного скоринга.
Cost: O(1) FLOPs
Cost: O(T²) FLOPs
Cost: O(N·T·L) онлайн
LUO ET AL. · CLIP4CLIP: AN EMPIRICAL STUDY OF CLIP FOR END TO END VIDEO TEXT RETRIEVAL
06

7.

GLOBAL SIMILARITY
ТОНКОЕ ВЫРАВНИВАНИЕ
X-CLIP и механизм
AOSM
Глобальный уровень (Coarse-Grained)
Сопоставление общего представления всего видеоролика с полным
текстом поискового запроса. Грубый отбор кандидатов.
Multi-Grained Learning:
параллельный поиск связей на
двух уровнях абстракции.
FRAME-WORD MATRIX
Локальный уровень (Fine-Grained via AOSM)
AOSM
Attention Over Similarity Matrix
Механизм отсекает шумные нерелевантные
кадры, фокусируя градиенты только на
смысловых совпадениях «кадр — слово».
Матрица попарного сходства T×L между каждым кадром t и словом l;
AOSM вычисляет веса внимания по строкам и столбцам.
Кадр
Слово
t₁
l₁
t₂
«Дрифт»
t₃
«Трасса»
MA ET AL. · X-CLIP: END-TO-END MULTIGRAINED CONTRASTIVE TUNING
07

8.

FOUNDATION MODELS
InternVideo2: Video
Foundation Models
3D Spatio-Temporal ViT
Прямое моделирование пространства и времени.
Masked Video Modeling
Восстановление замаскированных кадров и пространственных
блоков.
Zero-Shot Search
Поиск по длинным описаниям без предварительной ручной
разметки.
08

9.

ИНФРАСТРУКТУРА IR-СИСТЕМ
Индексация и поиск с помощью FAISS / HNSW
Архитектура production-конвейера: разделение офлайн-пайплайна и быстрого онлайн-поиска.
01
02
03
Офлайн: Извлечение
Индексация: Базы векторов
Онлайн: ANN-Поиск
ШАГ 1
ШАГ 2
ШАГ 3
Декодирование видеопотока,
выборка ключевых кадров и расчет
векторных представлений
нейросетевым энкодером.
Построение графов HNSW или
квантование IVF-PQ в векторных
хранилищах (FAISS, Milvus, Qdrant)
для быстрого масштабирования.
Кодирование пользовательского
запроса за миллисекунды и поиск k
ближайших соседей с суб-линейной
сложностью O(log N).
ТЕХНОЛОГИЯ
ИНДЕКС
ЗАДЕРЖКА
GPU Worker / FFMPEG
HNSW / IVF-PQ
< 15 мс на запрос
APPROXIMATE NEAREST NEIGHBORS (ANN) · VECTOR DATABASE BENCHMARKS
09

10.

МЕТРИКИ И ЗАКЛЮЧЕНИЕ
Оценка IR-систем и итоги
ПОЛНОТА ВЫДАЧИ
РАНГ ЦЕЛИ
ТОЧНОСТЬ РАНЖИРОВАНИЯ
Доля запросов, где целевое видео
найдено среди первых K позиций (R@1,
R@5, R@10).
Медианный ранг первого релевантного
ролика в списке выдачи (меньше —
лучше).
Mean Average Precision — интегральная
площадь под Precision-Recall кривой.
Recall@K
MedR
mAP
Ключевой итог эволюции: переход от эвристического анализа цвета и граней к сквозному обучению в едином
мультимодальном пространстве, позволяющему искать видеоконтент по тонкому контексту на естественном
языке.
English     Русский Правила