Похожие презентации:
Algoritmy-poiska-videofajlov (1)
1.
НГУ · 4 КУРС · ИНФОРМАЦИОННЫЙ ПОИСКАлгоритмы поиска
видеофайлов
СЕМИНАР ПО СОВРЕМ ЕН Н Ы М IR-СИСТЕМАМ
От классических визуальных дескрипторов к фундаментальным
мультимодальным нейросетям.
Семантический разрыв · Общие эмбеддинги · Векторные индексы
2.
ПОСТАНОВКА ЗАДАЧИВ чём сложность поиска видео?
Три фундаментальных барьера отделяют пиксельный поток от релевантной выдачи.
01
СЕМАНТИКА
02
ВРЕМЯ
Семантический разрыв
Временная динамика
Огромная дистанция между
матрицами пикселей RGB и
высокоуровневым смыслом
сцены в запросе
пользователя.
Смысл действия
раскрывается только в
последовательности
кадров во времени, а не в
статичной фотографии.
03
ВЫЧИСЛЕНИЯ
Вычислительная
сложность
Колоссальная
избыточность сырого
потока при 30 FPS требует
агрессивного
сэмплирования и сжатия
признаков.
VIDEO RETRIEVAL CHALLENGES · MULTIMODAL INFORMATION RETRIEVAL
02
3.
ЦВЕТОВАЯ СЕТКАКЛАССИЧЕСКИЙ ПОДХОД
Color Layout Descriptor (CLD)
Поиск по
глобальным
признакам
Кадр разбивается на блоки 8×8; для каждого блока вычисляется средний
цвет в пространстве YCbCr с последующим DCT-преобразованием.
Стандарт MPEG-7: эвристические
дескрипторы цвета, текстур и
движения.
ГРАНИ И ТЕКСТУРЫ
Ключевое ограничение:
алгоритм фиксирует физический
сигнал, но остаётся абсолютно
«слепым» к абстрактному
смыслу происходящего в кадре.
Edge Histogram Descriptor (EHD)
Пространственное распределение пяти типов граней: вертикальные,
горизонтальные, диагонали 45°/135° и ненаправленные контуры.
ДИНАМИКА КАДРА
Motion Activity Descriptor
Интенсивность и направление векторов движения между соседними
кадрами; отличает статичную сцену от быстрой погони.
MPEG-7 VISUAL STANDARD (ISO/IEC 15938 -8)
03
4.
ЛОКАЛЬНЫЕ ДЕСКРИПТОРЫSIFT и Bag of Visual Words
Адаптация классического текстового поиска к визуальным ключевым точкам.
01
02
03
04
Детекция SIFT
Словарь K-Means
Квантование
ЭТАП 1
ЭТАП 2
ЭТАП 3
Инвертированный
индекс
Поиск экстремумов DoG,
расчет градиентов и
генерация инвариантных
128-мерных векторов
ключевых точек.
Кластеризация миллионов
дескрипторов обучающей
выборки; центроиды
кластеров становятся
«визуальными словами».
Каждый SIFT-дескриптор
кадра проецируется на
ближайший центроид.
Кадр превращается в
мешок визуальных слов.
ВЫХОД
ОБЪЁМ
ФОРМАТ
МЕТРИКА
{vᵢ} ∈ ℝ¹²⁸
K центроидов
Гистограмма токенов
TF-IDF Скоринг
ЭТАП 4
Ранжирование кадров по
весам TF-IDF визуальных
слов с использованием
стандартного обратного
индекса из IR.
SIVIC & ZISSERMAN (ICCV 2003) · VIDEO GOOGLE ARCHITECTURE
04
5.
МУЛЬТИМОДАЛЬНЫЙ ПОДХОДОбщее векторное пространство
Текстовый и видеокодировщики проецируют запрос и последовательность кадров в единое пространство ℝᴰ. Косинусное
сходство превращает семантическую близость в сигнал ранжирования.
TEXT ENCODER
VIDEO ENCODER
NEAREST NEIGHBORS
Вектор запроса
Вектор видео
Релевантные результаты
05
6.
СЕТЕВАЯ АРХИТЕКТУРАCLIP4Clip: стратегии агрегации кадров
Как собрать эмбеддинги отдельных кадров в единое векторное представление сцены?
ТИП 1 · БЕЗ ПАРАМЕТРОВ
ТИП 2 · ПОСЛЕДОВАТЕЛЬНЫЙ
ТИП 3 · ПЛОТНОЕ ВЗАИМОДЕЙСТВИЕ
Parameter-Free Type
Sequential Type
Tight Type
Mean Pooling: простое
покомпонентное усреднение
векторов кадров. Крайне
эффективно для инференса, но
полностью теряет порядок
событий во времени.
Temporal Transformer / LSTM
поверх кадров. Учитывает
хронологию и динамику
действий, создавая
контекстуализированный
глобальный вектор.
Cross-Attention между каждым
словом запроса и каждым
кадром видео. Даёт
максимальное качество
ранжирования ценой
медленного попарного скоринга.
Cost: O(1) FLOPs
Cost: O(T²) FLOPs
Cost: O(N·T·L) онлайн
LUO ET AL. · CLIP4CLIP: AN EMPIRICAL STUDY OF CLIP FOR END TO END VIDEO TEXT RETRIEVAL
06
7.
GLOBAL SIMILARITYТОНКОЕ ВЫРАВНИВАНИЕ
X-CLIP и механизм
AOSM
Глобальный уровень (Coarse-Grained)
Сопоставление общего представления всего видеоролика с полным
текстом поискового запроса. Грубый отбор кандидатов.
Multi-Grained Learning:
параллельный поиск связей на
двух уровнях абстракции.
FRAME-WORD MATRIX
Локальный уровень (Fine-Grained via AOSM)
AOSM
Attention Over Similarity Matrix
Механизм отсекает шумные нерелевантные
кадры, фокусируя градиенты только на
смысловых совпадениях «кадр — слово».
Матрица попарного сходства T×L между каждым кадром t и словом l;
AOSM вычисляет веса внимания по строкам и столбцам.
Кадр
Слово
t₁
l₁
t₂
«Дрифт»
t₃
«Трасса»
MA ET AL. · X-CLIP: END-TO-END MULTIGRAINED CONTRASTIVE TUNING
07
8.
FOUNDATION MODELSInternVideo2: Video
Foundation Models
3D Spatio-Temporal ViT
Прямое моделирование пространства и времени.
Masked Video Modeling
Восстановление замаскированных кадров и пространственных
блоков.
Zero-Shot Search
Поиск по длинным описаниям без предварительной ручной
разметки.
08
9.
ИНФРАСТРУКТУРА IR-СИСТЕМИндексация и поиск с помощью FAISS / HNSW
Архитектура production-конвейера: разделение офлайн-пайплайна и быстрого онлайн-поиска.
01
02
03
Офлайн: Извлечение
Индексация: Базы векторов
Онлайн: ANN-Поиск
ШАГ 1
ШАГ 2
ШАГ 3
Декодирование видеопотока,
выборка ключевых кадров и расчет
векторных представлений
нейросетевым энкодером.
Построение графов HNSW или
квантование IVF-PQ в векторных
хранилищах (FAISS, Milvus, Qdrant)
для быстрого масштабирования.
Кодирование пользовательского
запроса за миллисекунды и поиск k
ближайших соседей с суб-линейной
сложностью O(log N).
ТЕХНОЛОГИЯ
ИНДЕКС
ЗАДЕРЖКА
GPU Worker / FFMPEG
HNSW / IVF-PQ
< 15 мс на запрос
APPROXIMATE NEAREST NEIGHBORS (ANN) · VECTOR DATABASE BENCHMARKS
09
10.
МЕТРИКИ И ЗАКЛЮЧЕНИЕОценка IR-систем и итоги
ПОЛНОТА ВЫДАЧИ
РАНГ ЦЕЛИ
ТОЧНОСТЬ РАНЖИРОВАНИЯ
Доля запросов, где целевое видео
найдено среди первых K позиций (R@1,
R@5, R@10).
Медианный ранг первого релевантного
ролика в списке выдачи (меньше —
лучше).
Mean Average Precision — интегральная
площадь под Precision-Recall кривой.
Recall@K
MedR
mAP
Ключевой итог эволюции: переход от эвристического анализа цвета и граней к сквозному обучению в едином
мультимодальном пространстве, позволяющему искать видеоконтент по тонкому контексту на естественном
языке.