5.56M
AI

presentation (1)

1.

Работа на тему:
Использование архитектуры трансформеров для задачи
классификации рентгеновских снимков на наличие
пневмонии
Митрофанов Л. А.
Институт вычислительной математики и информационных технологий
Направление: 01.03.04 — прикладная математика
Группа 09-321
Научный руководитель:
Тумаков Д. Н. — к. ф.-м. н., доцент кафедры прикладной математики и ИИ
Казань, 2026

2.

СОДЕРЖАНИЕ
Введение
1. Данные и ось заморозки
2. Результаты
3. Что не подтвердилось
Заключение
2

3.

ВВЕДЕНИЕ. Постановка задачи
Полное дообучение и линейный пробинг — концы
одного отрезка
Ранние слои переносятся, поздние
специализированы
Между ними лежат уровни, задаваемые длиной замороженного
префикса блоков; обучение с нуля стоит вне отрезка слева.
Дообучение целиком берут по умолчанию, хотя это только одна из
точек
Края и текстуры универсальны; классы ImageNet с
рентгенограммой общего почти не имеют. Положение границы
измеряется, а не выводится: веса вдоль глубины у свёрток и у
внимания разложены по-разному
Цель
Измерить, какую долю предобученного на ImageNet-1k бэкбона имеет смысл переносить на классификацию рентгенограмм, и одинаков ли
ответ у свёрточных сетей и у сетей с вниманием
3

4.

1. Данные: утечка снята по построению
67 % снимков — у пациентов с несколькими
снимками
Официальное разбиение Kermany режется по снимку, поэтому
валидация делит пациентов с обучением, а по ней отбираются
чекпоинт и порог. Идентификатор пациента есть только в имени
файла — набор берётся с Kaggle, у зеркал имён нет
3117 групп на 3118 пациентов
Один и тот же снимок лежит в наборе под двумя именами, а
идентификатор пациента берётся из имени — и получаются два
пациента вместо одного. Поэтому группа не пациент, а компонента
связности графа, где снимки соединены отношением "тот же
пациент" или "тот же снимок" при расстоянии Хэмминга не более 8
Пересечение групп 0/0/0, минимальное расстояние 11 при пороге 8
Проверки не предупреждают, а бросают исключение: группа в двух частях сразу или снимок теста, дублирующий обучение, останавливают
расчёт. Предобучение тест не видело — веса только с ImageNet-1k, где рентгенограмм нет, а ветвь с нуля обходится без него вовсе
4

5.

1. Ось заморозки строится по доле весов
10 % и 20 % глубины ResNet-50 — это
0,4 % и 0,7 % весов
Сетка 10/20/50/80/90 портится с обоих концов:
внизу два уровня различаются на 0,3 % весов и
ставят один опыт дважды, вверху между 90 % и
100 % глубины остаются 38 % весов без единого
уровня
Шесть уровней минимизируют
максимальный разрыв по весам
Из всех префиксов блоков берутся шесть, концы
обязательны; при равных максимальных
разрывах побеждает набор с большим
минимальным. Седьмой уровень у Swin-T,
MaxViT-T и ResNet-50 — дубликат
Половина глубины ConvNeXt-T — 18,5
% весов, DeiT3-S — 42,7 %
Свёртки держат массу параметров в поздних
стадиях, ViT распределяет её по блокам
равномерно
Рисунок 1 — накопление весов вдоль глубины и выбранные уровни заморозки
5

6.

2. Оптимум: 12—23 % замороженных весов
Семь моделей из девяти попадают в
эту полосу
ResNet-50 уходит на 36 %. У DeiT3-S лучшим
вышел ноль, но соседние 18 % и 34 % отличаются
на +0,0002 и −0,0003 при p 0,89 и 0,79 — выбор
сделан внутри разброса
Вокруг оптимума широкое плато
У пяти моделей из девяти половина оси и больше
неотличима от лучшей ячейки по парному
бутстрапу; у EffNetV2-S и DeiT3-S — пять уровней
из шести
Края отрезка несимметричны
Линейный пробинг проигрывает у всех девяти при
p < 0,001, от 0,0096 до 0,0329. Обучение с нуля
тоже проигрывает всем, но у EffNetV2-S и
MaxViT-T всего на 0,0040 и 0,0043
Рисунок 2 — AUROC и специфичность при чувствительности 95 % вдоль оси заморозки
6

7.

2. Модели между собой почти не различаются
Девять лучших ячеек укладываются в
0,9901—0,9944
Размах между моделями 0,0043; размах по оси
заморозки внутри одной модели — от 0,0095 у
EffNetV2-S до 0,0334 у MaxViT-T
Пять значимых пар из 36
Все разности 0,0019—0,0025, четыре пары из
пяти — ViT-S против кого-нибудь. МакНемар даёт
18 пар: он сравнивает решения, а не качество, и
ловит расхождение при равном числе ошибок
Совпадая в качестве, расходятся в
доводах
Один снимок, ответ у всех от 0,994 до 1,000, а
карты Grad-CAM разные: у свёрток вклад
сплошной, у ViT-S дробится на полосы поперёк
рёбер, у DeiT3-S рассыпается на очаги, у Swin-T
покрывает оба поля
Рисунок 3 — один снимок глазами семи моделей; тёплое — вклад за пневмонию,
холодное — за норму
7

8.

3. Что не подтвердилось
Свёртки 18—36 %, внимание 0—18 %
Ожидался обратный порядок: свёрточная локальность верна и для
рентгенограммы, значит замораживать у свёрток можно больше.
Наблюдаемый порядок обратен ожидаемому и нерегулярен
Интервалы ConvNeXt-T и ViT-S совпадают почти
целиком
[+0,0112; +0,0222] против [+0,0117; +0,0232]. Ожидалось, что без
предобучения внимание теряет заметно больше; крайние строки
это подтверждают, середина перемешана
ViT-S и DeiT3-S: одна архитектура, оптимум 18 % против нуля
Один класс VisionTransformer, двенадцать блоков, различие — двадцать четыре скаляра LayerScale. Качество 0,9944 против 0,9923 при p =
0,016, на линейном пробинге модели меняются местами. Объяснить это архитектурой нечем, остаётся рецепт предобучения
8

9.

3. Задача решается мимо лёгких
С нуля: окружение 0,7693 против
лёгких 0,5852
У ConvNeXt-T, DeiT3-S и DeiT3-B по одним лёгким
выходит ниже монеты; окружение впереди у
девяти моделей из девяти
Предобучение смещает опору внутрь
лёгких
На лучших уровнях условие "только лёгкие" даёт
уже 0,79—0,94. Но по всем 54 ячейкам счёт
"лёгкие против окружения" ровно 27:27: глубина
заморозки на распределение опоры не влияет
0,99 — не мера распознавания
пневмонии
Значительная часть задачи решается за
пределами лёгочных полей. Сравнение уровней
заморозки от этого не страдает: все ячейки
эксплуатируют один и тот же обходной путь и
сравниваются на равных
Рисунок 4 — качество на взрослом наборе без дообучения в трёх условиях видимости
кадра
9

10.

ЗАКЛЮЧЕНИЕ
Первую пятую бэкбона можно заморозить без
потерь
Последнюю треть размораживать обязательно. Выигрыш идёт в
память и число обучаемых параметров, а не в качество;
положение оптимума определяется парой "задача и
предобучение", а не размером сети
Деления по семействам архитектур нет
По семействам не делятся ни положение оптимума, ни величина
выигрыша от предобучения. Определяющей переменной оказался
рецепт предобучения, а не механизм вычисления признаков
Порог не переносится вместе с весами
Снятый на педиатрии под чувствительность 0,95, на взрослых он
даёт медианные 0,918 и роняет специфичность с 0,962 до 0,717
63 ячейки по три повтора, 35 часов на одной
видеокарте
Расчёт прошёл без единой упавшей стадии. Сверх основной
матрицы — перенос на взрослую популяцию в трёх условиях
видимости кадра
10
English     Русский Правила