Похожие презентации:
Лекция 2. Введение в машинное обучение
1. Применение искусственного интеллекта в магистерских научно-прикладных исследованиях
Применение искусственногоинтеллекта в магистерских научноприкладных исследованиях
ТЕМА:
Введение в машинное обучение.
Методы ИИ как исследовательские
инструменты
Лектор
Шинтемирова Айгуль Ураловна
2. Методы ИИ как исследовательские инструменты
1. Машинное обучение (классификация, регрессия, кластеризация).2. Нейронные сети и глубокое обучение.
3. Обработка естественного языка (NLP).
4. Компьютерное зрение.
5.Генеративные модели.
3. 1. Машинное обучение (классификация, регрессия, кластеризация).
• Машинное обучение[2] (англ. machine learning, ML) — классметодов искусственного интеллекта, характерной чертой которых
является не прямое решение задачи, а обучение за счёт
применения решений множества сходных задач. Для построения
таких методов используются средства математической
статистики, численных методов, математического
анализа, методов оптимизации, теории вероятностей, теории
графов, различные техники работы с данными в цифровой
форме.
4. 1.2. Примеры машинного обучения
•В психологии — алгоритм может научиться по анкетампрогнозировать вероятность стресса у человека.
•В юриспруденции — программа может предсказать исход дела
на основе тысячи похожих судебных решений.
•В маркетинге — алгоритм определяет, какие клиенты с большей
вероятностью купят продукт.
•В менеджменте — можно предсказать текучесть кадров в
компании, продажи и выручку.
•В туризме – можно предсказать потоки клиентов по
направлениям отдыха и цены
5. 1.3. Виды задач машинного обучения
• Классификация → категория (пример: тип клиента)– это процесс систематической группировки объектов (предметов, явлений, понятий) в
определенные категории или классы на основе их общих существенных признаков, что
упрощает их исследование, анализ и сравнение. Это метод организации информации и
знаний, позволяющий установить соподчиненные группы и иерархию между ними.
• Регрессия → число (пример: продажи)
– Регрессия — это защищенная задача машинного обучения , которая используется для
прогнозирования значения метки из набора связанных функций
• Кластеризация → группа (пример: сегмент клиентов)
– Кластеризация – это задача выявления похожих экземпляров на основе аналогичных
функций и их назначения кластерам на основе аналогичных экземпляров.
6. 1.4. Классификация
• Классификация — это задача, когда алгоритм распределяет объекты по заранееизвестным категориям.
• Как работает:
• Мы собираем данные (например, анкеты клиентов).
• Мы указываем алгоритму, к какой группе принадлежит каждый пример.
• Алгоритм учится и затем может классифицировать новые случаи.
• Ключевые показатели
• Количество классов
• Количество данных
Психология: классификация эмоционального состояния (радость, грусть, тревога) по данным о мимике или речи.
Юриспруденция: автоматическая сортировка документов на «контракты», «судебные иски», «законы»
Маркетинг: определение типа клиента — «лояльный» или «рискующий уйти».
Менеджмент: прогноз — уволится ли сотрудник (да/нет).
7. 1.5. Регрессия
• Регрессия — это задача прогнозирования числового значения наоснове данных.
• Как работает:
• Мы собираем данные о прошлом (например, прошлые продажи).
• Алгоритм выявляет зависимость между факторами и результатом.
• Алгоритм прогнозирует будущее значение.
• Ключевые показатели
• Количество данных
Психология: прогноз уровня тревожности по шкале от 1 до 10 на основе результатов теста.
Юриспруденция: оценка вероятности выигрыша дела в процентах.
Маркетинг: прогноз объёма продаж в следующем месяце.
Менеджмент: прогноз числа сотрудников, которые уволятся через год.
8. 1.6. Кластеризация
• Кластеризация — это метод, при котором алгоритм сам группирует объекты по сходству,без заранее заданных категорий.
• Как работает:
• У нас есть данные, но мы не знаем категорий.
• Алгоритм ищет объекты, которые похожи друг на друга.
• Формируются «кластеры» — группы с общими характеристиками.
• Ключевые показатели
• Количество данных
• Количество категорий
Психология: выделение групп пациентов с похожими симптомами, чтобы выбрать метод терапии.
Юриспруденция: объединение похожих судебных дел в кластеры для анализа практики.
Маркетинг: сегментация покупателей на группы («экономные», «импульсивные», «премиум»).
Менеджмент: группировка отделов компании по стилю работы и показателям эффективности.
9. 1.7. Сравнение методов
МетодДанные
Выход
Пример
Классификация
Метки категорий
Категория
Тип клиента
Регрессия
Числовые данные
Число
Продажи
Кластеризация
Без меток
Группа
Сегмент клиентов
10. 1.8. Машинное обучение как инструмент исследования
• машинное обучение — это инструмент, а не готовое решение. Егосила в том, что оно помогает исследователям:
• На этапе сбора данных: фильтровать лишнюю информацию,
выделять важное.
• На этапе анализа: выявлять закономерности, которые трудно
заметить человеку.
• На этапе моделирования: строить предсказательные модели.
• На этапе интерпретации: визуализировать данные, сравнивать
группы, проверять гипотезы
11. 1.9. Преимущества и ограничения
ПреимуществаОграничения
• Ускоряет анализ больших массивов данных.
• Находит скрытые связи, невидимые для
человека.
• Может использоваться в самых разных областях
(от медицины до юриспруденции).
• Нужны качественные данные (мусор на входе →
мусор на выходе).
• Алгоритм «не думает», а лишь выявляет
закономерности.
• Результаты требуют интерпретации
специалистом.
12. 2. Нейронные сети и глубокое обучение
• Нейро́нная сеть[1] (также искус́ ственная нейро́нная сеть[2], ИНС,или просто нейросе́ть) — математическая модель, а также её
программное или аппаратное воплощение, построенная по
принципу организации нервных сетей (биологических нейронных
сетей) — сетей нервных клеток (нейронов) живого организма
• Глубокая нейронная сеть (глубинная нейронная сеть, ГНС, англ.
DNN — Deep neural network) — это искусственная нейронная сеть
(ИНС) с несколькими слоями между входным и выходным
слоями[39][40]. ГНС находит корректный метод математических
преобразований, чтобы превратить входные данные в выходные,
независимо от линейной или нелинейной корреляции.
13. 2. Нейронные сети и глубокое обучение
Нейро́нная сеть – одна скрытаясвязь – применяется в логике
Глубокая нейронная сеть – несколько скрытых связей
- применяется в распознавании
14. 2.1. Основные типы нейронных сетей
1. Полносвязные сети (MLP) – базовый вариант, применяются дляклассификации и регрессии.
2. Сверточные сети (CNN) – анализ изображений, медицинских снимков,
видео.
3. Рекуррентные сети (RNN, LSTM, GRU) – работа с временными
рядами, текстами, последовательностями.
4. Трансформеры (BERT, GPT и др.) – современный стандарт анализа
текста, перевода, генерации.
5. Автоэнкодеры и GAN – генерация новых данных, восстановление
недостающей информации.
15. 2.2. Этапы применения нейронных сетей в исследовании
1. Формулировка задачи– Что мы хотим предсказать, классифицировать или сегментировать?
2. Сбор данных
– Нейросети требуют больших массивов данных: тысячи и миллионы примеров.
3. Подготовка данных
– Очистка, нормализация, разметка.
4. Построение модели
– Выбор архитектуры (CNN, RNN, трансформеры и т.д.).
5. Обучение модели
– Алгоритм находит оптимальные веса для связи между «нейронами».
6. Тестирование и валидация
– Проверка точности на новых данных.
7. Интерпретация результатов
– Важно уметь объяснить выводы модели исследователю и практику.
16. 2.3. Ограничения нейронных сетей
•Требуют больших данных и мощных вычислений.•Не всегда прозрачны («чёрный ящик»).
•Возможна переобучаемость — сеть запоминает примеры,
но не умеет обобщать.
•Не заменяют исследователя, а только помогают находить
закономерности.
17. 3. Обработка естественного языка (NLP).
• Обработка текстов на естественном языке (Natural LanguageProcessing, NLP) — общее направление искусственного
интеллекта и математической лингвистики. Оно изучает
проблемы компьютерного анализа и синтеза текстов
на естественных языках. Применительно к искусственному
интеллекту анализ означает понимание языка, а синтез —
генерацию грамотного текста.
18. 3.1. Инструменты и методы NLP
•Традиционные подходы (TF-IDF, Bag of Words) — подсчёт частотностислов, создание «векторного представления текста». (проще говоря
тематические поисковики)
•Современные методы — использование эмбеддингов (Word2Vec,
GloVe, FastText) и трансформеров (BERT, GPT). (обработчик языка, с
использованием семантических и синтаксических сходств)
•Глубокое обучение — нейросети для анализа смысловых связей в
тексте (выводы и гипотезы, обучение с учителем и без).
19. 3.2. Обучение с учителем и без учителя
• Обучение с учителем (англ. supervised learning) — это методмашинного обучения, при котором модель обучается на
размеченных данных, то есть на наборах пар "вход —
правильный выход" (стимул-реакция). (размеченные данные)
• Обучение без учителя (Unsupervised Learning) — это метод
машинного обучения, при котором модель обучается на
неразмеченных данных, самостоятельно выявляя
закономерности, взаимосвязи и скрытые структуры без
предоставления ей "правильных ответов". (кластеры,
отклонения, изменения)
• Смешанные обучения
20. 3.3. Этапы применения NLP
ЭтапыЧто делает
1. Формулировка задачи:
Что нужно сделать с текстом — классифицировать, найти
тональность, извлечь факты?
Гипотезы исследования и постановка задачи
2. Сбор корпуса данных:
статьи, интервью, нормативные акты, отзывы.
диссертации, отчёты, патенты, судебные решения, маркетинговые
исследования
3. Очистка текста:
удаление «шума» (лишние символы, стоп-слова)
Какие термины, подходы, методы чаще всего встречаются, выявляет
основные направления исследований
4. Представление текста в
числовом виде:
Статистика – сколько исследований по каждому направлению, сколько
мнений, какие они
5. Обучение модели:
выбор метода
классификация, кластеризация, анализ тональности
помогает понять, как оцениваются разные подходы
6. Интерпретация результатов:
выводы для исследования.
показывает, где есть пробелы — то есть потенциальные гипотезы для
нового исследования.
7. Внедрение в практику:
отчёты, рекомендации, прогнозы.
21. 4.1. Компьютерное зрение (CV, Computer Vision)
ЗадачиСпособ реализации
1. Классификация
изображений
определение, что изображено на картинке
(«томограмма с опухолью» или «без опухоли»,
медицинские снимки)
поиск и выделение объектов на изображении
(подсчет машин, видеонаблюдение и т.д.)
выделение контуров объектов (прорисовка улиц и
скверов, границы органов на мед снимках,
2. Детекция объектов
3. Сегментация
4. Распознавание лиц и
эмоций
5. Анализ видео
использование в криминалистике, маркетинге,
психологии
отслеживание движения объектов, изучение
поведения людей, распознавание действий.
22. 4.2. Преимущества и ограничения
Преимущества:Ограничения:
Высокая скорость анализа.
Требование больших объемов
размеченных данных
Возможность «переобучения» и
ошибок.
Этические и правовые вопросы
(например, распознавание лиц).
Возможность работы с массивами
данных, недоступными для человека.
Объективность и воспроизводимость.
23. 5. Генеративные модели
• Генеративный искусственный интеллект — типсистемы искусственного интеллекта (ИИ), способной
синтезировать текст, изображения или комбинированный
медиаконтент в ответ на подсказки[1][2]. Генеративный ИИ
использует генеративные модели, такие как большие языковые
модели[3].
• Генеративные модели ИИ - тип алгоритмов машинного обучения,
предназначенных для создания (генерации) новых данных,
которые похожи на обучающие данные.
• Обучение без учителя
24. 5.1. Примеры генеративных моделей
Особенность — способность создавать новые тексты, изображения, аудио и даже 3D-объекты,которые выглядят реалистично и содержат новые комбинации признаков.
• Основные задачи генеративных моделей:
• Генерация новых данных (изображений, текстов, звуков).
• Восстановление недостающих данных (например, дорисовка фрагментов изображения).
• Синтетические данные для исследований (создание больших наборов данных, если реальных
данных мало).
• Моделирование гипотез (например, прогнозирование эволюции биологических систем).
•Текстовые модели (ChatGPT, Gemini, Claude).
•Генерация изображений (Stable Diffusion, MidJourney, DALL·E).
•Генерация музыки и видео (Suno, Runway).
25. 5.2. Использование генеративных моделей
Сфера примененияПримеры применения
Медицина
• Создание синтетических данных для обучения диагностических систем (когда реальных
данных мало).
• Моделирование роста опухолей, прогнозирование распространения болезней.
• Генерация 3D-моделей органов для планирования операций.
Биология и химия
• Генерация молекулярных структур для поиска новых лекарств.
• Моделирование взаимодействия белков.
• Синтетические данные для экспериментов, которые сложно провести в лаборатории.
Экология и
география
• Генерация климатических сценариев.
• Восстановление недостающих спутниковых данных.
• Симуляции для оценки последствий природных катастроф.
Социальные науки
• Генерация больших массивов текстов для анализа.
• Создание моделей поведения людей в кризисных ситуациях.
• Синтетические интервью или опросы для предварительной апробации гипотез.
Образование и
наука
• Автоматическое написание черновиков статей, отчетов, резюме литературы.
• Виртуальные симуляторы для обучения студентов.
• Генерация задач и тестов.
26. 5.3. Преимущества и ограничения
Преимущества:Ограничения:
Возможность работать с данными,
которые в реальности собрать сложно
или дорого.
Ускорение научных исследований.
Риск создания нереалистичных или
ложных данных («галлюцинации»
моделей).
Этика и правовые вопросы: дипфейки,
плагиат, авторские права.
Большие вычислительные ресурсы и
энергозатраты.
Автоматизация креативных
процессов.
Генерация гипотез и сценариев.
Опасность злоупотреблений
(фальсификация исследований,
манипуляция общественным
мнением).
27. Семинарское задание 3
• Краткое содержание задания:• 1. С помощью ИИ по
анализу Claude (Anthropic) , Perplexity AI , Scite.ai, Semantic Schol
ar предоставить перечень 10-15 статей, заинтересовавших вас.
• 2. загрузить статьи в chat GPT, сгененировать гипотезы по
дальнейшему исследованию
• 3. по слайду 3.3. Этапы применения NLP – проверить все
класеризации, гиптезы и выводы
• 4. проверить статьи и результаты на плагиат