Похожие презентации:
01_meth
1. 02. Подходы в современной компьютерной лингвистике
2. Подходы в компьютерной лингвистике
• До 90-х годов 20 века– Model-driven – модели, словари, правила
• 90-е годы – «статистическая революция»
• C 2005
– Data-driven – подходы, основанные на
закономерностях, обнаруженных в данных
– => статистические подходы, машинное обучение
• C 2014 года нейронные сети
• С 2022-2023 г. большие языковые модели
3. Текстовые коллекции
• Специализированные порталы (литература,геология…) – электронные библиотеки
• Интернет
• Специальные лингвистически размеченные
корпуса
• Текстовые коллекции с пользовательской
разметкой (Wikipedia)
• Использование в компьютерной лингвистике
– Изучение явлений «глазами» для составления
словарей, правил
– Статистические модели
– Машинное обучение
4. Данные
• Размеченные данные– Развитие алгоритмов, воспроизводящих
ручную разметку
– Машинное обучение с учителем
(supervised machine learning)
• Неразмеченные данные
– Набор данных (тексты, речь, диалоги)
– Автоматический вывод закономерностей
– Машинное обучение без учителя
(unsupervised machine learning)
5. Разметка данных
• Экспертная разметка– Дорого
– Может не отражать восприятие «обыкновенных» людей
• Краудсорсинг – набор неквалифицированных людей для
подготовки данных
– Подготовка заданий
– Вознаграждение
– Контроль качества
• Пользовательская разметка (user-generated content)
– Хэштеги и смайлики для твитов
– Ссылки в Википедии
• Естественно размеченные данные
– Предсказание соседних слов
– Предсказание соседнего предложения
6. Национальный корпус русского языка: состав
• Основной корпус– Тексты XVIII-сер. XX веков
– Тексты после сер. XX
• Морфологическая разметка, неоднозначность
снята
• Газетный корпус (2000-е годы)
• Корпус параллельных текстов (англо-русский,
немецко-русский, русско-украинский)
• Корпус диалектных текстов
• Корпус поэтических текстов
• Корпус устной речи (расшифровка записей) и
др.
7. Фрагмент морфологической разметки в Национальном корпусе русского языка
Я сидел на барском сиденье, дышал горячим ветром, бившим в лицо,
ощущая в то же время не истребимую никакими сквозняками пыль и
легкий запах духов -- катафалк с хорошей скоростью мчался по шоссе
на юг. (Ю. Трифонов)
<s>Я {я=S,ед,од=им} сидел{сидеть=V,несов=изъяв,прош,ед,муж}
на{на=PR} барском{барский=A=ед,сред,пр}
сиденье{сиденье=S,сред,неод=ед,пр},
дышал{дышать=V,несов=изъяв,прош,ед,муж}
горячим{горячий=A=ед,муж,твор} ветром{ветер=S,муж,неод=ед,твор},
бившим{бить=V,несов=прич,прош,ед,муж,твор} в{в=PR}
лицо{лицо=S,сред,неод=ед,вин},
ощущая{ощущать=V=несов,деепр,непрош} в{в=PR}
то{тот=A=ед,сред,вин} же{же=PART}
время{время=S,сред,неод=ед,вин} не{не=PART}
истребимую{истребимый=A=ед,жен,вин}
никакими{никакой=A=мн,твор}
сквозняками{сквозняк=S,муж,неод=мн,твор}
пыль{пыль=S,жен,неод,ед=вин} и{и=CONJ}
легкий{легкий=A=ед,муж,вин,неод} запах{запах=S,муж,неод=ед,вин}…
8. Экспертная разметка:SyntagRus
• SintagRus• FrameNet
9. Краудсорсинг
• Специальные платформы:– Mechanical Turk (Mturk) – мало русскоязычных
разметчиков
– Yandex Toloka
• Индивидуальные проекты сбора ответов
людей
• Игры со специальной целью: Game with a
purpose (GWAP)
– Как сделать так, чтобы многим людям было
интересно играть и тем самым цель игры
достигалась
10.
11.
12.
13. Платформа для краудсорсинга на русском языке: Толока (https://toloka.yandex.ru/)
14. Пример:Определение тональности твитов
15. Пример: оценка семантической близости слов
16. User-generated (пользовательский) content
• Пользовательский контент– Википедия
– Социальные сети
• Разметка
– Смайлики в Twitter
– Ссылки в Википедии
– Википедия: статьи на одну и ту же на разных языках
• Множество научных исследований этих
ресурсов, в том числе
– с точки зрения лингвистики,
– с точки зрения приложений автоматической
обработки текстов
17. Размеченные данные и машинное обучение
• =задача с учителем=supervised algorithm• Дано:
– набор классов
– примеры, отнесенные к этим классам
• Нужно:
– Выработать алгоритм, который на основе
имеющихся данных будет классифицировать новые
примеры
• Методы:
– Байесовский классификатор
– Деревья решений
– Метод опорных векторов
– Нейронные сети (!!!)
18. Естественно размеченные данные
• Предсказание слов в контексте– Позволяет сгруппировать близкие по
смыслу слова
• Предобучение нейросетевых моделей
предсказывать следующее слово
– Модели предобучаются на больших
объемах текстовых данных (терабайты)
19. Обучение нейронной сети для формирование представлений слов в виде векторов – эмбеддинги
Mikolov 2013: 2 базовые архитектуры нейронных сетей:▪ Continuous Bag of Word (CBOW): использует окно контекста для
предсказания слова
▪ Skip-gram (SG): используется слово для предсказания
окружающих слов
▪ Могут обучаться на больших объемах текстовых данных
20. Проект Rusvectores
21. Учет контекста. Механизм самовнимания. Архитектура трансформер (Attention is all you need, 2017)
22. Большие языковые модели
Идея переноса обучения: обучить модель на
большом объеме неразмеченных данных
Затем использовать полученные представления
слов для решения нужно задачи
– BERT (2019) – энкодер трансформера, ->
обучается предсказывать маскированные
слова -> контекстуализированные векторные
представления,
– GPT (2018) – декодер трансформера,
обучается порождать тексты
23. Самовнимание в порождающих моделях
2324. Предобученные нейронные сети
25. Ограничения больших языковых моделей Minaee S. et al. Large language models: A survey //arXiv preprint arXiv:2402.06196. –
2024.У них нет состояния/памяти. LLM
сами по себе не могут вспомнить
даже то, что им было отправлено в
предыдущем запросе.
Они
стохастические/вероятностные.
Если вы отправите один и тот же
запрос LLM несколько раз, вы,
скорее всего, получите разные
ответы.
У них устаревшая информация, и
сами по себе они не имеют доступа
к внешним данным. LLM сам по
себе даже не знает о текущем
времени или дне и не имеет
доступа к какой-либо информации,
которая не присутствовала в его
обучающем наборе.
Они, как правило, очень
большие. Это означает, что для
обучения и обслуживания
требуется много дорогостоящих
машин GPU.
Они галлюцинируют. LLM не
имеют понятия «истины», и их
обычно обучали на смеси
хорошего и плохого контента.
Они могут давать очень
правдоподобные, но
неправдивые ответы.
26. Русификация больших языковых моделей Модели RuAdapt (Tikhomirov, Chernyshev, 2024)
Правильная токенизация текстов на
русском языке
Модель присутствует на лидербордах
русскоязычных бенчмарков Mera, Llmarena.ru.
27. LLM arena: сравнение русскоязычных моделей
28. Закон Ципфа
Имеются большие текстовые данные.Какое распределение частот разных слов?
29. Проблема статистических методов при обработке текстов
• Закон Ципфа– Упорядочиваем слова по мере снижения частоты
встречаемости (ранг r – позиция в тексте):
– f*r=k
– частота встречаемости слова обратно пропорциональна рангу
• В любом тексте, коллекции текстов
– Небольшое число частотных слов
– Среднее число среднечастотных слов
– Большое число редких слов
• Проблема применения статистики (sparse data):
– Много слов употребляется редко (!),
– Большинство только один раз («длинный хвост»)
30. Частоты слов в «Том Сойер»
31. График распределения частот слов по закону Ципфа
32. Закон Ципфа и интернет-спам
• Поисковая оптимизация– Увеличение количества ключевых слов на
странице
• Но: нарушение закона Ципфа
– Поисковые машины (Google, Yandex)
проверяют тексты на «естественность»
– Если закона Ципфа не соблюдается, то
• понижают рейтинг сайтов с «подозрительными»
текстами,
• либо вообще банят такие сайты.
33. Задание 1
• Взять художественное произведение неменее 50 страниц
• Извлечь слова
– Убрать капитализацию (т.е. большие
буквы)
– Отделить слова от знаков препинания
• Посчитать частоты слов
– Выдать упорядоченный список
– Выполняется ли закон Ципфа
34. Задание-2
• Выбрать одно из следующих слов:– Скраб
– Короб
– Откат
– Распил
– Бачок
– Халтура
– Шпажка
– Ватрушка
– Схрон
– Корзина
– Прикол
– Опция
– Гламур
– Вброс
– Середняк
35. Задание 2
• Посмотреть значения и толкования слов всловарях Даля, Ушакова, Ожегова, Кузнецова
– http://dic.academic.ru/
• Употребление этого слова в корпусе русского
языка (ruscorpora.ru)
– В основном корпусе до середины 20 века
– В основном корпусе (после сер. 20 века)
– В газетном корпусе
• Употребление этого слова в Яндекс-новостях
• Представить отчет о сходствах-различиях в
словарных описаниях, реальном
употреблении
36. Структура отчета
• Слово• Толкования в словарях: сходстворазличие
• Употребление в корпусах
– Сходство-различие в употреблении
• Соответствия между толкованиями и
реальными употреблениями
– Например, в словарях нет какого-то
значения
• Выводы