AI-For-Beginners/translations/ru/lessons/5-NLP/15-LanguageModeling
localizeflow[bot] 7a7aeb92a1 chore(i18n): sync translations with latest source changes (chunk 1/1, 203 changes) 2026-01-30 01:10:04 +00:00
..
lab chore(i18n): sync translations with latest source changes (chunk 1/1, 203 changes) 2026-01-30 01:10:04 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 12:35:46 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 12:35:46 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 203 changes) 2026-01-30 01:10:04 +00:00

README.md

Моделирование языка

Семантические векторы, такие как Word2Vec и GloVe, на самом деле являются первым шагом к моделированию языка — созданию моделей, которые каким-то образом понимают (или представляют) природу языка.

Тест перед лекцией

Основная идея моделирования языка заключается в обучении моделей на неразмеченных данных в несупервизируемом режиме. Это важно, потому что у нас есть огромные объемы неразмеченного текста, в то время как количество размеченного текста всегда будет ограничено усилиями, которые мы можем потратить на разметку. Чаще всего мы можем создавать языковые модели, которые способны предсказывать пропущенные слова в тексте, так как легко замаскировать случайное слово в тексте и использовать его как обучающий пример.

Обучение векторов

В предыдущих примерах мы использовали заранее обученные семантические векторы, но интересно понять, как эти векторы можно обучать. Существует несколько подходов:

  • Моделирование языка с помощью N-грамм, когда мы предсказываем токен, основываясь на N предыдущих токенах (N-граммы).
  • Непрерывный мешок слов (Continuous Bag-of-Words, CBoW), когда мы предсказываем центральный токен W_0 в последовательности токенов W_{-N}, ..., W_N.
  • Skip-gram, где мы предсказываем набор соседних токенов {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} на основе центрального токена W_0.

изображение из статьи о преобразовании слов в векторы

Изображение из этой статьи

✍️ Пример ноутбуков: Обучение модели CBoW

Продолжите обучение с помощью следующих ноутбуков:

Заключение

В предыдущем уроке мы увидели, что векторы слов работают как магия! Теперь мы знаем, что обучение векторов слов — это не такая уж сложная задача, и мы можем обучить свои собственные векторы для текстов, специфичных для определенной области, если это потребуется.

Тест после лекции

Обзор и самостоятельное изучение

🚀 Задание: Обучите модель Skip-Gram

В лабораторной работе мы предлагаем вам изменить код из этого урока, чтобы обучить модель Skip-Gram вместо CBoW. Прочитайте подробности