AI-For-Beginners/translations/ru/lessons/5-NLP/15-LanguageModeling
leestott e7369eb9ad 🌐 Update translations via Co-op Translator 2025-08-28 12:35:46 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-26 12:09:18 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 12:35:46 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 12:35:46 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-26 12:09:18 +00:00

README.md

Моделирование языка

Семантические векторы, такие как Word2Vec и GloVe, на самом деле являются первым шагом к моделированию языка — созданию моделей, которые каким-то образом понимают (или представляют) природу языка.

Викторина перед лекцией

Основная идея моделирования языка заключается в обучении моделей на неразмеченных данных в режиме без учителя. Это важно, потому что у нас есть огромные объемы неразмеченного текста, в то время как количество размеченного текста всегда будет ограничено усилиями, которые мы можем потратить на разметку. Чаще всего мы можем создавать языковые модели, которые могут предсказывать пропущенные слова в тексте, так как легко замаскировать случайное слово в тексте и использовать его в качестве обучающего примера.

Обучение векторов

В предыдущих примерах мы использовали заранее обученные семантические векторы, но интересно посмотреть, как эти векторы могут быть обучены. Существует несколько возможных подходов:

  • N-граммное моделирование языка, когда мы предсказываем токен, основываясь на N предыдущих токенах (N-граммы).
  • Непрерывный мешок слов (CBoW), когда мы предсказываем центральный токен W_0 в последовательности токенов W_{-N}, ..., W_N.
  • Skip-gram, где мы предсказываем набор соседних токенов {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} на основе центрального токена W_0.

изображение из статьи о преобразовании слов в векторы

Изображение из этой статьи

✍️ Примерные ноутбуки: Обучение модели CBoW

Продолжите обучение с помощью следующих ноутбуков:

Заключение

В предыдущем уроке мы увидели, что векторы слов работают как магия! Теперь мы знаем, что обучение векторов слов — это не очень сложная задача, и мы можем обучить свои собственные векторы слов для текстов в специфической предметной области, если это потребуется.

Викторина после лекции

Обзор и самостоятельное изучение

🚀 Задание: Обучите модель Skip-Gram

В лабораторной работе мы предлагаем вам изменить код из этого урока, чтобы обучить модель Skip-Gram вместо CBoW. Прочитайте подробности.

Отказ от ответственности:
Этот документ был переведен с использованием сервиса автоматического перевода Co-op Translator. Хотя мы стремимся к точности, пожалуйста, учитывайте, что автоматические переводы могут содержать ошибки или неточности. Оригинальный документ на его родном языке следует считать авторитетным источником. Для получения критически важной информации рекомендуется профессиональный перевод человеком. Мы не несем ответственности за любые недоразумения или неправильные интерпретации, возникающие в результате использования данного перевода.