AI-For-Beginners/translations/sr/lessons/5-NLP/15-LanguageModeling/README.md

4.3 KiB
Raw Blame History

Моделирање језика

Семантички уграђени вектори, као што су Word2Vec и GloVe, представљају први корак ка моделирању језика креирању модела који на неки начин разумеју (или представљају) природу језика.

Квиз пре предавања

Главна идеја иза моделирања језика је њихово тренирање на необележеним скуповима података на ненадгледан начин. Ово је важно јер имамо огромне количине необележеног текста, док би количина обележеног текста увек била ограничена напором који можемо уложити у обележавање. Најчешће можемо изградити моделе језика који могу предвидети недостајуће речи у тексту, јер је лако изоставити насумичну реч у тексту и користити је као узорак за тренирање.

Тренирање уграђених вектора

У претходним примерима користили смо унапред обучене семантичке уграђене векторе, али је занимљиво видети како се ти вектори могу тренирати. Постоји неколико могућих идеја које се могу користити:

  • Н-Грам моделирање језика, где предвиђамо токен гледајући претходних N токена (N-грам).
  • Континуирана врећа речи (CBoW), где предвиђамо средишњи токен W_0 у низу токена W_{-N}, ..., W_N.
  • Скип-грам, где предвиђамо скуп суседних токена {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} на основу средишњег токена W_0.

слика из рада о претварању речи у векторе

Слика из овог рада

✍️ Пример бележница: Тренирање CBoW модела

Наставите са учењем у следећим бележницама:

Закључак

У претходној лекцији видели смо да уграђени вектори речи функционишу као магија! Сада знамо да тренирање уграђених вектора речи није веома сложен задатак и да бисмо могли да обучимо сопствене уграђене векторе за текст специфичан за одређену област ако је потребно.

Квиз након предавања

Преглед и самостално учење

🚀 Задатак: Тренирајте Скип-грам модел

У лабораторији вас изазивамо да модификујете код из ове лекције како бисте тренирали скип-грам модел уместо CBoW. Прочитајте детаље