# ഭാഷാ മോഡലിംഗ് വാക്കുകളുടെ അർത്ഥപരമായ എംബെഡിംഗുകൾ, ഉദാഹരണത്തിന് Word2Vec, GloVe എന്നിവ, വാസ്തവത്തിൽ **ഭാഷാ മോഡലിംഗ്** എന്നതിനുള്ള ആദ്യപടി ആണ് - ഭാഷയുടെ സ്വഭാവം ഏതെങ്കിലും വിധത്തിൽ *അർത്ഥമാക്കുന്ന* (അഥവാ *പ്രതിനിധാനം ചെയ്യുന്ന*) മോഡലുകൾ സൃഷ്ടിക്കുക. ## [പഠനത്തിന് മുമ്പുള്ള ക്വിസ്](https://ff-quizzes.netlify.app/en/ai/quiz/29) ഭാഷാ മോഡലിംഗിന്റെ പ്രധാന ആശയം unlabeled ഡാറ്റാസെറ്റുകളിൽ unsupervised രീതിയിൽ പരിശീലനം നൽകുകയാണ്. ഇത് പ്രധാനമാണ്, കാരണം നമുക്ക് വലിയ തോതിൽ unlabeled ടെക്സ്റ്റ് ലഭ്യമാണ്, എന്നാൽ ലേബൽ ചെയ്ത ടെക്സ്റ്റിന്റെ അളവ് ലേബലിംഗിന് ചെലവഴിക്കുന്ന ശ്രമത്തിന്റെ പരിധിയാൽ എപ്പോഴും പരിമിതമായിരിക്കും. സാധാരണയായി, നാം ടെക്സ്റ്റിൽ നഷ്ടപ്പെട്ട വാക്കുകൾ **കാണിച്ച് പ്രവചിക്കാൻ** കഴിയുന്ന ഭാഷാ മോഡലുകൾ നിർമ്മിക്കാം, കാരണം ടെക്സ്റ്റിൽ ഒരു യാദൃച്ഛിക വാക്ക് മറയ്ക്കുകയും അതിനെ പരിശീലന സാമ്പിളായി ഉപയോഗിക്കുകയുമാണ് എളുപ്പം. ## എംബെഡിംഗുകൾ പരിശീലിപ്പിക്കൽ മുൻ ഉദാഹരണങ്ങളിൽ, നാം മുൻകൂട്ടി പരിശീലിപ്പിച്ച അർത്ഥപരമായ എംബെഡിംഗുകൾ ഉപയോഗിച്ചു, പക്ഷേ ആ എംബെഡിംഗുകൾ എങ്ങനെ പരിശീലിപ്പിക്കാമെന്ന് കാണുന്നത് രസകരമാണ്. ഉപയോഗിക്കാവുന്ന ചില ആശയങ്ങൾ: * **N-ഗ്രാം** ഭാഷാ മോഡലിംഗ്, ഇവിടെ N മുൻവരുന്ന ടോക്കണുകൾ നോക്കി ഒരു ടോക്കൺ പ്രവചിക്കുന്നു (N-ഗ്രാം) * **കണ്ടിന്യൂവസ് ബാഗ്-ഓഫ്-വേർഡ്സ്** (CBoW), ടോക്കൺ ശ്രേണിയിൽ മധ്യത്തിലുള്ള ടോക്കൺ $W_0$ പ്രവചിക്കുന്നത്, $W_{-N}$, ..., $W_N$. * **സ്കിപ്പ്-ഗ്രാം**, മധ്യത്തിലുള്ള ടോക്കൺ $W_0$ ഉപയോഗിച്ച് സമീപവരുന്ന ടോക്കണുകളുടെ സെറ്റ് {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} പ്രവചിക്കുന്നത്. ![വാക്കുകൾ വെക്ടറുകളാക്കി മാറ്റുന്നതിന് പത്രത്തിൽ നിന്നുള്ള ചിത്രം](../../../../../translated_images/ml/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp) > ചിത്രം [ഈ പത്രത്തിൽ നിന്നുള്ളത്](https://arxiv.org/pdf/1301.3781.pdf) ## ✍️ ഉദാഹരണ നോട്ട്‌ബുക്കുകൾ: CBoW മോഡൽ പരിശീലനം താഴെ കൊടുത്ത നോട്ട്‌ബുക്കുകളിൽ നിങ്ങളുടെ പഠനം തുടരുക: * [TensorFlow ഉപയോഗിച്ച് CBoW Word2Vec പരിശീലനം](CBoW-TF.ipynb) * [PyTorch ഉപയോഗിച്ച് CBoW Word2Vec പരിശീലനം](CBoW-PyTorch.ipynb) ## നിഗമനം മുൻപത്തെ പാഠത്തിൽ നാം കണ്ടത് വാക്കുകളുടെ എംബെഡിംഗുകൾ അത്ഭുതം പോലെ പ്രവർത്തിക്കുന്നു എന്നതാണ്! ഇപ്പോൾ നമുക്ക് അറിയാം വാക്ക് എംബെഡിംഗുകൾ പരിശീലിപ്പിക്കുന്നത് വളരെ സങ്കീർണ്ണമായ കാര്യമല്ല, ആവശ്യമായാൽ നാം ഡൊമെയ്ൻ പ്രത്യേക ടെക്സ്റ്റിനായി നമ്മുടെ സ്വന്തം വാക്ക് എംബെഡിംഗുകൾ പരിശീലിപ്പിക്കാനും കഴിയും. ## [പഠനത്തിന് ശേഷമുള്ള ക്വിസ്](https://ff-quizzes.netlify.app/en/ai/quiz/30) ## അവലോകനം & സ്വയം പഠനം * [ഭാഷാ മോഡലിംഗിനുള്ള ഔദ്യോഗിക PyTorch ട്യൂട്ടോറിയൽ](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html). * [Word2Vec മോഡൽ പരിശീലനത്തിനുള്ള ഔദ്യോഗിക TensorFlow ട്യൂട്ടോറിയൽ](https://www.TensorFlow.org/tutorials/text/word2vec). * **gensim** ഫ്രെയിംവർക്ക് ഉപയോഗിച്ച് ഏറ്റവും സാധാരണമായി ഉപയോഗിക്കുന്ന എംബെഡിംഗുകൾ കുറച്ച് കോഡ് വരികളിൽ പരിശീലിപ്പിക്കുന്നതിനെക്കുറിച്ച് [ഈ ഡോക്യുമെന്റേഷനിൽ](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) വിവരിച്ചിരിക്കുന്നു. ## 🚀 [അസൈൻമെന്റ്: സ്കിപ്പ്-ഗ്രാം മോഡൽ പരിശീലനം](lab/README.md) ലാബിൽ, ഈ പാഠത്തിലെ കോഡ് മാറ്റി CBoW പകരം സ്കിപ്പ്-ഗ്രാം മോഡൽ പരിശീലിപ്പിക്കാൻ നിങ്ങളെ വെല്ലുവിളിക്കുന്നു. [വിശദാംശങ്ങൾ വായിക്കുക](lab/README.md) --- **അസൂയാ**: ഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, സ്വയം പ്രവർത്തിക്കുന്ന വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. അതിന്റെ മാതൃഭാഷയിലുള്ള യഥാർത്ഥ രേഖയാണ് പ്രാമാണികമായ ഉറവിടം എന്ന് പരിഗണിക്കേണ്ടതാണ്. നിർണായക വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിക്കുന്നതിൽ നിന്നുണ്ടാകുന്ന ഏതെങ്കിലും തെറ്റിദ്ധാരണകൾക്കോ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കോ ഞങ്ങൾ ഉത്തരവാദികളല്ല.