AI-For-Beginners/translations/ml/lessons/5-NLP/15-LanguageModeling/README.md

49 lines
8.2 KiB
Markdown

# ഭാഷാ മോഡലിംഗ്
വാക്കുകളുടെ അർത്ഥപരമായ എംബെഡിംഗുകൾ, ഉദാഹരണത്തിന് Word2Vec, GloVe എന്നിവ, വാസ്തവത്തിൽ **ഭാഷാ മോഡലിംഗ്** എന്നതിനുള്ള ആദ്യപടി ആണ് - ഭാഷയുടെ സ്വഭാവം ഏതെങ്കിലും വിധത്തിൽ *അർത്ഥമാക്കുന്ന* (അഥവാ *പ്രതിനിധാനം ചെയ്യുന്ന*) മോഡലുകൾ സൃഷ്ടിക്കുക.
## [പഠനത്തിന് മുമ്പുള്ള ക്വിസ്](https://ff-quizzes.netlify.app/en/ai/quiz/29)
ഭാഷാ മോഡലിംഗിന്റെ പ്രധാന ആശയം unlabeled ഡാറ്റാസെറ്റുകളിൽ unsupervised രീതിയിൽ പരിശീലനം നൽകുകയാണ്. ഇത് പ്രധാനമാണ്, കാരണം നമുക്ക് വലിയ തോതിൽ unlabeled ടെക്സ്റ്റ് ലഭ്യമാണ്, എന്നാൽ ലേബൽ ചെയ്ത ടെക്സ്റ്റിന്റെ അളവ് ലേബലിംഗിന് ചെലവഴിക്കുന്ന ശ്രമത്തിന്റെ പരിധിയാൽ എപ്പോഴും പരിമിതമായിരിക്കും. സാധാരണയായി, നാം ടെക്സ്റ്റിൽ നഷ്ടപ്പെട്ട വാക്കുകൾ **കാണിച്ച് പ്രവചിക്കാൻ** കഴിയുന്ന ഭാഷാ മോഡലുകൾ നിർമ്മിക്കാം, കാരണം ടെക്സ്റ്റിൽ ഒരു യാദൃച്ഛിക വാക്ക് മറയ്ക്കുകയും അതിനെ പരിശീലന സാമ്പിളായി ഉപയോഗിക്കുകയുമാണ് എളുപ്പം.
## എംബെഡിംഗുകൾ പരിശീലിപ്പിക്കൽ
മുൻ ഉദാഹരണങ്ങളിൽ, നാം മുൻകൂട്ടി പരിശീലിപ്പിച്ച അർത്ഥപരമായ എംബെഡിംഗുകൾ ഉപയോഗിച്ചു, പക്ഷേ ആ എംബെഡിംഗുകൾ എങ്ങനെ പരിശീലിപ്പിക്കാമെന്ന് കാണുന്നത് രസകരമാണ്. ഉപയോഗിക്കാവുന്ന ചില ആശയങ്ങൾ:
* **N-ഗ്രാം** ഭാഷാ മോഡലിംഗ്, ഇവിടെ N മുൻവരുന്ന ടോക്കണുകൾ നോക്കി ഒരു ടോക്കൺ പ്രവചിക്കുന്നു (N-ഗ്രാം)
* **കണ്ടിന്യൂവസ് ബാഗ്-ഓഫ്-വേർഡ്സ്** (CBoW), ടോക്കൺ ശ്രേണിയിൽ മധ്യത്തിലുള്ള ടോക്കൺ $W_0$ പ്രവചിക്കുന്നത്, $W_{-N}$, ..., $W_N$.
* **സ്കിപ്പ്-ഗ്രാം**, മധ്യത്തിലുള്ള ടോക്കൺ $W_0$ ഉപയോഗിച്ച് സമീപവരുന്ന ടോക്കണുകളുടെ സെറ്റ് {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} പ്രവചിക്കുന്നത്.
![വാക്കുകൾ വെക്ടറുകളാക്കി മാറ്റുന്നതിന് പത്രത്തിൽ നിന്നുള്ള ചിത്രം](../../../../../translated_images/ml/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp)
> ചിത്രം [ഈ പത്രത്തിൽ നിന്നുള്ളത്](https://arxiv.org/pdf/1301.3781.pdf)
## ✍️ ഉദാഹരണ നോട്ട്‌ബുക്കുകൾ: CBoW മോഡൽ പരിശീലനം
താഴെ കൊടുത്ത നോട്ട്‌ബുക്കുകളിൽ നിങ്ങളുടെ പഠനം തുടരുക:
* [TensorFlow ഉപയോഗിച്ച് CBoW Word2Vec പരിശീലനം](CBoW-TF.ipynb)
* [PyTorch ഉപയോഗിച്ച് CBoW Word2Vec പരിശീലനം](CBoW-PyTorch.ipynb)
## നിഗമനം
മുൻപത്തെ പാഠത്തിൽ നാം കണ്ടത് വാക്കുകളുടെ എംബെഡിംഗുകൾ അത്ഭുതം പോലെ പ്രവർത്തിക്കുന്നു എന്നതാണ്! ഇപ്പോൾ നമുക്ക് അറിയാം വാക്ക് എംബെഡിംഗുകൾ പരിശീലിപ്പിക്കുന്നത് വളരെ സങ്കീർണ്ണമായ കാര്യമല്ല, ആവശ്യമായാൽ നാം ഡൊമെയ്ൻ പ്രത്യേക ടെക്സ്റ്റിനായി നമ്മുടെ സ്വന്തം വാക്ക് എംബെഡിംഗുകൾ പരിശീലിപ്പിക്കാനും കഴിയും.
## [പഠനത്തിന് ശേഷമുള്ള ക്വിസ്](https://ff-quizzes.netlify.app/en/ai/quiz/30)
## അവലോകനം & സ്വയം പഠനം
* [ഭാഷാ മോഡലിംഗിനുള്ള ഔദ്യോഗിക PyTorch ട്യൂട്ടോറിയൽ](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html).
* [Word2Vec മോഡൽ പരിശീലനത്തിനുള്ള ഔദ്യോഗിക TensorFlow ട്യൂട്ടോറിയൽ](https://www.TensorFlow.org/tutorials/text/word2vec).
* **gensim** ഫ്രെയിംവർക്ക് ഉപയോഗിച്ച് ഏറ്റവും സാധാരണമായി ഉപയോഗിക്കുന്ന എംബെഡിംഗുകൾ കുറച്ച് കോഡ് വരികളിൽ പരിശീലിപ്പിക്കുന്നതിനെക്കുറിച്ച് [ഈ ഡോക്യുമെന്റേഷനിൽ](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) വിവരിച്ചിരിക്കുന്നു.
## 🚀 [അസൈൻമെന്റ്: സ്കിപ്പ്-ഗ്രാം മോഡൽ പരിശീലനം](lab/README.md)
ലാബിൽ, ഈ പാഠത്തിലെ കോഡ് മാറ്റി CBoW പകരം സ്കിപ്പ്-ഗ്രാം മോഡൽ പരിശീലിപ്പിക്കാൻ നിങ്ങളെ വെല്ലുവിളിക്കുന്നു. [വിശദാംശങ്ങൾ വായിക്കുക](lab/README.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**അസൂയാ**:
ഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, സ്വയം പ്രവർത്തിക്കുന്ന വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. അതിന്റെ മാതൃഭാഷയിലുള്ള യഥാർത്ഥ രേഖയാണ് പ്രാമാണികമായ ഉറവിടം എന്ന് പരിഗണിക്കേണ്ടതാണ്. നിർണായക വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിക്കുന്നതിൽ നിന്നുണ്ടാകുന്ന ഏതെങ്കിലും തെറ്റിദ്ധാരണകൾക്കോ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കോ ഞങ്ങൾ ഉത്തരവാദികളല്ല.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->