AI-For-Beginners/translations/ta/lessons/5-NLP/15-LanguageModeling/README.md

47 lines
8.5 KiB
Markdown

# மொழி மாதிரிகள்
Word2Vec மற்றும் GloVe போன்ற அர்த்த அடிப்படையிலான எம்பெடிங்குகள் உண்மையில் **மொழி மாதிரிகளை உருவாக்குவதற்கான** முதல் படியாகும் - மொழியின் இயல்பை *புரிந்து கொள்ளும்* (அல்லது *படம்பிடிக்கும்*) மாதிரிகளை உருவாக்குவது.
## [முன்-பாடம் வினாடி வினா](https://ff-quizzes.netlify.app/en/ai/quiz/29)
மொழி மாதிரிகளை உருவாக்குவதின் முக்கிய நோக்கம், அவற்றை லேபிள் செய்யப்படாத தரவுத்தொகுப்புகளில் மேற்பார்வையற்ற முறையில் பயிற்சி செய்வதாகும். இது முக்கியமானது, ஏனெனில் நமக்கு அதிக அளவிலான லேபிள் செய்யப்படாத உரை கிடைக்கிறது, ஆனால் லேபிள் செய்யப்பட்ட உரையின் அளவு எப்போதும் அதை லேபிள் செய்ய நாம் செலவிடும் முயற்சியால் மட்டுப்படுத்தப்படும். பெரும்பாலும், நாங்கள் உரையில் **காணாமல் போன வார்த்தைகளை கணிக்கக்கூடிய** மொழி மாதிரிகளை உருவாக்க முடியும், ஏனெனில் உரையில் ஒரு சீரற்ற வார்த்தையை மறைத்து அதை ஒரு பயிற்சி மாதிரியாக பயன்படுத்துவது எளிது.
## எம்பெடிங்குகளை பயிற்சி செய்வது
முந்தைய எடுத்துக்காட்டுகளில், நாங்கள் முன்பே பயிற்சி செய்யப்பட்ட அர்த்த அடிப்படையிலான எம்பெடிங்குகளை பயன்படுத்தினோம், ஆனால் அவற்றை எப்படி பயிற்சி செய்யலாம் என்பதைப் பார்ப்பது சுவாரஸ்யமாக இருக்கும். இதற்காக பல சாத்தியமான யோசனைகள் உள்ளன:
* **N-Gram** மொழி மாதிரி, இதில் நாம் N முந்தைய டோக்கன்களைப் பார்த்து ஒரு டோக்கனை கணிக்கிறோம் (N-gram).
* **கண்டினியூயஸ் பேக்-ஆஃப்-வேர்ட்ஸ்** (CBoW), இதில் நாம் ஒரு டோக்கன் வரிசையில் நடுவிலுள்ள டோக்கன் $W_0$ ஐ கணிக்கிறோம் $W_{-N}$, ..., $W_N$.
* **ஸ்கிப்-கிராம்**, இதில் நாம் நடுவிலுள்ள டோக்கன் $W_0$ ஐ வைத்து அண்டை டோக்கன்களின் தொகுப்பை {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} கணிக்கிறோம்.
![வார்த்தைகளை வெக்டர்களாக மாற்றும் ஆல்காரிதம்களின் உதாரணம்](../../../../../translated_images/ta/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp)
> படம் [இந்த ஆராய்ச்சி ஆவணத்திலிருந்து](https://arxiv.org/pdf/1301.3781.pdf)
## ✍️ எடுத்துக்காட்டு நோட்புக்குகள்: CBoW மாதிரியை பயிற்சி செய்வது
பின்வரும் நோட்புக்குகளில் உங்கள் கற்றலை தொடருங்கள்:
* [TensorFlow மூலம் CBoW Word2Vec பயிற்சி](CBoW-TF.ipynb)
* [PyTorch மூலம் CBoW Word2Vec பயிற்சி](CBoW-PyTorch.ipynb)
## முடிவு
முந்தைய பாடத்தில், வார்த்தை எம்பெடிங்குகள் மந்திரம் போல வேலை செய்கின்றன என்பதை நாங்கள் பார்த்தோம்! இப்போது, வார்த்தை எம்பெடிங்குகளை பயிற்சி செய்வது மிகவும் சிக்கலான பணியாக இல்லை என்பதை நாங்கள் அறிந்துள்ளோம், மேலும் தேவைப்பட்டால், குறிப்பிட்ட துறைக்கேற்ப உரை எம்பெடிங்குகளை நாங்கள் உருவாக்க முடியும்.
## [பாடத்திற்குப் பிந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ai/quiz/30)
## மதிப்பீடு & சுயபயிற்சி
* [மொழி மாதிரிகள் பற்றிய அதிகாரப்பூர்வ PyTorch பயிற்சி](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html).
* [Word2Vec மாதிரியை பயிற்சி செய்வதற்கான அதிகாரப்பூர்வ TensorFlow பயிற்சி](https://www.TensorFlow.org/tutorials/text/word2vec).
* **gensim** கட்டமைப்பைப் பயன்படுத்தி சில வரிகளுக்குள் பொதுவாக பயன்படுத்தப்படும் எம்பெடிங்குகளை பயிற்சி செய்வது [இந்த ஆவணத்தில்](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) விவரிக்கப்பட்டுள்ளது.
## 🚀 [பணி: ஸ்கிப்-கிராம் மாதிரியை பயிற்சி செய்யுங்கள்](lab/README.md)
பயிற்சியில், இந்த பாடத்தின் குறியீட்டை மாற்றி ஸ்கிப்-கிராம் மாதிரியை பயிற்சி செய்ய உங்களை சவாலுக்கு அழைக்கிறோம். [விவரங்களைப் படிக்கவும்](lab/README.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையை பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. எங்கள் நோக்கம் துல்லியமாக இருக்க வேண்டும் என்பதுதான், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.