# மொழி மாதிரிகள் Word2Vec மற்றும் GloVe போன்ற அர்த்த அடிப்படையிலான எம்பெடிங்குகள் உண்மையில் **மொழி மாதிரிகளை உருவாக்குவதற்கான** முதல் படியாகும் - மொழியின் இயல்பை *புரிந்து கொள்ளும்* (அல்லது *படம்பிடிக்கும்*) மாதிரிகளை உருவாக்குவது. ## [முன்-பாடம் வினாடி வினா](https://ff-quizzes.netlify.app/en/ai/quiz/29) மொழி மாதிரிகளை உருவாக்குவதின் முக்கிய நோக்கம், அவற்றை லேபிள் செய்யப்படாத தரவுத்தொகுப்புகளில் மேற்பார்வையற்ற முறையில் பயிற்சி செய்வதாகும். இது முக்கியமானது, ஏனெனில் நமக்கு அதிக அளவிலான லேபிள் செய்யப்படாத உரை கிடைக்கிறது, ஆனால் லேபிள் செய்யப்பட்ட உரையின் அளவு எப்போதும் அதை லேபிள் செய்ய நாம் செலவிடும் முயற்சியால் மட்டுப்படுத்தப்படும். பெரும்பாலும், நாங்கள் உரையில் **காணாமல் போன வார்த்தைகளை கணிக்கக்கூடிய** மொழி மாதிரிகளை உருவாக்க முடியும், ஏனெனில் உரையில் ஒரு சீரற்ற வார்த்தையை மறைத்து அதை ஒரு பயிற்சி மாதிரியாக பயன்படுத்துவது எளிது. ## எம்பெடிங்குகளை பயிற்சி செய்வது முந்தைய எடுத்துக்காட்டுகளில், நாங்கள் முன்பே பயிற்சி செய்யப்பட்ட அர்த்த அடிப்படையிலான எம்பெடிங்குகளை பயன்படுத்தினோம், ஆனால் அவற்றை எப்படி பயிற்சி செய்யலாம் என்பதைப் பார்ப்பது சுவாரஸ்யமாக இருக்கும். இதற்காக பல சாத்தியமான யோசனைகள் உள்ளன: * **N-Gram** மொழி மாதிரி, இதில் நாம் N முந்தைய டோக்கன்களைப் பார்த்து ஒரு டோக்கனை கணிக்கிறோம் (N-gram). * **கண்டினியூயஸ் பேக்-ஆஃப்-வேர்ட்ஸ்** (CBoW), இதில் நாம் ஒரு டோக்கன் வரிசையில் நடுவிலுள்ள டோக்கன் $W_0$ ஐ கணிக்கிறோம் $W_{-N}$, ..., $W_N$. * **ஸ்கிப்-கிராம்**, இதில் நாம் நடுவிலுள்ள டோக்கன் $W_0$ ஐ வைத்து அண்டை டோக்கன்களின் தொகுப்பை {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} கணிக்கிறோம். ![வார்த்தைகளை வெக்டர்களாக மாற்றும் ஆல்காரிதம்களின் உதாரணம்](../../../../../translated_images/ta/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp) > படம் [இந்த ஆராய்ச்சி ஆவணத்திலிருந்து](https://arxiv.org/pdf/1301.3781.pdf) ## ✍️ எடுத்துக்காட்டு நோட்புக்குகள்: CBoW மாதிரியை பயிற்சி செய்வது பின்வரும் நோட்புக்குகளில் உங்கள் கற்றலை தொடருங்கள்: * [TensorFlow மூலம் CBoW Word2Vec பயிற்சி](CBoW-TF.ipynb) * [PyTorch மூலம் CBoW Word2Vec பயிற்சி](CBoW-PyTorch.ipynb) ## முடிவு முந்தைய பாடத்தில், வார்த்தை எம்பெடிங்குகள் மந்திரம் போல வேலை செய்கின்றன என்பதை நாங்கள் பார்த்தோம்! இப்போது, வார்த்தை எம்பெடிங்குகளை பயிற்சி செய்வது மிகவும் சிக்கலான பணியாக இல்லை என்பதை நாங்கள் அறிந்துள்ளோம், மேலும் தேவைப்பட்டால், குறிப்பிட்ட துறைக்கேற்ப உரை எம்பெடிங்குகளை நாங்கள் உருவாக்க முடியும். ## [பாடத்திற்குப் பிந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ai/quiz/30) ## மதிப்பீடு & சுயபயிற்சி * [மொழி மாதிரிகள் பற்றிய அதிகாரப்பூர்வ PyTorch பயிற்சி](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html). * [Word2Vec மாதிரியை பயிற்சி செய்வதற்கான அதிகாரப்பூர்வ TensorFlow பயிற்சி](https://www.TensorFlow.org/tutorials/text/word2vec). * **gensim** கட்டமைப்பைப் பயன்படுத்தி சில வரிகளுக்குள் பொதுவாக பயன்படுத்தப்படும் எம்பெடிங்குகளை பயிற்சி செய்வது [இந்த ஆவணத்தில்](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) விவரிக்கப்பட்டுள்ளது. ## 🚀 [பணி: ஸ்கிப்-கிராம் மாதிரியை பயிற்சி செய்யுங்கள்](lab/README.md) பயிற்சியில், இந்த பாடத்தின் குறியீட்டை மாற்றி ஸ்கிப்-கிராம் மாதிரியை பயிற்சி செய்ய உங்களை சவாலுக்கு அழைக்கிறோம். [விவரங்களைப் படிக்கவும்](lab/README.md) --- **குறிப்பு**: இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையை பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. எங்கள் நோக்கம் துல்லியமாக இருக்க வேண்டும் என்பதுதான், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.