# भाषा मॉडलिंग सिमेंटिक एम्बेडिंग्स, जैसे Word2Vec और GloVe, वास्तव में **भाषा मॉडलिंग** की दिशा में पहला कदम हैं - ऐसे मॉडल बनाना जो किसी तरह भाषा की प्रकृति को *समझते* (या *प्रतिनिधित्व करते*) हैं। ## [प्री-लेक्चर क्विज़](https://ff-quizzes.netlify.app/en/ai/quiz/29) भाषा मॉडलिंग का मुख्य विचार यह है कि उन्हें बिना लेबल वाले डेटा सेट पर अनसुपरवाइज्ड तरीके से प्रशिक्षित किया जाए। यह महत्वपूर्ण है क्योंकि हमारे पास बिना लेबल वाले टेक्स्ट की बड़ी मात्रा उपलब्ध है, जबकि लेबल वाले टेक्स्ट की मात्रा हमेशा सीमित होगी क्योंकि लेबलिंग में समय और प्रयास लगता है। अक्सर, हम ऐसे भाषा मॉडल बना सकते हैं जो **गुमशुदा शब्दों की भविष्यवाणी** कर सकें, क्योंकि टेक्स्ट में एक रैंडम शब्द को मास्क करना और इसे प्रशिक्षण नमूने के रूप में उपयोग करना आसान है। ## एम्बेडिंग्स का प्रशिक्षण पिछले उदाहरणों में, हमने प्री-ट्रेंड सिमेंटिक एम्बेडिंग्स का उपयोग किया था, लेकिन यह देखना दिलचस्प है कि इन एम्बेडिंग्स को कैसे प्रशिक्षित किया जा सकता है। इसके लिए कई संभावित विचार हैं: * **N-ग्राम** भाषा मॉडलिंग, जिसमें हम N पिछले टोकन देखकर एक टोकन की भविष्यवाणी करते हैं (N-ग्राम)। * **कंटीन्युअस बैग-ऑफ-वर्ड्स** (CBoW), जिसमें हम टोकन अनुक्रम $W_{-N}$, ..., $W_N$ में मध्य टोकन $W_0$ की भविष्यवाणी करते हैं। * **स्किप-ग्राम**, जिसमें हम मध्य टोकन $W_0$ से पड़ोसी टोकन {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} का सेट भविष्यवाणी करते हैं। ![शब्दों को वेक्टर में बदलने के लिए पेपर से छवि](../../../../../translated_images/hi/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp) > छवि [इस पेपर](https://arxiv.org/pdf/1301.3781.pdf) से ## ✍️ उदाहरण नोटबुक्स: CBoW मॉडल का प्रशिक्षण नीचे दिए गए नोटबुक्स में अपनी सीख जारी रखें: * [TensorFlow के साथ CBoW Word2Vec का प्रशिक्षण](CBoW-TF.ipynb) * [PyTorch के साथ CBoW Word2Vec का प्रशिक्षण](CBoW-PyTorch.ipynb) ## निष्कर्ष पिछले पाठ में हमने देखा कि शब्द एम्बेडिंग्स जादू की तरह काम करते हैं! अब हम जानते हैं कि शब्द एम्बेडिंग्स का प्रशिक्षण बहुत जटिल कार्य नहीं है, और यदि आवश्यक हो तो हम डोमेन-विशिष्ट टेक्स्ट के लिए अपने खुद के शब्द एम्बेडिंग्स प्रशिक्षित कर सकते हैं। ## [पोस्ट-लेक्चर क्विज़](https://ff-quizzes.netlify.app/en/ai/quiz/30) ## समीक्षा और स्व-अध्ययन * [PyTorch पर भाषा मॉडलिंग के लिए आधिकारिक ट्यूटोरियल](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html)। * [Word2Vec मॉडल के प्रशिक्षण पर TensorFlow का आधिकारिक ट्यूटोरियल](https://www.TensorFlow.org/tutorials/text/word2vec)। * **gensim** फ्रेमवर्क का उपयोग करके कुछ लाइनों के कोड में सबसे सामान्य एम्बेडिंग्स को प्रशिक्षित करने का विवरण [इस दस्तावेज़ में](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) दिया गया है। ## 🚀 [असाइनमेंट: स्किप-ग्राम मॉडल का प्रशिक्षण](lab/README.md) लैब में, हम आपको इस पाठ के कोड को संशोधित करके स्किप-ग्राम मॉडल प्रशिक्षित करने की चुनौती देते हैं। [विवरण पढ़ें](lab/README.md) ---