# भाषा मोडेलिङ Word2Vec र GloVe जस्ता सेम्यान्टिक एम्बेडिङहरू वास्तवमा **भाषा मोडेलिङ** तर्फको पहिलो कदम हुन् - यस्तो मोडेलहरू बनाउने जसले कुनै प्रकारले भाषा को प्रकृति *बुझ्न* (वा *प्रतिनिधित्व गर्न*) सकून्। ## [पाठ अघि क्विज](https://ff-quizzes.netlify.app/en/ai/quiz/29) भाषा मोडेलिङको मुख्य विचार भनेको अनलabeled डेटासेटहरूमा unsupervised तरिकाले तिनीहरूलाई प्रशिक्षण गर्नु हो। यो महत्त्वपूर्ण छ किनभने हामीसँग ठूलो मात्रामा अनलabeled पाठ उपलब्ध छ, जबकि labeled पाठको मात्रा सधैं सीमित हुनेछ किनभने labeling मा खर्च गर्न सकिने प्रयास सीमित छ। प्राय: हामी यस्तो भाषा मोडेलहरू बनाउन सक्छौं जसले **हराएका शब्दहरू भविष्यवाणी गर्न सक्छन्** पाठमा, किनभने पाठमा कुनै पनि शब्दलाई मास्क गरेर प्रशिक्षण नमूना बनाउन सजिलो छ। ## एम्बेडिङ प्रशिक्षण हाम्रो अघिल्लो उदाहरणहरूमा, हामीले pre-trained सेम्यान्टिक एम्बेडिङहरू प्रयोग गरेका थियौं, तर यी एम्बेडिङहरू कसरी प्रशिक्षण गर्न सकिन्छ भन्ने हेर्न रोचक छ। यसका लागि विभिन्न विचारहरू प्रयोग गर्न सकिन्छ: * **N-Gram** भाषा मोडेलिङ, जहाँ हामी N अघिल्लो टोकनहरू हेरेर टोकन भविष्यवाणी गर्छौं (N-gram) * **Continuous Bag-of-Words** (CBoW), जहाँ हामी टोकन अनुक्रम $W_{-N}$, ..., $W_N$ को बीचको टोकन $W_0$ भविष्यवाणी गर्छौं। * **Skip-gram**, जहाँ हामी बीचको टोकन $W_0$ बाट छेउछाउका टोकनहरूको सेट {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} भविष्यवाणी गर्छौं। ![शब्दहरूलाई भेक्टरमा रूपान्तरण गर्ने एल्गोरिदमको कागजबाट चित्र](../../../../../translated_images/ne/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp) > चित्र [यस कागज](https://arxiv.org/pdf/1301.3781.pdf) बाट ## ✍️ उदाहरण नोटबुकहरू: CBoW मोडेल प्रशिक्षण निम्न नोटबुकहरूमा सिकाइ जारी राख्नुहोस्: * [TensorFlow प्रयोग गरेर CBoW Word2Vec प्रशिक्षण](CBoW-TF.ipynb) * [PyTorch प्रयोग गरेर CBoW Word2Vec प्रशिक्षण](CBoW-PyTorch.ipynb) ## निष्कर्ष अघिल्लो पाठमा हामीले देख्यौं कि शब्द एम्बेडिङहरू जादुजस्तै काम गर्छन्! अब हामीलाई थाहा छ कि शब्द एम्बेडिङ प्रशिक्षण गर्नु धेरै जटिल कार्य होइन, र यदि आवश्यक परेमा हामी आफ्नो क्षेत्र विशेष पाठका लागि आफ्नै शब्द एम्बेडिङहरू प्रशिक्षण गर्न सक्षम हुनुपर्छ। ## [पाठ पछि क्विज](https://ff-quizzes.netlify.app/en/ai/quiz/30) ## समीक्षा र आत्म-अध्ययन * [PyTorch को आधिकारिक भाषा मोडेलिङ ट्युटोरियल](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html)। * [Word2Vec मोडेल प्रशिक्षणको लागि TensorFlow को आधिकारिक ट्युटोरियल](https://www.TensorFlow.org/tutorials/text/word2vec)। * **gensim** फ्रेमवर्क प्रयोग गरेर केही लाइनको कोडमा प्रचलित एम्बेडिङहरू प्रशिक्षण गर्ने तरिका [यस दस्तावेजमा](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) वर्णन गरिएको छ। ## 🚀 [असाइनमेन्ट: Skip-Gram मोडेल प्रशिक्षण गर्नुहोस्](lab/README.md) प्रयोगशालामा, हामी तपाईंलाई यस पाठको कोडलाई परिमार्जन गरेर CBoW को सट्टा Skip-Gram मोडेल प्रशिक्षण गर्न चुनौती दिन्छौं। [विवरण पढ्नुहोस्](lab/README.md) ---