AI-For-Beginners/translations/ne/lessons/5-NLP/15-LanguageModeling/README.md

46 lines
5.8 KiB
Markdown

# भाषा मोडेलिङ
Word2Vec र GloVe जस्ता सेम्यान्टिक एम्बेडिङहरू वास्तवमा **भाषा मोडेलिङ** तर्फको पहिलो कदम हुन् - यस्तो मोडेलहरू बनाउने जसले कुनै प्रकारले भाषा को प्रकृति *बुझ्न* (वा *प्रतिनिधित्व गर्न*) सकून्।
## [पाठ अघि क्विज](https://ff-quizzes.netlify.app/en/ai/quiz/29)
भाषा मोडेलिङको मुख्य विचार भनेको अनलabeled डेटासेटहरूमा unsupervised तरिकाले तिनीहरूलाई प्रशिक्षण गर्नु हो। यो महत्त्वपूर्ण छ किनभने हामीसँग ठूलो मात्रामा अनलabeled पाठ उपलब्ध छ, जबकि labeled पाठको मात्रा सधैं सीमित हुनेछ किनभने labeling मा खर्च गर्न सकिने प्रयास सीमित छ। प्राय: हामी यस्तो भाषा मोडेलहरू बनाउन सक्छौं जसले **हराएका शब्दहरू भविष्यवाणी गर्न सक्छन्** पाठमा, किनभने पाठमा कुनै पनि शब्दलाई मास्क गरेर प्रशिक्षण नमूना बनाउन सजिलो छ।
## एम्बेडिङ प्रशिक्षण
हाम्रो अघिल्लो उदाहरणहरूमा, हामीले pre-trained सेम्यान्टिक एम्बेडिङहरू प्रयोग गरेका थियौं, तर यी एम्बेडिङहरू कसरी प्रशिक्षण गर्न सकिन्छ भन्ने हेर्न रोचक छ। यसका लागि विभिन्न विचारहरू प्रयोग गर्न सकिन्छ:
* **N-Gram** भाषा मोडेलिङ, जहाँ हामी N अघिल्लो टोकनहरू हेरेर टोकन भविष्यवाणी गर्छौं (N-gram)
* **Continuous Bag-of-Words** (CBoW), जहाँ हामी टोकन अनुक्रम $W_{-N}$, ..., $W_N$ को बीचको टोकन $W_0$ भविष्यवाणी गर्छौं।
* **Skip-gram**, जहाँ हामी बीचको टोकन $W_0$ बाट छेउछाउका टोकनहरूको सेट {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} भविष्यवाणी गर्छौं।
![शब्दहरूलाई भेक्टरमा रूपान्तरण गर्ने एल्गोरिदमको कागजबाट चित्र](../../../../../translated_images/ne/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp)
> चित्र [यस कागज](https://arxiv.org/pdf/1301.3781.pdf) बाट
## ✍️ उदाहरण नोटबुकहरू: CBoW मोडेल प्रशिक्षण
निम्न नोटबुकहरूमा सिकाइ जारी राख्नुहोस्:
* [TensorFlow प्रयोग गरेर CBoW Word2Vec प्रशिक्षण](CBoW-TF.ipynb)
* [PyTorch प्रयोग गरेर CBoW Word2Vec प्रशिक्षण](CBoW-PyTorch.ipynb)
## निष्कर्ष
अघिल्लो पाठमा हामीले देख्यौं कि शब्द एम्बेडिङहरू जादुजस्तै काम गर्छन्! अब हामीलाई थाहा छ कि शब्द एम्बेडिङ प्रशिक्षण गर्नु धेरै जटिल कार्य होइन, र यदि आवश्यक परेमा हामी आफ्नो क्षेत्र विशेष पाठका लागि आफ्नै शब्द एम्बेडिङहरू प्रशिक्षण गर्न सक्षम हुनुपर्छ।
## [पाठ पछि क्विज](https://ff-quizzes.netlify.app/en/ai/quiz/30)
## समीक्षा र आत्म-अध्ययन
* [PyTorch को आधिकारिक भाषा मोडेलिङ ट्युटोरियल](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html)।
* [Word2Vec मोडेल प्रशिक्षणको लागि TensorFlow को आधिकारिक ट्युटोरियल](https://www.TensorFlow.org/tutorials/text/word2vec)।
* **gensim** फ्रेमवर्क प्रयोग गरेर केही लाइनको कोडमा प्रचलित एम्बेडिङहरू प्रशिक्षण गर्ने तरिका [यस दस्तावेजमा](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) वर्णन गरिएको छ।
## 🚀 [असाइनमेन्ट: Skip-Gram मोडेल प्रशिक्षण गर्नुहोस्](lab/README.md)
प्रयोगशालामा, हामी तपाईंलाई यस पाठको कोडलाई परिमार्जन गरेर CBoW को सट्टा Skip-Gram मोडेल प्रशिक्षण गर्न चुनौती दिन्छौं। [विवरण पढ्नुहोस्](lab/README.md)
---