46 lines
5.9 KiB
Markdown
46 lines
5.9 KiB
Markdown
# भाषा मॉडलिंग
|
|
|
|
सिमेंटिक एम्बेडिंग्स, जैसे Word2Vec और GloVe, वास्तव में **भाषा मॉडलिंग** की दिशा में पहला कदम हैं - ऐसे मॉडल बनाना जो किसी तरह भाषा की प्रकृति को *समझते* (या *प्रतिनिधित्व करते*) हैं।
|
|
|
|
## [प्री-लेक्चर क्विज़](https://ff-quizzes.netlify.app/en/ai/quiz/29)
|
|
|
|
भाषा मॉडलिंग का मुख्य विचार यह है कि उन्हें बिना लेबल वाले डेटा सेट पर अनसुपरवाइज्ड तरीके से प्रशिक्षित किया जाए। यह महत्वपूर्ण है क्योंकि हमारे पास बिना लेबल वाले टेक्स्ट की बड़ी मात्रा उपलब्ध है, जबकि लेबल वाले टेक्स्ट की मात्रा हमेशा सीमित होगी क्योंकि लेबलिंग में समय और प्रयास लगता है। अक्सर, हम ऐसे भाषा मॉडल बना सकते हैं जो **गुमशुदा शब्दों की भविष्यवाणी** कर सकें, क्योंकि टेक्स्ट में एक रैंडम शब्द को मास्क करना और इसे प्रशिक्षण नमूने के रूप में उपयोग करना आसान है।
|
|
|
|
## एम्बेडिंग्स का प्रशिक्षण
|
|
|
|
पिछले उदाहरणों में, हमने प्री-ट्रेंड सिमेंटिक एम्बेडिंग्स का उपयोग किया था, लेकिन यह देखना दिलचस्प है कि इन एम्बेडिंग्स को कैसे प्रशिक्षित किया जा सकता है। इसके लिए कई संभावित विचार हैं:
|
|
|
|
* **N-ग्राम** भाषा मॉडलिंग, जिसमें हम N पिछले टोकन देखकर एक टोकन की भविष्यवाणी करते हैं (N-ग्राम)।
|
|
* **कंटीन्युअस बैग-ऑफ-वर्ड्स** (CBoW), जिसमें हम टोकन अनुक्रम $W_{-N}$, ..., $W_N$ में मध्य टोकन $W_0$ की भविष्यवाणी करते हैं।
|
|
* **स्किप-ग्राम**, जिसमें हम मध्य टोकन $W_0$ से पड़ोसी टोकन {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} का सेट भविष्यवाणी करते हैं।
|
|
|
|

|
|
|
|
> छवि [इस पेपर](https://arxiv.org/pdf/1301.3781.pdf) से
|
|
|
|
## ✍️ उदाहरण नोटबुक्स: CBoW मॉडल का प्रशिक्षण
|
|
|
|
नीचे दिए गए नोटबुक्स में अपनी सीख जारी रखें:
|
|
|
|
* [TensorFlow के साथ CBoW Word2Vec का प्रशिक्षण](CBoW-TF.ipynb)
|
|
* [PyTorch के साथ CBoW Word2Vec का प्रशिक्षण](CBoW-PyTorch.ipynb)
|
|
|
|
## निष्कर्ष
|
|
|
|
पिछले पाठ में हमने देखा कि शब्द एम्बेडिंग्स जादू की तरह काम करते हैं! अब हम जानते हैं कि शब्द एम्बेडिंग्स का प्रशिक्षण बहुत जटिल कार्य नहीं है, और यदि आवश्यक हो तो हम डोमेन-विशिष्ट टेक्स्ट के लिए अपने खुद के शब्द एम्बेडिंग्स प्रशिक्षित कर सकते हैं।
|
|
|
|
## [पोस्ट-लेक्चर क्विज़](https://ff-quizzes.netlify.app/en/ai/quiz/30)
|
|
|
|
## समीक्षा और स्व-अध्ययन
|
|
|
|
* [PyTorch पर भाषा मॉडलिंग के लिए आधिकारिक ट्यूटोरियल](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html)।
|
|
* [Word2Vec मॉडल के प्रशिक्षण पर TensorFlow का आधिकारिक ट्यूटोरियल](https://www.TensorFlow.org/tutorials/text/word2vec)।
|
|
* **gensim** फ्रेमवर्क का उपयोग करके कुछ लाइनों के कोड में सबसे सामान्य एम्बेडिंग्स को प्रशिक्षित करने का विवरण [इस दस्तावेज़ में](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) दिया गया है।
|
|
|
|
## 🚀 [असाइनमेंट: स्किप-ग्राम मॉडल का प्रशिक्षण](lab/README.md)
|
|
|
|
लैब में, हम आपको इस पाठ के कोड को संशोधित करके स्किप-ग्राम मॉडल प्रशिक्षित करने की चुनौती देते हैं। [विवरण पढ़ें](lab/README.md)
|
|
|
|
---
|
|
|