5.9 KiB
भाषा मॉडलिंग
सिमेंटिक एम्बेडिंग्स, जैसे Word2Vec और GloVe, वास्तव में भाषा मॉडलिंग की दिशा में पहला कदम हैं - ऐसे मॉडल बनाना जो किसी तरह भाषा की प्रकृति को समझते (या प्रतिनिधित्व करते) हैं।
प्री-लेक्चर क्विज़
भाषा मॉडलिंग का मुख्य विचार यह है कि उन्हें बिना लेबल वाले डेटा सेट पर अनसुपरवाइज्ड तरीके से प्रशिक्षित किया जाए। यह महत्वपूर्ण है क्योंकि हमारे पास बिना लेबल वाले टेक्स्ट की बड़ी मात्रा उपलब्ध है, जबकि लेबल वाले टेक्स्ट की मात्रा हमेशा सीमित होगी क्योंकि लेबलिंग में समय और प्रयास लगता है। अक्सर, हम ऐसे भाषा मॉडल बना सकते हैं जो गुमशुदा शब्दों की भविष्यवाणी कर सकें, क्योंकि टेक्स्ट में एक रैंडम शब्द को मास्क करना और इसे प्रशिक्षण नमूने के रूप में उपयोग करना आसान है।
एम्बेडिंग्स का प्रशिक्षण
पिछले उदाहरणों में, हमने प्री-ट्रेंड सिमेंटिक एम्बेडिंग्स का उपयोग किया था, लेकिन यह देखना दिलचस्प है कि इन एम्बेडिंग्स को कैसे प्रशिक्षित किया जा सकता है। इसके लिए कई संभावित विचार हैं:
- N-ग्राम भाषा मॉडलिंग, जिसमें हम N पिछले टोकन देखकर एक टोकन की भविष्यवाणी करते हैं (N-ग्राम)।
- कंटीन्युअस बैग-ऑफ-वर्ड्स (CBoW), जिसमें हम टोकन अनुक्रम
W_{-N}, ...,W_Nमें मध्य टोकनW_0की भविष्यवाणी करते हैं। - स्किप-ग्राम, जिसमें हम मध्य टोकन
W_0से पड़ोसी टोकन {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} का सेट भविष्यवाणी करते हैं।
छवि इस पेपर से
✍️ उदाहरण नोटबुक्स: CBoW मॉडल का प्रशिक्षण
नीचे दिए गए नोटबुक्स में अपनी सीख जारी रखें:
निष्कर्ष
पिछले पाठ में हमने देखा कि शब्द एम्बेडिंग्स जादू की तरह काम करते हैं! अब हम जानते हैं कि शब्द एम्बेडिंग्स का प्रशिक्षण बहुत जटिल कार्य नहीं है, और यदि आवश्यक हो तो हम डोमेन-विशिष्ट टेक्स्ट के लिए अपने खुद के शब्द एम्बेडिंग्स प्रशिक्षित कर सकते हैं।
पोस्ट-लेक्चर क्विज़
समीक्षा और स्व-अध्ययन
- PyTorch पर भाषा मॉडलिंग के लिए आधिकारिक ट्यूटोरियल।
- Word2Vec मॉडल के प्रशिक्षण पर TensorFlow का आधिकारिक ट्यूटोरियल।
- gensim फ्रेमवर्क का उपयोग करके कुछ लाइनों के कोड में सबसे सामान्य एम्बेडिंग्स को प्रशिक्षित करने का विवरण इस दस्तावेज़ में दिया गया है।
🚀 असाइनमेंट: स्किप-ग्राम मॉडल का प्रशिक्षण
लैब में, हम आपको इस पाठ के कोड को संशोधित करके स्किप-ग्राम मॉडल प्रशिक्षित करने की चुनौती देते हैं। विवरण पढ़ें
