AI-For-Beginners/translations/hi/lessons/5-NLP/15-LanguageModeling/README.md

5.9 KiB

भाषा मॉडलिंग

सिमेंटिक एम्बेडिंग्स, जैसे Word2Vec और GloVe, वास्तव में भाषा मॉडलिंग की दिशा में पहला कदम हैं - ऐसे मॉडल बनाना जो किसी तरह भाषा की प्रकृति को समझते (या प्रतिनिधित्व करते) हैं।

प्री-लेक्चर क्विज़

भाषा मॉडलिंग का मुख्य विचार यह है कि उन्हें बिना लेबल वाले डेटा सेट पर अनसुपरवाइज्ड तरीके से प्रशिक्षित किया जाए। यह महत्वपूर्ण है क्योंकि हमारे पास बिना लेबल वाले टेक्स्ट की बड़ी मात्रा उपलब्ध है, जबकि लेबल वाले टेक्स्ट की मात्रा हमेशा सीमित होगी क्योंकि लेबलिंग में समय और प्रयास लगता है। अक्सर, हम ऐसे भाषा मॉडल बना सकते हैं जो गुमशुदा शब्दों की भविष्यवाणी कर सकें, क्योंकि टेक्स्ट में एक रैंडम शब्द को मास्क करना और इसे प्रशिक्षण नमूने के रूप में उपयोग करना आसान है।

एम्बेडिंग्स का प्रशिक्षण

पिछले उदाहरणों में, हमने प्री-ट्रेंड सिमेंटिक एम्बेडिंग्स का उपयोग किया था, लेकिन यह देखना दिलचस्प है कि इन एम्बेडिंग्स को कैसे प्रशिक्षित किया जा सकता है। इसके लिए कई संभावित विचार हैं:

  • N-ग्राम भाषा मॉडलिंग, जिसमें हम N पिछले टोकन देखकर एक टोकन की भविष्यवाणी करते हैं (N-ग्राम)।
  • कंटीन्युअस बैग-ऑफ-वर्ड्स (CBoW), जिसमें हम टोकन अनुक्रम W_{-N}, ..., W_N में मध्य टोकन W_0 की भविष्यवाणी करते हैं।
  • स्किप-ग्राम, जिसमें हम मध्य टोकन W_0 से पड़ोसी टोकन {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} का सेट भविष्यवाणी करते हैं।

शब्दों को वेक्टर में बदलने के लिए पेपर से छवि

छवि इस पेपर से

✍️ उदाहरण नोटबुक्स: CBoW मॉडल का प्रशिक्षण

नीचे दिए गए नोटबुक्स में अपनी सीख जारी रखें:

निष्कर्ष

पिछले पाठ में हमने देखा कि शब्द एम्बेडिंग्स जादू की तरह काम करते हैं! अब हम जानते हैं कि शब्द एम्बेडिंग्स का प्रशिक्षण बहुत जटिल कार्य नहीं है, और यदि आवश्यक हो तो हम डोमेन-विशिष्ट टेक्स्ट के लिए अपने खुद के शब्द एम्बेडिंग्स प्रशिक्षित कर सकते हैं।

पोस्ट-लेक्चर क्विज़

समीक्षा और स्व-अध्ययन

🚀 असाइनमेंट: स्किप-ग्राम मॉडल का प्रशिक्षण

लैब में, हम आपको इस पाठ के कोड को संशोधित करके स्किप-ग्राम मॉडल प्रशिक्षित करने की चुनौती देते हैं। विवरण पढ़ें