AI-For-Beginners/translations/ne/lessons/5-NLP/15-LanguageModeling/README.md

5.8 KiB

भाषा मोडेलिङ

Word2Vec र GloVe जस्ता सेम्यान्टिक एम्बेडिङहरू वास्तवमा भाषा मोडेलिङ तर्फको पहिलो कदम हुन् - यस्तो मोडेलहरू बनाउने जसले कुनै प्रकारले भाषा को प्रकृति बुझ्न (वा प्रतिनिधित्व गर्न) सकून्।

पाठ अघि क्विज

भाषा मोडेलिङको मुख्य विचार भनेको अनलabeled डेटासेटहरूमा unsupervised तरिकाले तिनीहरूलाई प्रशिक्षण गर्नु हो। यो महत्त्वपूर्ण छ किनभने हामीसँग ठूलो मात्रामा अनलabeled पाठ उपलब्ध छ, जबकि labeled पाठको मात्रा सधैं सीमित हुनेछ किनभने labeling मा खर्च गर्न सकिने प्रयास सीमित छ। प्राय: हामी यस्तो भाषा मोडेलहरू बनाउन सक्छौं जसले हराएका शब्दहरू भविष्यवाणी गर्न सक्छन् पाठमा, किनभने पाठमा कुनै पनि शब्दलाई मास्क गरेर प्रशिक्षण नमूना बनाउन सजिलो छ।

एम्बेडिङ प्रशिक्षण

हाम्रो अघिल्लो उदाहरणहरूमा, हामीले pre-trained सेम्यान्टिक एम्बेडिङहरू प्रयोग गरेका थियौं, तर यी एम्बेडिङहरू कसरी प्रशिक्षण गर्न सकिन्छ भन्ने हेर्न रोचक छ। यसका लागि विभिन्न विचारहरू प्रयोग गर्न सकिन्छ:

  • N-Gram भाषा मोडेलिङ, जहाँ हामी N अघिल्लो टोकनहरू हेरेर टोकन भविष्यवाणी गर्छौं (N-gram)
  • Continuous Bag-of-Words (CBoW), जहाँ हामी टोकन अनुक्रम W_{-N}, ..., W_N को बीचको टोकन W_0 भविष्यवाणी गर्छौं।
  • Skip-gram, जहाँ हामी बीचको टोकन W_0 बाट छेउछाउका टोकनहरूको सेट {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} भविष्यवाणी गर्छौं।

शब्दहरूलाई भेक्टरमा रूपान्तरण गर्ने एल्गोरिदमको कागजबाट चित्र

चित्र यस कागज बाट

✍️ उदाहरण नोटबुकहरू: CBoW मोडेल प्रशिक्षण

निम्न नोटबुकहरूमा सिकाइ जारी राख्नुहोस्:

निष्कर्ष

अघिल्लो पाठमा हामीले देख्यौं कि शब्द एम्बेडिङहरू जादुजस्तै काम गर्छन्! अब हामीलाई थाहा छ कि शब्द एम्बेडिङ प्रशिक्षण गर्नु धेरै जटिल कार्य होइन, र यदि आवश्यक परेमा हामी आफ्नो क्षेत्र विशेष पाठका लागि आफ्नै शब्द एम्बेडिङहरू प्रशिक्षण गर्न सक्षम हुनुपर्छ।

पाठ पछि क्विज

समीक्षा र आत्म-अध्ययन

🚀 असाइनमेन्ट: Skip-Gram मोडेल प्रशिक्षण गर्नुहोस्

प्रयोगशालामा, हामी तपाईंलाई यस पाठको कोडलाई परिमार्जन गरेर CBoW को सट्टा Skip-Gram मोडेल प्रशिक्षण गर्न चुनौती दिन्छौं। विवरण पढ्नुहोस्