5.8 KiB
भाषा मोडेलिङ
Word2Vec र GloVe जस्ता सेम्यान्टिक एम्बेडिङहरू वास्तवमा भाषा मोडेलिङ तर्फको पहिलो कदम हुन् - यस्तो मोडेलहरू बनाउने जसले कुनै प्रकारले भाषा को प्रकृति बुझ्न (वा प्रतिनिधित्व गर्न) सकून्।
पाठ अघि क्विज
भाषा मोडेलिङको मुख्य विचार भनेको अनलabeled डेटासेटहरूमा unsupervised तरिकाले तिनीहरूलाई प्रशिक्षण गर्नु हो। यो महत्त्वपूर्ण छ किनभने हामीसँग ठूलो मात्रामा अनलabeled पाठ उपलब्ध छ, जबकि labeled पाठको मात्रा सधैं सीमित हुनेछ किनभने labeling मा खर्च गर्न सकिने प्रयास सीमित छ। प्राय: हामी यस्तो भाषा मोडेलहरू बनाउन सक्छौं जसले हराएका शब्दहरू भविष्यवाणी गर्न सक्छन् पाठमा, किनभने पाठमा कुनै पनि शब्दलाई मास्क गरेर प्रशिक्षण नमूना बनाउन सजिलो छ।
एम्बेडिङ प्रशिक्षण
हाम्रो अघिल्लो उदाहरणहरूमा, हामीले pre-trained सेम्यान्टिक एम्बेडिङहरू प्रयोग गरेका थियौं, तर यी एम्बेडिङहरू कसरी प्रशिक्षण गर्न सकिन्छ भन्ने हेर्न रोचक छ। यसका लागि विभिन्न विचारहरू प्रयोग गर्न सकिन्छ:
- N-Gram भाषा मोडेलिङ, जहाँ हामी N अघिल्लो टोकनहरू हेरेर टोकन भविष्यवाणी गर्छौं (N-gram)
- Continuous Bag-of-Words (CBoW), जहाँ हामी टोकन अनुक्रम
W_{-N}, ...,W_Nको बीचको टोकनW_0भविष्यवाणी गर्छौं। - Skip-gram, जहाँ हामी बीचको टोकन
W_0बाट छेउछाउका टोकनहरूको सेट {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} भविष्यवाणी गर्छौं।
चित्र यस कागज बाट
✍️ उदाहरण नोटबुकहरू: CBoW मोडेल प्रशिक्षण
निम्न नोटबुकहरूमा सिकाइ जारी राख्नुहोस्:
निष्कर्ष
अघिल्लो पाठमा हामीले देख्यौं कि शब्द एम्बेडिङहरू जादुजस्तै काम गर्छन्! अब हामीलाई थाहा छ कि शब्द एम्बेडिङ प्रशिक्षण गर्नु धेरै जटिल कार्य होइन, र यदि आवश्यक परेमा हामी आफ्नो क्षेत्र विशेष पाठका लागि आफ्नै शब्द एम्बेडिङहरू प्रशिक्षण गर्न सक्षम हुनुपर्छ।
पाठ पछि क्विज
समीक्षा र आत्म-अध्ययन
- PyTorch को आधिकारिक भाषा मोडेलिङ ट्युटोरियल।
- Word2Vec मोडेल प्रशिक्षणको लागि TensorFlow को आधिकारिक ट्युटोरियल।
- gensim फ्रेमवर्क प्रयोग गरेर केही लाइनको कोडमा प्रचलित एम्बेडिङहरू प्रशिक्षण गर्ने तरिका यस दस्तावेजमा वर्णन गरिएको छ।
🚀 असाइनमेन्ट: Skip-Gram मोडेल प्रशिक्षण गर्नुहोस्
प्रयोगशालामा, हामी तपाईंलाई यस पाठको कोडलाई परिमार्जन गरेर CBoW को सट्टा Skip-Gram मोडेल प्रशिक्षण गर्न चुनौती दिन्छौं। विवरण पढ्नुहोस्
