49 lines
7.2 KiB
Markdown
49 lines
7.2 KiB
Markdown
# భాషా మోడలింగ్
|
|
|
|
వర్డ్2వెక్ మరియు గ్లోవ్ వంటి సేమాంటిక్ ఎంబెడ్డింగ్స్ వాస్తవానికి **భాషా మోడలింగ్** వైపు మొదటి అడుగు - భాష యొక్క స్వభావాన్ని ఏదో విధంగా *అర్థం చేసుకోవడం* (లేదా *ప్రతినిధ్యం వహించడం*) కోసం మోడల్స్ సృష్టించడం.
|
|
|
|
## [పాఠం ముందు క్విజ్](https://ff-quizzes.netlify.app/en/ai/quiz/29)
|
|
|
|
భాషా మోడలింగ్ వెనుక ప్రధాన ఆలోచన అనలేబుల్ డేటాసెట్లపై అనుసూచిత రీతిలో శిక్షణ ఇవ్వడం. ఇది ముఖ్యమైనది ఎందుకంటే మనకు పెద్ద మొత్తంలో అనలేబుల్ టెక్స్ట్ అందుబాటులో ఉంటుంది, అయితే లేబుల్ చేసిన టెక్స్ట్ పరిమితంగా ఉంటుంది ఎందుకంటే లేబలింగ్ కోసం మనం పెట్టే శ్రమ పరిమితంగా ఉంటుంది. ఎక్కువగా, మనం టెక్స్ట్లో లేని పదాలను **అంచనా వేయగల** భాషా మోడల్స్ తయారు చేయగలము, ఎందుకంటే టెక్స్ట్లో యాదృచ్ఛిక పదాన్ని మాస్క్ చేసి దానిని శిక్షణ నమూనాగా ఉపయోగించడం సులభం.
|
|
|
|
## ఎంబెడ్డింగ్స్ శిక్షణ
|
|
|
|
మునుపటి ఉదాహరణల్లో, మేము ముందుగా శిక్షణ పొందిన సేమాంటిక్ ఎంబెడ్డింగ్స్ ఉపయోగించాము, కానీ ఆ ఎంబెడ్డింగ్స్ ఎలా శిక్షణ పొందతాయో చూడటం ఆసక్తికరం. ఉపయోగించదగిన కొన్ని ఆలోచనలు ఉన్నాయి:
|
|
|
|
* **ఎన్-గ్రామ్** భాషా మోడలింగ్, ఇందులో N గత టోకెన్లను చూసి ఒక టోకెన్ను అంచనా వేస్తాము (N-గ్రామ్)
|
|
* **కంటిన్యూయస్ బ్యాగ్-ఆఫ్-వర్డ్స్** (CBoW), ఇందులో టోకెన్ సీక్వెన్స్ $W_{-N}$, ..., $W_N$ లో మధ్య టోకెన్ $W_0$ ను అంచనా వేస్తాము.
|
|
* **స్కిప్-గ్రామ్**, ఇందులో మధ్య టోకెన్ $W_0$ నుండి పొరుగువారైన టోకెన్ల సమూహం {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} ను అంచనా వేస్తాము.
|
|
|
|

|
|
|
|
> చిత్రం [ఈ పేపర్](https://arxiv.org/pdf/1301.3781.pdf) నుండి
|
|
|
|
## ✍️ ఉదాహరణ నోట్బుక్స్: CBoW మోడల్ శిక్షణ
|
|
|
|
క్రింది నోట్బుక్స్లో మీ అభ్యాసాన్ని కొనసాగించండి:
|
|
|
|
* [టెన్సర్ఫ్లోతో CBoW Word2Vec శిక్షణ](CBoW-TF.ipynb)
|
|
* [పైటార్చ్తో CBoW Word2Vec శిక్షణ](CBoW-PyTorch.ipynb)
|
|
|
|
## ముగింపు
|
|
|
|
మునుపటి పాఠంలో మనం చూసినట్లుగా పదాల ఎంబెడ్డింగ్స్ మాయాజాలంలా పనిచేస్తాయి! ఇప్పుడు మనకు తెలుసు పదాల ఎంబెడ్డింగ్స్ శిక్షణ చాలా క్లిష్టమైన పని కాదు, అవసరమైతే డొమైన్-స్పెసిఫిక్ టెక్స్ట్ కోసం మనం స్వంత పదాల ఎంబెడ్డింగ్స్ శిక్షణ ఇవ్వగలము.
|
|
|
|
## [పాఠం తర్వాత క్విజ్](https://ff-quizzes.netlify.app/en/ai/quiz/30)
|
|
|
|
## సమీక్ష & స్వీయ అధ్యయనం
|
|
|
|
* [భాషా మోడలింగ్ పై అధికారిక PyTorch ట్యుటోరియల్](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html).
|
|
* [Word2Vec మోడల్ శిక్షణపై అధికారిక TensorFlow ట్యుటోరియల్](https://www.TensorFlow.org/tutorials/text/word2vec).
|
|
* **gensim** ఫ్రేమ్వర్క్ ఉపయోగించి కొన్ని కోడ్ లైన్లలో అత్యంత సాధారణంగా ఉపయోగించే ఎంబెడ్డింగ్స్ శిక్షణ గురించి [ఈ డాక్యుమెంటేషన్](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) లో వివరించబడింది.
|
|
|
|
## 🚀 [అసైన్మెంట్: స్కిప్-గ్రామ్ మోడల్ శిక్షణ](lab/README.md)
|
|
|
|
ల్యాబ్లో, ఈ పాఠం నుండి కోడ్ను మార్చి CBoW కాకుండా స్కిప్-గ్రామ్ మోడల్ శిక్షణ ఇవ్వమని మిమ్మల్ని సవాలు చేస్తాము. [వివరాలు చదవండి](lab/README.md)
|
|
|
|
---
|
|
|
|
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
|
|
**అస్పష్టత**:
|
|
ఈ డాక్యుమెంట్ను AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో పొరపాట్లు లేదా తప్పులుండవచ్చు. మూల డాక్యుమెంట్ దాని స్వదేశీ భాషలో అధికారిక మూలంగా పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదం వాడకంలో ఏర్పడిన ఏవైనా అపార్థాలు లేదా తప్పుదారితీసే అర్థాలు కోసం మేము బాధ్యత వహించము.
|
|
<!-- CO-OP TRANSLATOR DISCLAIMER END --> |