AI-For-Beginners/translations/te/lessons/5-NLP/15-LanguageModeling/README.md

49 lines
7.2 KiB
Markdown

# భాషా మోడలింగ్
వర్డ్2వెక్ మరియు గ్లోవ్ వంటి సేమాంటిక్ ఎంబెడ్డింగ్స్ వాస్తవానికి **భాషా మోడలింగ్** వైపు మొదటి అడుగు - భాష యొక్క స్వభావాన్ని ఏదో విధంగా *అర్థం చేసుకోవడం* (లేదా *ప్రతినిధ్యం వహించడం*) కోసం మోడల్స్ సృష్టించడం.
## [పాఠం ముందు క్విజ్](https://ff-quizzes.netlify.app/en/ai/quiz/29)
భాషా మోడలింగ్ వెనుక ప్రధాన ఆలోచన అనలేబుల్ డేటాసెట్లపై అనుసూచిత రీతిలో శిక్షణ ఇవ్వడం. ఇది ముఖ్యమైనది ఎందుకంటే మనకు పెద్ద మొత్తంలో అనలేబుల్ టెక్స్ట్ అందుబాటులో ఉంటుంది, అయితే లేబుల్ చేసిన టెక్స్ట్ పరిమితంగా ఉంటుంది ఎందుకంటే లేబలింగ్ కోసం మనం పెట్టే శ్రమ పరిమితంగా ఉంటుంది. ఎక్కువగా, మనం టెక్స్ట్‌లో లేని పదాలను **అంచనా వేయగల** భాషా మోడల్స్ తయారు చేయగలము, ఎందుకంటే టెక్స్ట్‌లో యాదృచ్ఛిక పదాన్ని మాస్క్ చేసి దానిని శిక్షణ నమూనాగా ఉపయోగించడం సులభం.
## ఎంబెడ్డింగ్స్ శిక్షణ
మునుపటి ఉదాహరణల్లో, మేము ముందుగా శిక్షణ పొందిన సేమాంటిక్ ఎంబెడ్డింగ్స్ ఉపయోగించాము, కానీ ఆ ఎంబెడ్డింగ్స్ ఎలా శిక్షణ పొందతాయో చూడటం ఆసక్తికరం. ఉపయోగించదగిన కొన్ని ఆలోచనలు ఉన్నాయి:
* **ఎన్-గ్రామ్** భాషా మోడలింగ్, ఇందులో N గత టోకెన్లను చూసి ఒక టోకెన్‌ను అంచనా వేస్తాము (N-గ్రామ్)
* **కంటిన్యూయస్ బ్యాగ్-ఆఫ్-వర్డ్స్** (CBoW), ఇందులో టోకెన్ సీక్వెన్స్ $W_{-N}$, ..., $W_N$ లో మధ్య టోకెన్ $W_0$ ను అంచనా వేస్తాము.
* **స్కిప్-గ్రామ్**, ఇందులో మధ్య టోకెన్ $W_0$ నుండి పొరుగువారైన టోకెన్ల సమూహం {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} ను అంచనా వేస్తాము.
![పదాలను వెక్టర్లుగా మార్చే అల్గోరిథమ్స్ పై పేపర్ నుండి చిత్రం](../../../../../translated_images/te/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp)
> చిత్రం [ఈ పేపర్](https://arxiv.org/pdf/1301.3781.pdf) నుండి
## ✍️ ఉదాహరణ నోట్‌బుక్స్: CBoW మోడల్ శిక్షణ
క్రింది నోట్‌బుక్స్‌లో మీ అభ్యాసాన్ని కొనసాగించండి:
* [టెన్సర్‌ఫ్లోతో CBoW Word2Vec శిక్షణ](CBoW-TF.ipynb)
* [పైటార్చ్‌తో CBoW Word2Vec శిక్షణ](CBoW-PyTorch.ipynb)
## ముగింపు
మునుపటి పాఠంలో మనం చూసినట్లుగా పదాల ఎంబెడ్డింగ్స్ మాయాజాలంలా పనిచేస్తాయి! ఇప్పుడు మనకు తెలుసు పదాల ఎంబెడ్డింగ్స్ శిక్షణ చాలా క్లిష్టమైన పని కాదు, అవసరమైతే డొమైన్-స్పెసిఫిక్ టెక్స్ట్ కోసం మనం స్వంత పదాల ఎంబెడ్డింగ్స్ శిక్షణ ఇవ్వగలము.
## [పాఠం తర్వాత క్విజ్](https://ff-quizzes.netlify.app/en/ai/quiz/30)
## సమీక్ష & స్వీయ అధ్యయనం
* [భాషా మోడలింగ్ పై అధికారిక PyTorch ట్యుటోరియల్](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html).
* [Word2Vec మోడల్ శిక్షణపై అధికారిక TensorFlow ట్యుటోరియల్](https://www.TensorFlow.org/tutorials/text/word2vec).
* **gensim** ఫ్రేమ్‌వర్క్ ఉపయోగించి కొన్ని కోడ్ లైన్లలో అత్యంత సాధారణంగా ఉపయోగించే ఎంబెడ్డింగ్స్ శిక్షణ గురించి [ఈ డాక్యుమెంటేషన్](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html) లో వివరించబడింది.
## 🚀 [అసైన్‌మెంట్: స్కిప్-గ్రామ్ మోడల్ శిక్షణ](lab/README.md)
ల్యాబ్‌లో, ఈ పాఠం నుండి కోడ్‌ను మార్చి CBoW కాకుండా స్కిప్-గ్రామ్ మోడల్ శిక్షణ ఇవ్వమని మిమ్మల్ని సవాలు చేస్తాము. [వివరాలు చదవండి](lab/README.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**అస్పష్టత**:
ఈ డాక్యుమెంట్‌ను AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో పొరపాట్లు లేదా తప్పులుండవచ్చు. మూల డాక్యుమెంట్ దాని స్వదేశీ భాషలో అధికారిక మూలంగా పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదం వాడకంలో ఏర్పడిన ఏవైనా అపార్థాలు లేదా తప్పుదారితీసే అర్థాలు కోసం మేము బాధ్యత వహించము.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->