AI-For-Beginners/translations/ar/lessons/5-NLP/15-LanguageModeling/README.md

46 lines
3.7 KiB
Markdown

# نمذجة اللغة
التضمينات الدلالية، مثل Word2Vec وGloVe، تُعتبر في الواقع خطوة أولى نحو **نمذجة اللغة** - إنشاء نماذج تفهم (أو تمثل) طبيعة اللغة بطريقة ما.
## [اختبار ما قبل المحاضرة](https://ff-quizzes.netlify.app/en/ai/quiz/29)
الفكرة الرئيسية وراء نمذجة اللغة هي تدريبها على مجموعات بيانات غير معنونة بطريقة غير خاضعة للإشراف. هذا مهم لأن لدينا كميات هائلة من النصوص غير المعنونة المتاحة، بينما تكون كمية النصوص المعنونة محدودة دائمًا بسبب الجهد المطلوب لتصنيفها. غالبًا ما يمكننا بناء نماذج لغة تستطيع **توقع الكلمات المفقودة** في النص، لأن من السهل إخفاء كلمة عشوائية في النص واستخدامها كعينة تدريب.
## تدريب التضمينات
في الأمثلة السابقة، استخدمنا تضمينات دلالية مُدربة مسبقًا، ولكن من المثير للاهتمام أن نرى كيف يمكن تدريب هذه التضمينات. هناك عدة أفكار يمكن استخدامها:
* **نمذجة اللغة باستخدام N-Gram**، حيث نتوقع رمزًا معينًا من خلال النظر إلى N رموز سابقة (N-gram).
* **كيس الكلمات المستمر** (CBoW)، حيث نتوقع الرمز الأوسط $W_0$ في سلسلة الرموز $W_{-N}$, ..., $W_N$.
* **Skip-gram**، حيث نتوقع مجموعة من الرموز المجاورة {$W_{-N},\dots, W_{-1}, W_1,\dots, W_N$} من الرمز الأوسط $W_0$.
![صورة من ورقة بحثية حول تحويل الكلمات إلى متجهات](../../../../../translated_images/ar/example-algorithms-for-converting-words-to-vectors.fbe9207a726922f6.webp)
> صورة مأخوذة من [هذه الورقة البحثية](https://arxiv.org/pdf/1301.3781.pdf)
## ✍️ دفاتر أمثلة: تدريب نموذج CBoW
واصل التعلم من خلال دفاتر الملاحظات التالية:
* [تدريب CBoW Word2Vec باستخدام TensorFlow](CBoW-TF.ipynb)
* [تدريب CBoW Word2Vec باستخدام PyTorch](CBoW-PyTorch.ipynb)
## الخاتمة
في الدرس السابق، رأينا أن تضمينات الكلمات تعمل بشكل مذهل! الآن نعلم أن تدريب تضمينات الكلمات ليس مهمة معقدة جدًا، ويجب أن نكون قادرين على تدريب تضمينات الكلمات الخاصة بنا للنصوص المتخصصة إذا لزم الأمر.
## [اختبار ما بعد المحاضرة](https://ff-quizzes.netlify.app/en/ai/quiz/30)
## المراجعة والدراسة الذاتية
* [الدرس الرسمي لـ PyTorch حول نمذجة اللغة](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html).
* [الدرس الرسمي لـ TensorFlow حول تدريب نموذج Word2Vec](https://www.TensorFlow.org/tutorials/text/word2vec).
* استخدام إطار العمل **gensim** لتدريب التضمينات الأكثر استخدامًا في بضعة أسطر من الكود موضح [في هذه الوثيقة](https://pytorch.org/tutorials/beginner/nlp/word_embeddings_tutorial.html).
## 🚀 [مهمة: تدريب نموذج Skip-Gram](lab/README.md)
في المختبر، نتحداك لتعديل الكود من هذا الدرس لتدريب نموذج Skip-Gram بدلاً من CBoW. [اقرأ التفاصيل](lab/README.md)
---