AI-For-Beginners/translations/ar/lessons/5-NLP/13-TextRep
leestott c6463675e6 🌐 Update translations via Co-op Translator 2025-08-28 04:44:09 +00:00
..
README.md 🌐 Update translations via Co-op Translator 2025-08-26 12:09:18 +00:00
TextRepresentationPyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 04:44:09 +00:00
TextRepresentationTF.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 04:44:09 +00:00
assignment.md 🌐 Update translations via Co-op Translator 2025-08-26 12:09:18 +00:00

README.md

تمثيل النصوص كموترات

اختبار ما قبل المحاضرة

تصنيف النصوص

خلال الجزء الأول من هذا القسم، سنركز على مهمة تصنيف النصوص. سنستخدم مجموعة بيانات AG News، التي تحتوي على مقالات إخبارية مثل المثال التالي:

  • الفئة: العلوم/التكنولوجيا
  • العنوان: شركة في كنتاكي تفوز بمنحة لدراسة الببتيدات (AP)
  • النص: AP - شركة أسسها باحث في الكيمياء من جامعة لويفيل فازت بمنحة لتطوير...

هدفنا سيكون تصنيف الخبر إلى واحدة من الفئات بناءً على النص.

تمثيل النصوص

إذا أردنا حل مهام معالجة اللغة الطبيعية (NLP) باستخدام الشبكات العصبية، فنحن بحاجة إلى طريقة لتمثيل النصوص كموترات. الحواسيب تمثل بالفعل الأحرف النصية كأرقام ترتبط بالخطوط على شاشتك باستخدام ترميزات مثل ASCII أو UTF-8.

صورة توضح خريطة تربط الحرف بتمثيل ASCII وثنائي

مصدر الصورة

كمستخدمين، نحن نفهم ما يمثله كل حرف، وكيف تتجمع الأحرف لتكوين كلمات الجملة. ومع ذلك، الحواسيب بحد ذاتها لا تمتلك هذا الفهم، والشبكة العصبية يجب أن تتعلم المعنى أثناء التدريب.

لذلك، يمكننا استخدام طرق مختلفة لتمثيل النصوص:

  • تمثيل على مستوى الحروف، حيث نمثل النصوص بمعاملة كل حرف كرقم. إذا كان لدينا C عدد مختلف من الأحرف في النصوص، فإن كلمة Hello سيتم تمثيلها بموتر بحجم 5xC. كل حرف سيقابل عمودًا في الموتر باستخدام الترميز الواحد (one-hot encoding).
  • تمثيل على مستوى الكلمات، حيث ننشئ قاموسًا لجميع الكلمات في النصوص، ثم نمثل الكلمات باستخدام الترميز الواحد. هذه الطريقة أفضل إلى حد ما، لأن كل حرف بمفرده لا يحمل الكثير من المعنى، وبالتالي باستخدام مفاهيم دلالية أعلى - الكلمات - نبسط المهمة للشبكة العصبية. ومع ذلك، نظرًا لحجم القاموس الكبير، نحتاج إلى التعامل مع موترات متفرقة ذات أبعاد عالية.

بغض النظر عن الطريقة، يجب أولاً تحويل النص إلى تسلسل من الرموز، حيث يمكن أن تكون الرموز أحرفًا، كلمات، أو حتى أجزاء من كلمات. بعد ذلك، نحول الرمز إلى رقم، عادة باستخدام القاموس، ويمكن إدخال هذا الرقم إلى الشبكة العصبية باستخدام الترميز الواحد.

N-Grams

في اللغة الطبيعية، المعنى الدقيق للكلمات يمكن تحديده فقط في السياق. على سبيل المثال، معاني neural network وfishing network مختلفة تمامًا. إحدى الطرق لأخذ ذلك في الاعتبار هي بناء النموذج على أزواج الكلمات، واعتبار أزواج الكلمات كرموز منفصلة في القاموس. بهذه الطريقة، الجملة I like to go fishing سيتم تمثيلها بتسلسل الرموز التالي: I like، like to، to go، go fishing. المشكلة في هذه الطريقة هي أن حجم القاموس ينمو بشكل كبير، وأن التركيبات مثل go fishing وgo shopping يتم تمثيلها كرموز مختلفة، على الرغم من أن الفعل هو نفسه.

في بعض الحالات، يمكننا التفكير في استخدام ثلاثيات الكلمات (tri-grams) - تركيبات من ثلاث كلمات - أيضًا. وبالتالي، تُعرف هذه الطريقة عمومًا باسم n-grams. كما أنه من المنطقي استخدام n-grams مع التمثيل على مستوى الحروف، حيث ستقابل n-grams تقريبًا المقاطع الصوتية المختلفة.

حقيبة الكلمات (Bag-of-Words) وTF/IDF

عند حل مهام مثل تصنيف النصوص، نحتاج إلى تمثيل النصوص كمتجه ثابت الحجم، والذي سنستخدمه كمدخل للمصنف النهائي الكثيف. إحدى أبسط الطرق للقيام بذلك هي دمج تمثيلات الكلمات الفردية، على سبيل المثال عن طريق جمعها. إذا جمعنا الترميزات الواحدية لكل كلمة، سنحصل على متجه تكرارات، يوضح عدد مرات ظهور كل كلمة داخل النص. يُعرف هذا التمثيل للنص باسم حقيبة الكلمات (BoW).

صورة من المؤلف

تمثل حقيبة الكلمات الكلمات التي تظهر في النص وكمياتها، مما يمكن أن يكون مؤشرًا جيدًا على محتوى النص. على سبيل المثال، المقالة الإخبارية عن السياسة من المحتمل أن تحتوي على كلمات مثل president وcountry، بينما المنشور العلمي قد يحتوي على كلمات مثل collider، discovered، وما إلى ذلك. وبالتالي، يمكن أن تكون تكرارات الكلمات في كثير من الحالات مؤشرًا جيدًا على محتوى النص.

المشكلة مع حقيبة الكلمات هي أن بعض الكلمات الشائعة، مثل and، is، وما إلى ذلك، تظهر في معظم النصوص، ولديها أعلى التكرارات، مما يخفي الكلمات التي تكون فعلاً مهمة. يمكننا تقليل أهمية هذه الكلمات من خلال أخذ تكرار ظهور الكلمات في مجموعة النصوص الكاملة بعين الاعتبار. هذه هي الفكرة الرئيسية وراء طريقة TF/IDF، التي يتم تناولها بمزيد من التفصيل في الدفاتر المرفقة مع هذا الدرس.

ومع ذلك، لا يمكن لأي من هذه الطرق أن تأخذ في الاعتبار دلالات النصوص بشكل كامل. نحن بحاجة إلى نماذج شبكات عصبية أكثر قوة للقيام بذلك، والتي سنناقشها لاحقًا في هذا القسم.

✍️ تمارين: تمثيل النصوص

واصل التعلم من خلال الدفاتر التالية:

الخلاصة

حتى الآن، قمنا بدراسة تقنيات يمكنها إضافة وزن تكراري للكلمات المختلفة. ومع ذلك، فهي غير قادرة على تمثيل المعنى أو الترتيب. كما قال اللغوي الشهير ج. ر. فيرث في عام 1935: "المعنى الكامل للكلمة دائمًا ما يكون سياقيًا، ولا يمكن أخذ أي دراسة للمعنى بعيدًا عن السياق على محمل الجد." سنتعلم لاحقًا في الدورة كيفية التقاط المعلومات السياقية من النصوص باستخدام نمذجة اللغة.

🚀 التحدي

جرّب بعض التمارين الأخرى باستخدام حقيبة الكلمات ونماذج بيانات مختلفة. قد تستوحي من هذه المسابقة على Kaggle

اختبار ما بعد المحاضرة

المراجعة والدراسة الذاتية

قم بممارسة مهاراتك في تضمين النصوص وتقنيات حقيبة الكلمات على Microsoft Learn

التكليف: دفاتر الملاحظات

إخلاء المسؤولية:
تم ترجمة هذا المستند باستخدام خدمة الترجمة بالذكاء الاصطناعي Co-op Translator. بينما نسعى لتحقيق الدقة، يرجى العلم أن الترجمات الآلية قد تحتوي على أخطاء أو معلومات غير دقيقة. يجب اعتبار المستند الأصلي بلغته الأصلية هو المصدر الموثوق. للحصول على معلومات حاسمة، يُوصى بالاستعانة بترجمة بشرية احترافية. نحن غير مسؤولين عن أي سوء فهم أو تفسيرات خاطئة ناتجة عن استخدام هذه الترجمة.