|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CBoW-PyTorch.ipynb | ||
| CBoW-TF.ipynb | ||
| README.md | ||
README.md
מודל שפה
הטמעות סמנטיות, כמו Word2Vec ו-GloVe, הן למעשה צעד ראשון לקראת מודל שפה - יצירת מודלים שמבינים (או מייצגים) בצורה כלשהי את טבע השפה.
שאלון לפני השיעור
הרעיון המרכזי מאחורי מודל שפה הוא אימון על מערכי נתונים לא מתויגים בצורה לא מפוקחת. זה חשוב מכיוון שיש לנו כמויות עצומות של טקסט לא מתויג, בעוד שכמות הטקסט המתויג תמיד תהיה מוגבלת על ידי המאמץ שנוכל להשקיע בתיוג. לרוב, ניתן לבנות מודלים שפה שיכולים לחזות מילים חסרות בטקסט, מכיוון שקל להסתיר מילה אקראית בטקסט ולהשתמש בה כדוגמת אימון.
אימון הטמעות
בדוגמאות הקודמות שלנו, השתמשנו בהטמעות סמנטיות מוכנות מראש, אך מעניין לראות כיצד ניתן לאמן את ההטמעות הללו. ישנם כמה רעיונות אפשריים שניתן להשתמש בהם:
- מודל שפה N-Gram, שבו אנו חוזים טוקן על ידי התבוננות ב-N טוקנים קודמים (N-gram).
- Continuous Bag-of-Words (CBoW), שבו אנו חוזים את הטוקן האמצעי
W_0ברצף טוקניםW_{-N}, ...,W_N. - Skip-gram, שבו אנו חוזים סט של טוקנים סמוכים {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} מתוך הטוקן האמצעיW_0.
תמונה מתוך המאמר הזה
✍️ מחברות לדוגמה: אימון מודל CBoW
המשיכו ללמוד במחברות הבאות:
סיכום
בשיעור הקודם ראינו שהטמעות מילים עובדות כמו קסם! עכשיו אנחנו יודעים שאימון הטמעות מילים אינו משימה מורכבת מאוד, ואנו יכולים לאמן הטמעות מילים משלנו לטקסטים ספציפיים לתחום במידת הצורך.
שאלון אחרי השיעור
סקירה ולימוד עצמי
- המדריך הרשמי של PyTorch על מודל שפה.
- המדריך הרשמי של TensorFlow על אימון מודל Word2Vec.
- שימוש במסגרת gensim לאימון הטמעות הנפוצות ביותר בכמה שורות קוד מתואר בתיעוד הזה.
🚀 משימה: אימון מודל Skip-Gram
במעבדה, אנו מאתגרים אתכם לשנות את הקוד מהשיעור הזה כדי לאמן מודל Skip-Gram במקום CBoW. קראו את הפרטים
