5.0 KiB
Μοντελοποίηση Γλώσσας
Οι σημασιολογικές ενσωματώσεις, όπως το Word2Vec και το GloVe, αποτελούν στην πραγματικότητα το πρώτο βήμα προς τη μοντελοποίηση γλώσσας - τη δημιουργία μοντέλων που με κάποιο τρόπο κατανοούν (ή αναπαριστούν) τη φύση της γλώσσας.
Προ-διάλεξης κουίζ
Η βασική ιδέα πίσω από τη μοντελοποίηση γλώσσας είναι η εκπαίδευση σε μη επισημασμένα σύνολα δεδομένων με μη επιβλεπόμενο τρόπο. Αυτό είναι σημαντικό επειδή έχουμε τεράστιες ποσότητες μη επισημασμένου κειμένου διαθέσιμες, ενώ η ποσότητα του επισημασμένου κειμένου είναι πάντα περιορισμένη από την προσπάθεια που μπορούμε να αφιερώσουμε για την επισήμανση. Τις περισσότερες φορές, μπορούμε να δημιουργήσουμε μοντέλα γλώσσας που μπορούν να προβλέψουν λέξεις που λείπουν στο κείμενο, επειδή είναι εύκολο να αποκρύψουμε μια τυχαία λέξη στο κείμενο και να τη χρησιμοποιήσουμε ως δείγμα εκπαίδευσης.
Εκπαίδευση Ενσωματώσεων
Στα προηγούμενα παραδείγματα μας, χρησιμοποιήσαμε προεκπαιδευμένες σημασιολογικές ενσωματώσεις, αλλά είναι ενδιαφέρον να δούμε πώς μπορούν να εκπαιδευτούν αυτές οι ενσωματώσεις. Υπάρχουν αρκετές ιδέες που μπορούν να χρησιμοποιηθούν:
- Μοντελοποίηση γλώσσας με N-Gram, όπου προβλέπουμε ένα σύμβολο κοιτάζοντας τα N προηγούμενα σύμβολα (N-gram).
- Continuous Bag-of-Words (CBoW), όπου προβλέπουμε το μεσαίο σύμβολο
W_0σε μια ακολουθία συμβόλωνW_{-N}, ...,W_N. - Skip-gram, όπου προβλέπουμε ένα σύνολο γειτονικών συμβόλων {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} από το μεσαίο σύμβολοW_0.
Εικόνα από αυτό το άρθρο
✍️ Παράδειγμα Σημειωματάρια: Εκπαίδευση μοντέλου CBoW
Συνεχίστε τη μάθησή σας στα παρακάτω σημειωματάρια:
Συμπέρασμα
Στο προηγούμενο μάθημα είδαμε ότι οι ενσωματώσεις λέξεων λειτουργούν σαν μαγεία! Τώρα γνωρίζουμε ότι η εκπαίδευση ενσωματώσεων λέξεων δεν είναι μια πολύπλοκη διαδικασία, και θα πρέπει να μπορούμε να εκπαιδεύσουμε τις δικές μας ενσωματώσεις λέξεων για κείμενο συγκεκριμένου τομέα, αν χρειαστεί.
Μετά-διάλεξης κουίζ
Ανασκόπηση & Αυτοδιδασκαλία
- Επίσημο tutorial PyTorch για Μοντελοποίηση Γλώσσας.
- Επίσημο tutorial TensorFlow για εκπαίδευση μοντέλου Word2Vec.
- Η χρήση του πλαισίου gensim για την εκπαίδευση των πιο συχνά χρησιμοποιούμενων ενσωματώσεων με λίγες γραμμές κώδικα περιγράφεται σε αυτή την τεκμηρίωση.
🚀 Εργασία: Εκπαίδευση Μοντέλου Skip-Gram
Στο εργαστήριο, σας προκαλούμε να τροποποιήσετε τον κώδικα από αυτό το μάθημα για να εκπαιδεύσετε ένα μοντέλο skip-gram αντί για CBoW. Διαβάστε τις λεπτομέρειες
