3.8 KiB
Sprachmodellierung
Semantische Einbettungen, wie Word2Vec und GloVe, sind in der Tat ein erster Schritt in Richtung Sprachmodellierung - Modelle zu erstellen, die irgendwie die Natur der Sprache verstehen (oder darstellen).
Vorlesungsquiz
Die Hauptidee hinter der Sprachmodellierung besteht darin, sie auf unlabeled Datensätzen auf unüberwachtem Weg zu trainieren. Dies ist wichtig, da wir große Mengen an unlabeled Text zur Verfügung haben, während die Menge an labeled Text immer durch den Aufwand, den wir für das Labeling aufwenden können, begrenzt ist. Oft können wir Sprachmodelle erstellen, die fehlende Wörter im Text vorhersagen, da es einfach ist, ein zufälliges Wort im Text zu maskieren und es als Trainingsbeispiel zu verwenden.
Einbettungen trainieren
In unseren vorherigen Beispielen haben wir vortrainierte semantische Einbettungen verwendet, aber es ist interessant zu sehen, wie diese Einbettungen trainiert werden können. Es gibt mehrere mögliche Ansätze, die verwendet werden können:
- N-Gram Sprachmodellierung, wenn wir ein Token vorhersagen, indem wir auf N vorherige Tokens (N-gram) schauen.
- Continuous Bag-of-Words (CBoW), wenn wir das mittlere Token
W_0in einer Token-SequenzW_{-N}, ...,W_Nvorhersagen. - Skip-gram, wo wir eine Menge benachbarter Tokens {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} aus dem mittleren TokenW_0vorhersagen.
Bild aus diesem Papier
✍️ Beispiel-Notebooks: CBoW-Modell trainieren
Setzen Sie Ihr Lernen in den folgenden Notebooks fort:
Fazit
In der vorherigen Lektion haben wir gesehen, dass Wort-Einbettungen wie Magie funktionieren! Jetzt wissen wir, dass das Trainieren von Wort-Einbettungen keine sehr komplexe Aufgabe ist und wir in der Lage sein sollten, unsere eigenen Wort-Einbettungen für domänenspezifischen Text zu trainieren, falls erforderlich.
Nachlese-Quiz
Überprüfung & Selbststudium
- Offizielles PyTorch-Tutorial zur Sprachmodellierung.
- Offizielles TensorFlow-Tutorial zum Training des Word2Vec-Modells.
- Die Verwendung des gensim-Frameworks, um die am häufigsten verwendeten Einbettungen in wenigen Codezeilen zu trainieren, wird in dieser Dokumentation beschrieben.
🚀 Aufgabe: Trainiere Skip-Gram-Modell
Im Labor fordern wir Sie heraus, den Code aus dieser Lektion zu ändern, um ein Skip-Gram-Modell anstelle von CBoW zu trainieren. Lesen Sie die Details
Haftungsausschluss:
Dieses Dokument wurde mit maschinellen KI-Übersetzungsdiensten übersetzt. Obwohl wir uns um Genauigkeit bemühen, beachten Sie bitte, dass automatisierte Übersetzungen Fehler oder Ungenauigkeiten enthalten können. Das Originaldokument in seiner ursprünglichen Sprache sollte als die maßgebliche Quelle angesehen werden. Für wichtige Informationen wird eine professionelle menschliche Übersetzung empfohlen. Wir übernehmen keine Haftung für Missverständnisse oder Fehlinterpretationen, die aus der Verwendung dieser Übersetzung entstehen.
