AI-For-Beginners/translations/de/lessons/5-NLP/15-LanguageModeling
leestott 449df2cc64 🌐 Update translations via Co-op Translator 2025-08-31 17:20:28 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-24 10:52:15 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-31 17:20:28 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-31 17:20:28 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-24 10:52:15 +00:00

README.md

Sprachmodellierung

Semantische Einbettungen wie Word2Vec und GloVe sind tatsächlich ein erster Schritt in Richtung Sprachmodellierung Modelle zu erstellen, die die Natur der Sprache irgendwie verstehen (oder repräsentieren).

Quiz vor der Vorlesung

Die Hauptidee hinter der Sprachmodellierung besteht darin, Modelle auf unbeschrifteten Datensätzen in einer unüberwachten Weise zu trainieren. Das ist wichtig, da uns riesige Mengen an unbeschriftetem Text zur Verfügung stehen, während die Menge an beschriftetem Text immer durch den Aufwand begrenzt ist, den wir für die Beschriftung aufbringen können. Meistens können wir Sprachmodelle erstellen, die fehlende Wörter im Text vorhersagen, da es einfach ist, ein zufälliges Wort im Text auszublenden und es als Trainingsbeispiel zu verwenden.

Training von Einbettungen

In unseren bisherigen Beispielen haben wir vortrainierte semantische Einbettungen verwendet, aber es ist interessant zu sehen, wie diese Einbettungen trainiert werden können. Es gibt mehrere mögliche Ansätze, die verwendet werden können:

  • N-Gramm-Sprachmodellierung, bei der wir ein Token vorhersagen, indem wir auf die N vorherigen Tokens (N-Gramm) schauen.
  • Continuous Bag-of-Words (CBoW), bei dem wir das mittlere Token W_0 in einer Token-Sequenz W_{-N}, ..., W_N vorhersagen.
  • Skip-Gram, bei dem wir eine Menge benachbarter Tokens {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} aus dem mittleren Token W_0 vorhersagen.

Bild aus einem Paper über die Umwandlung von Wörtern in Vektoren

Bild aus diesem Paper

✍️ Beispiel-Notebooks: Training eines CBoW-Modells

Setze dein Lernen in den folgenden Notebooks fort:

Fazit

In der vorherigen Lektion haben wir gesehen, dass Wort-Einbettungen wie Magie funktionieren! Jetzt wissen wir, dass das Training von Wort-Einbettungen keine sehr komplexe Aufgabe ist, und wir sollten in der Lage sein, unsere eigenen Wort-Einbettungen für textspezifische Domänen zu trainieren, falls erforderlich.

Quiz nach der Vorlesung

Rückblick & Selbststudium

🚀 Aufgabe: Trainiere ein Skip-Gram-Modell

Im Labor fordern wir dich heraus, den Code aus dieser Lektion zu modifizieren, um ein Skip-Gram-Modell anstelle von CBoW zu trainieren. Lies die Details

Haftungsausschluss:
Dieses Dokument wurde mit dem KI-Übersetzungsdienst Co-op Translator übersetzt. Obwohl wir uns um Genauigkeit bemühen, beachten Sie bitte, dass automatisierte Übersetzungen Fehler oder Ungenauigkeiten enthalten können. Das Originaldokument in seiner ursprünglichen Sprache sollte als maßgebliche Quelle betrachtet werden. Für kritische Informationen wird eine professionelle menschliche Übersetzung empfohlen. Wir übernehmen keine Haftung für Missverständnisse oder Fehlinterpretationen, die sich aus der Nutzung dieser Übersetzung ergeben.