AI-For-Beginners/translations/nl/lessons/5-NLP/15-LanguageModeling
leestott 07e1ffa96b 🌐 Update translations via Co-op Translator 2025-08-28 22:12:36 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-28 22:12:36 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 22:12:36 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 22:12:36 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-28 22:12:36 +00:00

README.md

Taalmodellering

Semantische embeddings, zoals Word2Vec en GloVe, vormen eigenlijk een eerste stap richting taalmodellering - het creëren van modellen die op een bepaalde manier de aard van taal begrijpen (of weergeven).

Quiz vóór de les

Het belangrijkste idee achter taalmodellering is om modellen te trainen op niet-gelabelde datasets op een onbegeleide manier. Dit is belangrijk omdat we enorme hoeveelheden niet-gelabelde tekst beschikbaar hebben, terwijl de hoeveelheid gelabelde tekst altijd beperkt zal zijn door de inspanning die nodig is om deze te labelen. Meestal kunnen we taalmodellen bouwen die ontbrekende woorden in de tekst kunnen voorspellen, omdat het eenvoudig is om een willekeurig woord in een tekst te maskeren en dit als trainingsvoorbeeld te gebruiken.

Embeddings trainen

In onze eerdere voorbeelden hebben we gebruik gemaakt van voorgetrainde semantische embeddings, maar het is interessant om te zien hoe deze embeddings getraind kunnen worden. Er zijn verschillende mogelijke ideeën die kunnen worden gebruikt:

  • N-Gram taalmodellering, waarbij we een token voorspellen door te kijken naar de N voorgaande tokens (N-gram).
  • Continuous Bag-of-Words (CBoW), waarbij we de middelste token W_0 voorspellen in een reeks tokens W_{-N}, ..., W_N.
  • Skip-gram, waarbij we een set van naburige tokens {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} voorspellen vanuit de middelste token W_0.

afbeelding uit een paper over het omzetten van woorden naar vectoren

Afbeelding uit deze paper

✍️ Voorbeeld Notebooks: CBoW-model trainen

Ga verder met leren in de volgende notebooks:

Conclusie

In de vorige les hebben we gezien dat woordembeddings bijna magisch werken! Nu weten we dat het trainen van woordembeddings geen heel complexe taak is, en we zouden in staat moeten zijn om onze eigen woordembeddings te trainen voor domeinspecifieke teksten indien nodig.

Quiz na de les

Herhaling & Zelfstudie

🚀 Opdracht: Train Skip-Gram Model

In het lab dagen we je uit om de code uit deze les aan te passen om een skip-gram model te trainen in plaats van CBoW. Lees de details


Disclaimer:
Dit document is vertaald met behulp van de AI-vertalingsservice Co-op Translator. Hoewel we streven naar nauwkeurigheid, dient u zich ervan bewust te zijn dat geautomatiseerde vertalingen fouten of onnauwkeurigheden kunnen bevatten. Het originele document in de oorspronkelijke taal moet worden beschouwd als de gezaghebbende bron. Voor cruciale informatie wordt professionele menselijke vertaling aanbevolen. Wij zijn niet aansprakelijk voor misverstanden of verkeerde interpretaties die voortvloeien uit het gebruik van deze vertaling.