|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CBoW-PyTorch.ipynb | ||
| CBoW-TF.ipynb | ||
| README.md | ||
README.md
Taalmodellering
Semantische embeddings, zoals Word2Vec en GloVe, vormen eigenlijk een eerste stap richting taalmodellering - het creëren van modellen die op een bepaalde manier de aard van taal begrijpen (of weergeven).
Quiz vóór de les
Het belangrijkste idee achter taalmodellering is om modellen te trainen op niet-gelabelde datasets op een onbegeleide manier. Dit is belangrijk omdat we enorme hoeveelheden niet-gelabelde tekst beschikbaar hebben, terwijl de hoeveelheid gelabelde tekst altijd beperkt zal zijn door de inspanning die nodig is om deze te labelen. Meestal kunnen we taalmodellen bouwen die ontbrekende woorden in de tekst kunnen voorspellen, omdat het eenvoudig is om een willekeurig woord in een tekst te maskeren en dit als trainingsvoorbeeld te gebruiken.
Embeddings trainen
In onze eerdere voorbeelden hebben we gebruik gemaakt van voorgetrainde semantische embeddings, maar het is interessant om te zien hoe deze embeddings getraind kunnen worden. Er zijn verschillende mogelijke ideeën die kunnen worden gebruikt:
- N-Gram taalmodellering, waarbij we een token voorspellen door te kijken naar de N voorgaande tokens (N-gram).
- Continuous Bag-of-Words (CBoW), waarbij we de middelste token
W_0voorspellen in een reeks tokensW_{-N}, ...,W_N. - Skip-gram, waarbij we een set van naburige tokens {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} voorspellen vanuit de middelste tokenW_0.
Afbeelding uit deze paper
✍️ Voorbeeld Notebooks: CBoW-model trainen
Ga verder met leren in de volgende notebooks:
Conclusie
In de vorige les hebben we gezien dat woordembeddings bijna magisch werken! Nu weten we dat het trainen van woordembeddings geen heel complexe taak is, en we zouden in staat moeten zijn om onze eigen woordembeddings te trainen voor domeinspecifieke teksten indien nodig.
Quiz na de les
Herhaling & Zelfstudie
- Officiële PyTorch-tutorial over taalmodellering.
- Officiële TensorFlow-tutorial over het trainen van een Word2Vec-model.
- Het gebruik van het gensim-framework om de meest gebruikte embeddings te trainen in slechts een paar regels code wordt beschreven in deze documentatie.
🚀 Opdracht: Train Skip-Gram Model
In het lab dagen we je uit om de code uit deze les aan te passen om een skip-gram model te trainen in plaats van CBoW. Lees de details
Disclaimer:
Dit document is vertaald met behulp van de AI-vertalingsservice Co-op Translator. Hoewel we streven naar nauwkeurigheid, dient u zich ervan bewust te zijn dat geautomatiseerde vertalingen fouten of onnauwkeurigheden kunnen bevatten. Het originele document in de oorspronkelijke taal moet worden beschouwd als de gezaghebbende bron. Voor cruciale informatie wordt professionele menselijke vertaling aanbevolen. Wij zijn niet aansprakelijk voor misverstanden of verkeerde interpretaties die voortvloeien uit het gebruik van deze vertaling.
