3.0 KiB
Jazykové modelování
Sémantické vektory, jako Word2Vec a GloVe, jsou ve skutečnosti prvním krokem k jazykovému modelování – vytváření modelů, které nějakým způsobem rozumí (nebo reprezentují) podstatu jazyka.
Kvíz před přednáškou
Hlavní myšlenkou jazykového modelování je jejich trénování na neoznačených datových sadách neřízeným způsobem. To je důležité, protože máme k dispozici obrovské množství neoznačeného textu, zatímco množství označeného textu bude vždy omezeno úsilím, které můžeme věnovat jeho označování. Nejčastěji můžeme vytvářet jazykové modely, které dokážou předpovídat chybějící slova v textu, protože je snadné náhodně zakrýt slovo v textu a použít ho jako trénovací vzorek.
Trénování vektorů
V našich předchozích příkladech jsme používali předtrénované sémantické vektory, ale je zajímavé vidět, jak lze tyto vektory trénovat. Existuje několik možných přístupů, které lze použít:
- Jazykové modelování pomocí N-Gramů, kdy předpovídáme token na základě N předchozích tokenů (N-gram).
- Continuous Bag-of-Words (CBoW), kdy předpovídáme prostřední token
W_0v sekvenci tokenůW_{-N}, ...,W_N. - Skip-gram, kde předpovídáme sadu sousedních tokenů {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} na základě prostředního tokenuW_0.
Obrázek z tohoto článku
✍️ Ukázkové notebooky: Trénování modelu CBoW
Pokračujte ve svém učení v následujících noteboocích:
Závěr
V předchozí lekci jsme viděli, že vektory slov fungují jako kouzlo! Nyní víme, že trénování vektorů slov není příliš složitý úkol a měli bychom být schopni trénovat vlastní vektory slov pro texty specifické pro danou oblast, pokud to bude potřeba.
Kvíz po přednášce
Přehled & Samostudium
- Oficiální tutoriál PyTorch o jazykovém modelování.
- Oficiální tutoriál TensorFlow o trénování modelu Word2Vec.
- Použití frameworku gensim k trénování nejběžněji používaných vektorů v několika řádcích kódu je popsáno v této dokumentaci.
🚀 Úkol: Trénování modelu Skip-Gram
V laboratoři vás vyzýváme, abyste upravili kód z této lekce a trénovali model Skip-Gram místo CBoW. Přečtěte si podrobnosti
