3.9 KiB
Jazykové modelování
Sémantické vektory, jako Word2Vec a GloVe, jsou ve skutečnosti prvním krokem k jazykovému modelování – vytváření modelů, které nějakým způsobem rozumí (nebo reprezentují) podstatu jazyka.
Kvíz před přednáškou
Hlavní myšlenkou jazykového modelování je jejich trénování na neoznačených datových sadách neřízeným způsobem. To je důležité, protože máme k dispozici obrovské množství neoznačeného textu, zatímco množství označeného textu bude vždy omezeno úsilím, které můžeme věnovat jeho označování. Nejčastěji můžeme vytvářet jazykové modely, které dokážou předpovídat chybějící slova v textu, protože je snadné náhodně vynechat slovo v textu a použít ho jako trénovací vzorek.
Trénování vektorů
V našich předchozích příkladech jsme používali předem natrénované sémantické vektory, ale je zajímavé vidět, jak lze tyto vektory natrénovat. Existuje několik možných přístupů, které lze použít:
- Jazykové modelování pomocí N-Gramů, kdy předpovídáme token na základě N předchozích tokenů (N-gram).
- Continuous Bag-of-Words (CBoW), kdy předpovídáme prostřední token
W_0v sekvenci tokenůW_{-N}, ...,W_N. - Skip-gram, kde předpovídáme sadu sousedních tokenů {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} na základě prostředního tokenuW_0.
Obrázek z tohoto článku
✍️ Ukázkové notebooky: Trénování modelu CBoW
Pokračujte ve svém učení v následujících noteboocích:
Závěr
V předchozí lekci jsme viděli, že vektory slov fungují jako kouzlo! Nyní víme, že trénování vektorů slov není příliš složitý úkol, a měli bychom být schopni natrénovat vlastní vektory slov pro text specifický pro danou oblast, pokud to bude potřeba.
Kvíz po přednášce
Přehled & Samostudium
- Oficiální tutoriál PyTorch o jazykovém modelování.
- Oficiální tutoriál TensorFlow o trénování modelu Word2Vec.
- Použití frameworku gensim k trénování nejběžněji používaných vektorů v několika řádcích kódu je popsáno v této dokumentaci.
🚀 Úkol: Natrénujte model Skip-Gram
V laboratoři vás vyzýváme, abyste upravili kód z této lekce a natrénovali model Skip-Gram místo CBoW. Přečtěte si podrobnosti
Prohlášení:
Tento dokument byl přeložen pomocí služby pro automatický překlad Co-op Translator. Ačkoli se snažíme o přesnost, mějte prosím na paměti, že automatické překlady mohou obsahovat chyby nebo nepřesnosti. Původní dokument v jeho původním jazyce by měl být považován za autoritativní zdroj. Pro důležité informace se doporučuje profesionální lidský překlad. Neodpovídáme za žádná nedorozumění nebo nesprávné interpretace vyplývající z použití tohoto překladu.
