AI-For-Beginners/translations/cs/lessons/5-NLP/15-LanguageModeling
localizeflow[bot] 3c760d21ff chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00
..
lab chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00

README.md

Jazykové modelování

Sémantické vektory, jako Word2Vec a GloVe, jsou ve skutečnosti prvním krokem k jazykovému modelování vytváření modelů, které nějakým způsobem rozumí (nebo reprezentují) podstatu jazyka.

Kvíz před přednáškou

Hlavní myšlenkou jazykového modelování je jejich trénování na neoznačených datových sadách neřízeným způsobem. To je důležité, protože máme k dispozici obrovské množství neoznačeného textu, zatímco množství označeného textu bude vždy omezeno úsilím, které můžeme věnovat jeho označování. Nejčastěji můžeme vytvářet jazykové modely, které dokážou předpovídat chybějící slova v textu, protože je snadné náhodně zakrýt slovo v textu a použít ho jako trénovací vzorek.

Trénování vektorů

V našich předchozích příkladech jsme používali předtrénované sémantické vektory, ale je zajímavé vidět, jak lze tyto vektory trénovat. Existuje několik možných přístupů, které lze použít:

  • Jazykové modelování pomocí N-Gramů, kdy předpovídáme token na základě N předchozích tokenů (N-gram).
  • Continuous Bag-of-Words (CBoW), kdy předpovídáme prostřední token W_0 v sekvenci tokenů W_{-N}, ..., W_N.
  • Skip-gram, kde předpovídáme sadu sousedních tokenů {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} na základě prostředního tokenu W_0.

obrázek z článku o převodu slov na vektory

Obrázek z tohoto článku

✍️ Ukázkové notebooky: Trénování modelu CBoW

Pokračujte ve svém učení v následujících noteboocích:

Závěr

V předchozí lekci jsme viděli, že vektory slov fungují jako kouzlo! Nyní víme, že trénování vektorů slov není příliš složitý úkol a měli bychom být schopni trénovat vlastní vektory slov pro texty specifické pro danou oblast, pokud to bude potřeba.

Kvíz po přednášce

Přehled & Samostudium

🚀 Úkol: Trénování modelu Skip-Gram

V laboratoři vás vyzýváme, abyste upravili kód z této lekce a trénovali model Skip-Gram místo CBoW. Přečtěte si podrobnosti