AI-For-Beginners/translations/sl/lessons/5-NLP/15-LanguageModeling
localizeflow[bot] 2cf3095b7a chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:44:13 +00:00
..
lab chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:44:13 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 08:19:54 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 08:19:54 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:44:13 +00:00

README.md

Jezikovno modeliranje

Semantične vektorske predstavitve, kot sta Word2Vec in GloVe, so pravzaprav prvi korak k jezikovnemu modeliranju ustvarjanju modelov, ki nekako razumejo (ali predstavljajo) naravo jezika.

Predhodni kviz

Glavna ideja jezikovnega modeliranja je, da jih treniramo na nenalepčenih podatkovnih nizih na nesuperviziran način. To je pomembno, ker imamo na voljo ogromne količine nenalepčenega besedila, medtem ko je količina nalepčenega besedila vedno omejena z vloženim trudom pri označevanju. Najpogosteje lahko zgradimo jezikovne modele, ki lahko napovedujejo manjkajoče besede v besedilu, saj je enostavno naključno besedo v besedilu zakriti in jo uporabiti kot učni vzorec.

Učenje vektorskih predstavitev

V prejšnjih primerih smo uporabljali že vnaprej naučene semantične vektorske predstavitve, vendar je zanimivo videti, kako lahko te predstavitve treniramo. Obstaja več možnih pristopov:

  • N-gram jezikovno modeliranje, kjer napovedujemo token z upoštevanjem N prejšnjih tokenov (N-gram).
  • Neprekinjena vreča besed (CBoW), kjer napovedujemo srednji token W_0 v zaporedju tokenov W_{-N}, ..., W_N.
  • Skip-gram, kjer napovedujemo niz sosednjih tokenov {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} iz srednjega tokena W_0.

slika iz članka o pretvorbi besed v vektorje

Slika iz tega članka

✍️ Primeri zvezkov: Učenje CBoW modela

Nadaljujte z učenjem v naslednjih zvezkih:

Zaključek

V prejšnji lekciji smo videli, da vektorske predstavitve besed delujejo kot čarovnija! Zdaj vemo, da učenje vektorskih predstavitev besed ni zelo zapletena naloga, in bi morali biti sposobni naučiti svoje vektorske predstavitve za besedila specifična za določeno področje, če je to potrebno.

Naknadni kviz

Pregled in samostojno učenje

🚀 Naloga: Naučite Skip-Gram model

V laboratoriju vas izzivamo, da spremenite kodo iz te lekcije in naučite Skip-Gram model namesto CBoW. Preberite podrobnosti