AI-For-Beginners/translations/hr/lessons/5-NLP/15-LanguageModeling
leestott b5a91026ce 🌐 Update translations via Co-op Translator 2025-08-30 08:19:54 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 08:19:54 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 08:19:54 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00

README.md

Modeliranje jezika

Semantičke ugrađene reprezentacije, poput Word2Vec i GloVe, zapravo su prvi korak prema modeliranju jezika - stvaranju modela koji na neki način razumiju (ili predstavljaju) prirodu jezika.

Kviz prije predavanja

Glavna ideja modeliranja jezika je treniranje na nepodacima bez oznaka na nesuperviziran način. Ovo je važno jer imamo ogromne količine teksta bez oznaka, dok bi količina teksta s oznakama uvijek bila ograničena trudom koji možemo uložiti u označavanje. Najčešće možemo izgraditi modele jezika koji mogu predvidjeti nedostajuće riječi u tekstu, jer je lako sakriti nasumičnu riječ u tekstu i koristiti je kao uzorak za treniranje.

Treniranje ugrađenih reprezentacija

U našim prethodnim primjerima koristili smo unaprijed trenirane semantičke ugrađene reprezentacije, ali zanimljivo je vidjeti kako se te reprezentacije mogu trenirati. Postoji nekoliko mogućih ideja koje se mogu koristiti:

  • N-Gram modeliranje jezika, gdje predviđamo token gledajući N prethodnih tokena (N-gram)
  • Kontinuirana vreća riječi (CBoW), gdje predviđamo srednji token W_0 u nizu tokena W_{-N}, ..., W_N.
  • Skip-gram, gdje predviđamo skup susjednih tokena {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} iz srednjeg tokena W_0.

slika iz rada o pretvaranju riječi u vektore

Slika iz ovog rada

✍️ Primjeri bilježnica: Treniranje CBoW modela

Nastavite učiti kroz sljedeće bilježnice:

Zaključak

U prethodnoj lekciji vidjeli smo da ugrađene reprezentacije riječi djeluju poput magije! Sada znamo da treniranje ugrađenih reprezentacija riječi nije vrlo složen zadatak, i trebali bismo biti u mogućnosti trenirati vlastite ugrađene reprezentacije za tekst specifičan za određeno područje ako je potrebno.

Kviz nakon predavanja

Pregled i samostalno učenje

🚀 Zadatak: Trenirajte Skip-Gram model

U laboratoriju vas izazivamo da izmijenite kod iz ove lekcije kako biste trenirali Skip-Gram model umjesto CBoW. Pročitajte detalje

Odricanje od odgovornosti:
Ovaj dokument je preveden pomoću AI usluge za prevođenje Co-op Translator. Iako nastojimo osigurati točnost, imajte na umu da automatski prijevodi mogu sadržavati pogreške ili netočnosti. Izvorni dokument na izvornom jeziku treba smatrati autoritativnim izvorom. Za kritične informacije preporučuje se profesionalni prijevod od strane čovjeka. Ne preuzimamo odgovornost za nesporazume ili pogrešna tumačenja koja mogu proizaći iz korištenja ovog prijevoda.