|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CBoW-PyTorch.ipynb | ||
| CBoW-TF.ipynb | ||
| README.md | ||
README.md
Modeliranje jezika
Semantičke ugrađene reprezentacije, poput Word2Vec i GloVe, zapravo su prvi korak prema modeliranju jezika - stvaranju modela koji na neki način razumiju (ili predstavljaju) prirodu jezika.
Kviz prije predavanja
Glavna ideja modeliranja jezika je treniranje na nepodacima bez oznaka na nesuperviziran način. Ovo je važno jer imamo ogromne količine teksta bez oznaka, dok bi količina teksta s oznakama uvijek bila ograničena trudom koji možemo uložiti u označavanje. Najčešće možemo izgraditi modele jezika koji mogu predvidjeti nedostajuće riječi u tekstu, jer je lako sakriti nasumičnu riječ u tekstu i koristiti je kao uzorak za treniranje.
Treniranje ugrađenih reprezentacija
U našim prethodnim primjerima koristili smo unaprijed trenirane semantičke ugrađene reprezentacije, ali zanimljivo je vidjeti kako se te reprezentacije mogu trenirati. Postoji nekoliko mogućih ideja koje se mogu koristiti:
- N-Gram modeliranje jezika, gdje predviđamo token gledajući N prethodnih tokena (N-gram)
- Kontinuirana vreća riječi (CBoW), gdje predviđamo srednji token
W_0u nizu tokenaW_{-N}, ...,W_N. - Skip-gram, gdje predviđamo skup susjednih tokena {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} iz srednjeg tokenaW_0.
Slika iz ovog rada
✍️ Primjeri bilježnica: Treniranje CBoW modela
Nastavite učiti kroz sljedeće bilježnice:
Zaključak
U prethodnoj lekciji vidjeli smo da ugrađene reprezentacije riječi djeluju poput magije! Sada znamo da treniranje ugrađenih reprezentacija riječi nije vrlo složen zadatak, i trebali bismo biti u mogućnosti trenirati vlastite ugrađene reprezentacije za tekst specifičan za određeno područje ako je potrebno.
Kviz nakon predavanja
Pregled i samostalno učenje
- Službeni PyTorch vodič o modeliranju jezika.
- Službeni TensorFlow vodič o treniranju Word2Vec modela.
- Korištenje okvira gensim za treniranje najčešće korištenih ugrađenih reprezentacija u nekoliko linija koda opisano je u ovoj dokumentaciji.
🚀 Zadatak: Trenirajte Skip-Gram model
U laboratoriju vas izazivamo da izmijenite kod iz ove lekcije kako biste trenirali Skip-Gram model umjesto CBoW. Pročitajte detalje
Odricanje od odgovornosti:
Ovaj dokument je preveden pomoću AI usluge za prevođenje Co-op Translator. Iako nastojimo osigurati točnost, imajte na umu da automatski prijevodi mogu sadržavati pogreške ili netočnosti. Izvorni dokument na izvornom jeziku treba smatrati autoritativnim izvorom. Za kritične informacije preporučuje se profesionalni prijevod od strane čovjeka. Ne preuzimamo odgovornost za nesporazume ili pogrešna tumačenja koja mogu proizaći iz korištenja ovog prijevoda.
