|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CBoW-PyTorch.ipynb | ||
| CBoW-TF.ipynb | ||
| README.md | ||
README.md
SprÄkmodellering
Semantiska inbĂ€ddningar, sĂ„som Word2Vec och GloVe, Ă€r faktiskt ett första steg mot sprĂ„kmodellering â att skapa modeller som pĂ„ nĂ„got sĂ€tt förstĂ„r (eller representerar) sprĂ„kets natur.
Förtest-quiz
Huvudidén bakom sprÄkmodellering Àr att trÀna modeller pÄ oetiketterade dataset pÄ ett oövervakat sÀtt. Detta Àr viktigt eftersom vi har enorma mÀngder oetiketterad text tillgÀnglig, medan mÀngden etiketterad text alltid skulle vara begrÀnsad av den tid och anstrÀngning vi kan lÀgga pÄ att skapa etiketter. Oftast kan vi bygga sprÄkmodeller som kan förutsÀga saknade ord i texten, eftersom det Àr enkelt att maskera ett slumpmÀssigt ord i texten och anvÀnda det som ett trÀningsprov.
TrÀning av inbÀddningar
I vÄra tidigare exempel anvÀnde vi förtrÀnade semantiska inbÀddningar, men det Àr intressant att se hur dessa inbÀddningar kan trÀnas. Det finns flera möjliga idéer som kan anvÀndas:
- N-Gram sprÄkmodellering, dÀr vi förutsÀger en token genom att titta pÄ N föregÄende tokens (N-gram).
- Continuous Bag-of-Words (CBoW), dÀr vi förutsÀger den mittersta token
W_0i en sekvens av tokensW_{-N}, ...,W_N. - Skip-gram, dÀr vi förutsÀger en uppsÀttning nÀrliggande tokens {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} frÄn den mittersta tokenW_0.
Bild frÄn denna artikel
âïž Exempelnotebooks: TrĂ€ning av CBoW-modell
FortsÀtt ditt lÀrande i följande notebooks:
Slutsats
I den föregÄende lektionen sÄg vi att ordbÀddningar fungerar som magi! Nu vet vi att trÀning av ordbÀddningar inte Àr en sÀrskilt komplex uppgift, och vi bör kunna trÀna vÄra egna ordbÀddningar för textsamlingar inom specifika domÀner om det behövs.
Eftertest-quiz
Granskning & SjÀlvstudier
- Officiell PyTorch-handledning om sprÄkmodellering.
- Officiell TensorFlow-handledning om trÀning av Word2Vec-modell.
- AnvÀndning av gensim-ramverket för att trÀna de mest anvÀnda inbÀddningarna med nÄgra fÄ kodrader beskrivs i denna dokumentation.
đ Uppgift: TrĂ€na Skip-Gram-modell
I labbet utmanar vi dig att modifiera koden frÄn denna lektion för att trÀna en skip-gram-modell istÀllet för CBoW. LÀs detaljerna
Ansvarsfriskrivning:
Detta dokument har översatts med hjĂ€lp av AI-översĂ€ttningstjĂ€nsten Co-op Translator. Ăven om vi strĂ€var efter noggrannhet, bör det noteras att automatiserade översĂ€ttningar kan innehĂ„lla fel eller brister. Det ursprungliga dokumentet pĂ„ dess originalsprĂ„k bör betraktas som den auktoritativa kĂ€llan. För kritisk information rekommenderas professionell mĂ€nsklig översĂ€ttning. Vi ansvarar inte för eventuella missförstĂ„nd eller feltolkningar som kan uppstĂ„ vid anvĂ€ndning av denna översĂ€ttning.
