AI-For-Beginners/translations/da/lessons/5-NLP/15-LanguageModeling
leestott 68b3c9c9e7 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-28 18:09:00 +00:00

README.md

Sprogsmodellering

Semantiske indlejringer, såsom Word2Vec og GloVe, er faktisk et første skridt mod sprogsmodellering - at skabe modeller, der på en eller anden måde forstår (eller repræsenterer) sprogets natur.

Quiz før lektionen

Hovedideen bag sprogsmodellering er at træne dem på ulabelerede datasæt på en usuperviseret måde. Dette er vigtigt, fordi vi har enorme mængder ulabeleret tekst tilgængelig, mens mængden af labeleret tekst altid vil være begrænset af den indsats, vi kan bruge på at labelere. Oftest kan vi bygge sprogsmodeller, der kan forudsige manglende ord i teksten, fordi det er nemt at maskere et tilfældigt ord i teksten og bruge det som en træningsprøve.

Træning af indlejringer

I vores tidligere eksempler brugte vi fortrænede semantiske indlejringer, men det er interessant at se, hvordan disse indlejringer kan trænes. Der er flere mulige idéer, der kan bruges:

  • N-Gram sprogsmodellering, hvor vi forudsiger et token ved at kigge på N tidligere tokens (N-gram).
  • Continuous Bag-of-Words (CBoW), hvor vi forudsiger det midterste token W_0 i en token-sekvens W_{-N}, ..., W_N.
  • Skip-gram, hvor vi forudsiger et sæt af nabotokens {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} ud fra det midterste token W_0.

billede fra artikel om konvertering af ord til vektorer

Billede fra denne artikel

✍️ Eksempel Notebooks: Træning af CBoW-model

Fortsæt din læring i følgende notebooks:

Konklusion

I den tidligere lektion har vi set, at ordindlejringer virker som magi! Nu ved vi, at træning af ordindlejringer ikke er en særlig kompleks opgave, og vi bør være i stand til at træne vores egne ordindlejringer til domænespecifik tekst, hvis det er nødvendigt.

Quiz efter lektionen

Gennemgang & Selvstudie

🚀 Opgave: Træn Skip-Gram Model

I laboratoriet udfordrer vi dig til at ændre koden fra denne lektion for at træne en skip-gram model i stedet for CBoW. Læs detaljerne


Ansvarsfraskrivelse:
Dette dokument er blevet oversat ved hjælp af AI-oversættelsestjenesten Co-op Translator. Selvom vi bestræber os på nøjagtighed, skal du være opmærksom på, at automatiserede oversættelser kan indeholde fejl eller unøjagtigheder. Det originale dokument på dets oprindelige sprog bør betragtes som den autoritative kilde. For kritisk information anbefales professionel menneskelig oversættelse. Vi er ikke ansvarlige for eventuelle misforståelser eller fejltolkninger, der måtte opstå som følge af brugen af denne oversættelse.