AI-For-Beginners/translations/hu/lessons/5-NLP/15-LanguageModeling
leestott 2555d81160 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00

README.md

Nyelvi Modellezés

A szemantikus beágyazások, mint például a Word2Vec és a GloVe, valójában az első lépést jelentik a nyelvi modellezés felé olyan modellek létrehozása felé, amelyek valamilyen módon megértik (vagy reprezentálják) a nyelv természetét.

Előadás előtti kvíz

A nyelvi modellezés fő gondolata az, hogy címkézetlen adathalmazokon tanítsuk őket felügyelet nélküli módon. Ez azért fontos, mert hatalmas mennyiségű címkézetlen szöveg áll rendelkezésünkre, míg a címkézett szövegek mennyiségét mindig korlátozza az a munka, amit a címkézésre fordíthatunk. Leggyakrabban olyan nyelvi modelleket építhetünk, amelyek képesek hiányzó szavakat megjósolni a szövegben, mivel egyszerűen ki lehet takarni egy véletlenszerű szót a szövegben, és azt használni tanítómintaként.

Beágyazások tanítása

Korábbi példáinkban előre betanított szemantikus beágyazásokat használtunk, de érdekes látni, hogyan lehet ezeket a beágyazásokat betanítani. Számos lehetséges ötlet létezik, amelyeket felhasználhatunk:

  • N-Gram nyelvi modellezés, amikor egy tokent az előző N token alapján jósolunk meg (N-gram).
  • Folytonos Szózsák (CBoW), amikor a középső tokent W_0 jósoljuk meg egy token sorozatban W_{-N}, ..., W_N.
  • Skip-gram, ahol a középső tokenből W_0 egy szomszédos tokenhalmazt {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} jósolunk meg.

kép egy tanulmányból, amely a szavak vektorokká alakítását mutatja

Kép ebből a tanulmányból

✍️ Példa Jegyzetfüzetek: CBoW modell tanítása

Folytasd a tanulást az alábbi jegyzetfüzetekben:

Összegzés

Az előző leckében láttuk, hogy a szóbeágyazások szinte varázslatosan működnek! Most már tudjuk, hogy a szóbeágyazások tanítása nem egy túl bonyolult feladat, és képesek lehetünk saját szóbeágyazásokat tanítani specifikus szakterületi szövegekhez, ha szükséges.

Előadás utáni kvíz

Áttekintés és Önálló Tanulás

🚀 Feladat: Skip-Gram Modell Tanítása

A laborban arra hívunk ki, hogy módosítsd az órai kódot, és taníts Skip-Gram modellt a CBoW helyett. Olvasd el a részleteket.

Felelősség kizárása:
Ez a dokumentum az AI fordítási szolgáltatás Co-op Translator segítségével lett lefordítva. Bár törekszünk a pontosságra, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az eredeti nyelvén tekintendő hiteles forrásnak. Kritikus információk esetén javasolt professzionális emberi fordítást igénybe venni. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely a fordítás használatából eredhet.