|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CBoW-PyTorch.ipynb | ||
| CBoW-TF.ipynb | ||
| README.md | ||
README.md
Nyelvi Modellezés
A szemantikus beágyazások, mint például a Word2Vec és a GloVe, valójában az első lépést jelentik a nyelvi modellezés felé – olyan modellek létrehozása felé, amelyek valamilyen módon megértik (vagy reprezentálják) a nyelv természetét.
Előadás előtti kvíz
A nyelvi modellezés fő gondolata az, hogy címkézetlen adathalmazokon tanítsuk őket felügyelet nélküli módon. Ez azért fontos, mert hatalmas mennyiségű címkézetlen szöveg áll rendelkezésünkre, míg a címkézett szövegek mennyiségét mindig korlátozza az a munka, amit a címkézésre fordíthatunk. Leggyakrabban olyan nyelvi modelleket építhetünk, amelyek képesek hiányzó szavakat megjósolni a szövegben, mivel egyszerűen ki lehet takarni egy véletlenszerű szót a szövegben, és azt használni tanítómintaként.
Beágyazások tanítása
Korábbi példáinkban előre betanított szemantikus beágyazásokat használtunk, de érdekes látni, hogyan lehet ezeket a beágyazásokat betanítani. Számos lehetséges ötlet létezik, amelyeket felhasználhatunk:
- N-Gram nyelvi modellezés, amikor egy tokent az előző N token alapján jósolunk meg (N-gram).
- Folytonos Szózsák (CBoW), amikor a középső tokent
W_0jósoljuk meg egy token sorozatbanW_{-N}, ...,W_N. - Skip-gram, ahol a középső tokenből
W_0egy szomszédos tokenhalmazt {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} jósolunk meg.
✍️ Példa Jegyzetfüzetek: CBoW modell tanítása
Folytasd a tanulást az alábbi jegyzetfüzetekben:
Összegzés
Az előző leckében láttuk, hogy a szóbeágyazások szinte varázslatosan működnek! Most már tudjuk, hogy a szóbeágyazások tanítása nem egy túl bonyolult feladat, és képesek lehetünk saját szóbeágyazásokat tanítani specifikus szakterületi szövegekhez, ha szükséges.
Előadás utáni kvíz
Áttekintés és Önálló Tanulás
- Hivatalos PyTorch oktatóanyag a nyelvi modellezésről.
- Hivatalos TensorFlow oktatóanyag a Word2Vec modell tanításáról.
- A gensim keretrendszer használata a leggyakrabban használt beágyazások tanítására néhány kódsorral ebben a dokumentációban van leírva.
🚀 Feladat: Skip-Gram Modell Tanítása
A laborban arra hívunk ki, hogy módosítsd az órai kódot, és taníts Skip-Gram modellt a CBoW helyett. Olvasd el a részleteket.
Felelősség kizárása:
Ez a dokumentum az AI fordítási szolgáltatás Co-op Translator segítségével lett lefordítva. Bár törekszünk a pontosságra, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az eredeti nyelvén tekintendő hiteles forrásnak. Kritikus információk esetén javasolt professzionális emberi fordítást igénybe venni. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely a fordítás használatából eredhet.
