|
|
||
|---|---|---|
| .. | ||
| GPT-PyTorch.ipynb | ||
| README.md | ||
README.md
Esikoulutetut Suuret Kielenmallit
Kaikissa aiemmissa tehtÀvissÀmme olemme kouluttaneet neuroverkkoa suorittamaan tietyn tehtÀvÀn kÀyttÀen merkittyÀ aineistoa. Suurten transformer-mallien, kuten BERT:n, kohdalla kÀytÀmme kielenmallinnusta itseohjautuvassa muodossa rakentaaksemme kielenmallin, joka sitten erikoistetaan tiettyyn jatkotehtÀvÀÀn lisÀkoulutuksella, joka keskittyy tiettyyn alaan. On kuitenkin osoitettu, ettÀ suuret kielenmallit voivat ratkaista monia tehtÀviÀ myös ilman mitÀÀn alakohtaista koulutusta. Malliperhe, joka pystyy tÀhÀn, tunnetaan nimellÀ GPT: Generative Pre-Trained Transformer.
Ennakkokysely
Tekstintuotanto ja Perpleksisyys
Ajatus siitÀ, ettÀ neuroverkko pystyy suorittamaan yleisiÀ tehtÀviÀ ilman jatkokoulutusta, esitetÀÀn Language Models are Unsupervised Multitask Learners -julkaisussa. PÀÀidea on, ettÀ monet muut tehtÀvÀt voidaan mallintaa tekstintuotannon avulla, koska tekstin ymmÀrtÀminen tarkoittaa olennaisesti sen tuottamista. Koska malli on koulutettu valtavalla mÀÀrÀllÀ tekstiÀ, joka kattaa ihmisen tietÀmyksen, siitÀ tulee myös tietoinen monista eri aiheista.
Tekstin ymmÀrtÀminen ja tuottaminen tarkoittaa myös jonkinlaista tietÀmystÀ ympÀröivÀstÀ maailmasta. Ihmiset oppivat myös suurelta osin lukemalla, ja GPT-verkko on tÀssÀ suhteessa samanlainen.
Tekstintuotantoverkot toimivat ennustamalla seuraavan sanan todennÀköisyyden $P(w_N). Kuitenkin seuraavan sanan ehdoton todennÀköisyys vastaa tÀmÀn sanan esiintymistiheyttÀ tekstikorpuksessa. GPT pystyy antamaan meille **ehdollisen todennÀköisyyden** seuraavalle sanalle, kun edelliset sanat ovat tiedossa: P(w_N | w_{n-1}, ..., w_0)$.
Voit lukea lisÀÀ todennÀköisyyksistÀ Data Science for Beginners Curriculum -materiaalista.
Kielen tuottamisen mallin laatua voidaan mÀÀritellÀ perpleksisyyden avulla. Se on sisÀinen mittari, joka mahdollistaa mallin laadun arvioinnin ilman mitÀÀn tehtÀvÀkohtaista aineistoa. Se perustuu lauseen todennÀköisyyden kÀsitteeseen - malli antaa korkeaa todennÀköisyyttÀ lauseelle, joka todennÀköisesti on oikea (eli malli ei ole hÀmmÀstynyt siitÀ), ja matalaa todennÀköisyyttÀ lauseille, jotka ovat vÀhemmÀn jÀrkeviÀ (esim. Voiko se tehdÀ mitÀ?). Kun annamme mallille lauseita oikeasta tekstikorpuksesta, odotamme niiden olevan korkealla todennÀköisyydellÀ ja matalalla perpleksisyydellÀ. Matemaattisesti se mÀÀritellÀÀn testijoukon normalisoituna kÀÀnteisenÀ todennÀköisyytenÀ:
\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}
Voit kokeilla tekstintuotantoa GPT-pohjaisella tekstieditorilla Hugging Facelta. TÀssÀ editorissa aloitat tekstin kirjoittamisen, ja painamalla [TAB] saat useita tÀydennysvaihtoehtoja. Jos ne ovat liian lyhyitÀ tai et ole tyytyvÀinen niihin - paina [TAB] uudelleen, ja saat lisÀÀ vaihtoehtoja, mukaan lukien pidempiÀ tekstikappaleita.
GPT on Malliperhe
GPT ei ole yksittÀinen malli, vaan pikemminkin kokoelma malleja, jotka on kehitetty ja koulutettu OpenAI:n toimesta.
GPT-mallien alla meillÀ on:
| GPT-2 | GPT-3 | GPT-4 |
|---|---|---|
| Kielenmalli, jossa jopa 1,5 miljardia parametria. | Kielenmalli, jossa jopa 175 miljardia parametria. | 100T parametria, ja se hyvÀksyy sekÀ kuvia ettÀ tekstiÀ syötteenÀ ja tuottaa tekstiÀ. |
GPT-3- ja GPT-4-mallit ovat saatavilla Microsoft Azuren kognitiivisena palveluna ja OpenAI API:n kautta.
Prompt-suunnittelu
Koska GPT on koulutettu valtavilla datamÀÀrillÀ ymmÀrtÀmÀÀn kieltÀ ja koodia, se tuottaa vastauksia syötteisiin (prompteihin). Promptit ovat GPT:n syötteitÀ tai kyselyitÀ, joissa annetaan malleille ohjeita tehtÀvistÀ, jotka niiden tulee suorittaa. Halutun lopputuloksen saavuttamiseksi tarvitaan tehokkain prompti, joka sisÀltÀÀ oikeiden sanojen, muotojen, fraasien tai jopa symbolien valinnan. TÀtÀ lÀhestymistapaa kutsutaan Prompt-suunnitteluksi.
TÀmÀ dokumentaatio tarjoaa lisÀtietoa prompt-suunnittelusta.
âïž Esimerkkivihko: Leikkiminen OpenAI-GPT:n kanssa
Jatka oppimista seuraavissa vihkoissa:
Yhteenveto
Uudet yleiset esikoulutetut kielenmallit eivÀt ainoastaan mallinna kielen rakennetta, vaan sisÀltÀvÀt myös valtavan mÀÀrÀn luonnollista kieltÀ. NÀin ollen niitÀ voidaan tehokkaasti kÀyttÀÀ joidenkin NLP-tehtÀvien ratkaisemiseen nolla-shot- tai vÀhÀ-shot-asetuksissa.