5.4 KiB
Esikoulutetut Suuret Kielenmallit
Kaikissa aiemmissa tehtävissämme olemme kouluttaneet neuroverkkoa suorittamaan tietyn tehtävän käyttäen merkittyä aineistoa. Suurten transformer-mallien, kuten BERT:n, kohdalla käytämme kielenmallinnusta itseohjautuvassa muodossa rakentaaksemme kielenmallin, joka sitten erikoistetaan tiettyyn jatkotehtävään lisäkoulutuksella, joka keskittyy tiettyyn alaan. On kuitenkin osoitettu, että suuret kielenmallit voivat ratkaista monia tehtäviä myös ilman mitään alakohtaista koulutusta. Malliperhe, joka pystyy tähän, tunnetaan nimellä GPT: Generative Pre-Trained Transformer.
Ennakkokysely
Tekstintuotanto ja Perpleksisyys
Ajatus siitä, että neuroverkko pystyy suorittamaan yleisiä tehtäviä ilman jatkokoulutusta, esitetään Language Models are Unsupervised Multitask Learners -julkaisussa. Pääidea on, että monet muut tehtävät voidaan mallintaa tekstintuotannon avulla, koska tekstin ymmärtäminen tarkoittaa olennaisesti sen tuottamista. Koska malli on koulutettu valtavalla määrällä tekstiä, joka kattaa ihmisen tietämyksen, siitä tulee myös tietoinen monista eri aiheista.
Tekstin ymmärtäminen ja tuottaminen tarkoittaa myös jonkinlaista tietämystä ympäröivästä maailmasta. Ihmiset oppivat myös suurelta osin lukemalla, ja GPT-verkko on tässä suhteessa samanlainen.
Tekstintuotantoverkot toimivat ennustamalla seuraavan sanan todennäköisyyden $P(w_N). Kuitenkin seuraavan sanan ehdoton todennäköisyys vastaa tämän sanan esiintymistiheyttä tekstikorpuksessa. GPT pystyy antamaan meille **ehdollisen todennäköisyyden** seuraavalle sanalle, kun edelliset sanat ovat tiedossa: P(w_N | w_{n-1}, ..., w_0)$.
Voit lukea lisää todennäköisyyksistä Data Science for Beginners Curriculum -materiaalista.
Kielen tuottamisen mallin laatua voidaan määritellä perpleksisyyden avulla. Se on sisäinen mittari, joka mahdollistaa mallin laadun arvioinnin ilman mitään tehtäväkohtaista aineistoa. Se perustuu lauseen todennäköisyyden käsitteeseen - malli antaa korkeaa todennäköisyyttä lauseelle, joka todennäköisesti on oikea (eli malli ei ole hämmästynyt siitä), ja matalaa todennäköisyyttä lauseille, jotka ovat vähemmän järkeviä (esim. Voiko se tehdä mitä?). Kun annamme mallille lauseita oikeasta tekstikorpuksesta, odotamme niiden olevan korkealla todennäköisyydellä ja matalalla perpleksisyydellä. Matemaattisesti se määritellään testijoukon normalisoituna käänteisenä todennäköisyytenä:
\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}
Voit kokeilla tekstintuotantoa GPT-pohjaisella tekstieditorilla Hugging Facelta. Tässä editorissa aloitat tekstin kirjoittamisen, ja painamalla [TAB] saat useita täydennysvaihtoehtoja. Jos ne ovat liian lyhyitä tai et ole tyytyväinen niihin - paina [TAB] uudelleen, ja saat lisää vaihtoehtoja, mukaan lukien pidempiä tekstikappaleita.
GPT on Malliperhe
GPT ei ole yksittäinen malli, vaan pikemminkin kokoelma malleja, jotka on kehitetty ja koulutettu OpenAI:n toimesta.
GPT-mallien alla meillä on:
| GPT-2 | GPT-3 | GPT-4 |
|---|---|---|
| Kielenmalli, jossa jopa 1,5 miljardia parametria. | Kielenmalli, jossa jopa 175 miljardia parametria. | 100T parametria, ja se hyväksyy sekä kuvia että tekstiä syötteenä ja tuottaa tekstiä. |
GPT-3- ja GPT-4-mallit ovat saatavilla Microsoft Azuren kognitiivisena palveluna ja OpenAI API:n kautta.
Prompt-suunnittelu
Koska GPT on koulutettu valtavilla datamäärillä ymmärtämään kieltä ja koodia, se tuottaa vastauksia syötteisiin (prompteihin). Promptit ovat GPT:n syötteitä tai kyselyitä, joissa annetaan malleille ohjeita tehtävistä, jotka niiden tulee suorittaa. Halutun lopputuloksen saavuttamiseksi tarvitaan tehokkain prompti, joka sisältää oikeiden sanojen, muotojen, fraasien tai jopa symbolien valinnan. Tätä lähestymistapaa kutsutaan Prompt-suunnitteluksi.
Tämä dokumentaatio tarjoaa lisätietoa prompt-suunnittelusta.
✍️ Esimerkkivihko: Leikkiminen OpenAI-GPT:n kanssa
Jatka oppimista seuraavissa vihkoissa:
Yhteenveto
Uudet yleiset esikoulutetut kielenmallit eivät ainoastaan mallinna kielen rakennetta, vaan sisältävät myös valtavan määrän luonnollista kieltä. Näin ollen niitä voidaan tehokkaasti käyttää joidenkin NLP-tehtävien ratkaisemiseen nolla-shot- tai vähä-shot-asetuksissa.