|
|
||
|---|---|---|
| .. | ||
| GPT-PyTorch.ipynb | ||
| README.md | ||
README.md
FörtrÀnade stora sprÄkmodeller
I alla vÄra tidigare uppgifter har vi trÀnat ett neuralt nÀtverk för att utföra en viss uppgift med hjÀlp av en mÀrkt dataset. Med stora transformer-modeller, sÄsom BERT, anvÀnder vi sprÄkinlÀrning i sjÀlvövervakad form för att bygga en sprÄkmodell, som sedan specialiseras för specifika nedströmsuppgifter med ytterligare domÀnspecifik trÀning. Det har dock visat sig att stora sprÄkmodeller ocksÄ kan lösa mÄnga uppgifter utan nÄgon domÀnspecifik trÀning. En familj av modeller som kan göra detta kallas GPT: Generative Pre-Trained Transformer.
Quiz före förelÀsningen
Textgenerering och förvirring
Idén om att ett neuralt nÀtverk kan utföra generella uppgifter utan nedströms trÀning presenteras i Language Models are Unsupervised Multitask Learners-artikeln. Huvudidén Àr att mÄnga andra uppgifter kan modelleras med hjÀlp av textgenerering, eftersom att förstÄ text i grunden innebÀr att kunna producera den. Eftersom modellen trÀnas pÄ en enorm mÀngd text som omfattar mÀnsklig kunskap, blir den ocksÄ kunnig inom en mÀngd olika Àmnen.
Att förstÄ och kunna producera text innebÀr ocksÄ att veta nÄgot om vÀrlden omkring oss. MÀnniskor lÀr sig ocksÄ i stor utstrÀckning genom att lÀsa, och GPT-nÀtverket Àr liknande i detta avseende.
TextgenereringsnÀtverk fungerar genom att förutsÀga sannolikheten för nÀsta ord $P(w_N). Den ovillkorliga sannolikheten för nÀsta ord motsvarar dock frekvensen av detta ord i textkorpuset. GPT kan ge oss **villkorlig sannolikhet** för nÀsta ord, givet de föregÄende: P(w_N | w_{n-1}, ..., w_0)$.
Du kan lÀsa mer om sannolikheter i vÄr Data Science for Beginners Curriculum.
Kvaliteten pÄ en sprÄkgenererande modell kan definieras med hjÀlp av förvirring. Det Àr en inneboende metrik som gör det möjligt för oss att mÀta modellens kvalitet utan nÄgon uppgiftsspecifik dataset. Den baseras pÄ begreppet sannolikheten för en mening - modellen tilldelar hög sannolikhet till en mening som sannolikt Àr verklig (dvs. modellen Àr inte förvirrad av den), och lÄg sannolikhet till meningar som Àr mindre logiska (t.ex. Kan det gör vad?). NÀr vi ger vÄr modell meningar frÄn ett verkligt textkorpus, förvÀntar vi oss att de har hög sannolikhet och lÄg förvirring. Matematiskt definieras det som normaliserad invers sannolikhet för testuppsÀttningen:
\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}
Du kan experimentera med textgenerering med hjÀlp av GPT-driven textredigerare frÄn Hugging Face. I denna redigerare börjar du skriva din text, och genom att trycka pÄ [TAB] fÄr du flera alternativ för att slutföra texten. Om de Àr för korta, eller om du inte Àr nöjd med dem - tryck pÄ [TAB] igen, och du fÄr fler alternativ, inklusive lÀngre textstycken.
GPT Àr en familj
GPT Àr inte en enskild modell, utan snarare en samling modeller utvecklade och trÀnade av OpenAI.
Under GPT-modellerna har vi:
| GPT-2 | GPT 3 | GPT-4 |
|---|---|---|
| SprÄkmodell med upp till 1,5 miljarder parametrar. | SprÄkmodell med upp till 175 miljarder parametrar | 100T parametrar och accepterar bÄde bild- och textinmatning och genererar text. |
GPT-3 och GPT-4-modellerna Àr tillgÀngliga som en kognitiv tjÀnst frÄn Microsoft Azure, och som OpenAI API.
Prompt Engineering
Eftersom GPT har trÀnats pÄ stora mÀngder data för att förstÄ sprÄk och kod, ger de svar pÄ inmatningar (prompter). Prompter Àr GPT-inmatningar eller frÄgor dÀr man ger instruktioner till modeller om uppgifter de ska utföra. För att fÄ ett önskat resultat behöver du den mest effektiva prompten, vilket innebÀr att vÀlja rÀtt ord, format, fraser eller till och med symboler. Denna metod kallas Prompt Engineering.
Denna dokumentation ger dig mer information om prompt engineering.
âïž Exempel Notebook: Playing with OpenAI-GPT
FortsÀtt ditt lÀrande i följande notebooks:
Slutsats
Nya generella förtrÀnade sprÄkmodeller modellerar inte bara sprÄkstruktur, utan innehÄller ocksÄ en enorm mÀngd naturligt sprÄk. DÀrför kan de effektivt anvÀndas för att lösa vissa NLP-uppgifter i zero-shot eller few-shot-scenarier.