AI-For-Beginners/translations/cs/lessons/5-NLP/20-LangModels
localizeflow[bot] 3c760d21ff chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00
..
GPT-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:29:36 +00:00

README.md

Předtrénované velké jazykové modely

Ve všech našich předchozích úlohách jsme trénovali neuronovou síť, aby vykonávala určitou úlohu pomocí označeného datového souboru. U velkých transformátorových modelů, jako je BERT, používáme jazykové modelování v samostatně řízeném režimu k vytvoření jazykového modelu, který je následně specializován na konkrétní úlohu pomocí dalšího tréninku zaměřeného na danou doménu. Bylo však prokázáno, že velké jazykové modely dokážou řešit mnoho úloh i bez jakéhokoliv tréninku zaměřeného na konkrétní doménu. Rodina modelů schopných tohoto výkonu se nazývá GPT: Generative Pre-Trained Transformer.

Kvíz před přednáškou

Generování textu a perplexita

Myšlenka, že neuronová síť dokáže vykonávat obecné úlohy bez dalšího tréninku, je představena v článku Language Models are Unsupervised Multitask Learners. Hlavní myšlenkou je, že mnoho dalších úloh lze modelovat pomocí generování textu, protože porozumění textu v podstatě znamená schopnost ho vytvářet. Díky tomu, že model je trénován na obrovském množství textu zahrnujícího lidské znalosti, stává se také znalým v široké škále témat.

Porozumění textu a schopnost ho vytvářet zahrnuje také znalost světa kolem nás. Lidé se do značné míry učí čtením, a síť GPT je v tomto ohledu podobná.

Sítě pro generování textu fungují na principu předpovídání pravděpodobnosti dalšího slova $P(w_N). Nicméně, nepodmíněná pravděpodobnost dalšího slova odpovídá frekvenci tohoto slova v textovém korpusu. GPT nám dokáže poskytnout **podmíněnou pravděpodobnost** dalšího slova na základě předchozích slov: P(w_N | w_{n-1}, ..., w_0)$.

Více o pravděpodobnostech si můžete přečíst v našem kurzu Data Science pro začátečníky.

Kvalitu modelu generujícího text lze definovat pomocí perplexity. Jedná se o vnitřní metriku, která nám umožňuje měřit kvalitu modelu bez jakéhokoliv datového souboru specifického pro danou úlohu. Je založena na konceptu pravděpodobnosti věty - model přiřazuje vysokou pravděpodobnost větám, které jsou pravděpodobně reálné (tj. model není zmatený), a nízkou pravděpodobnost větám, které dávají menší smysl (např. Může to udělat co?). Když modelu poskytneme věty z reálného textového korpusu, očekáváme, že budou mít vysokou pravděpodobnost a nízkou perplexitu. Matematicky je definována jako normalizovaná inverzní pravděpodobnost testovacího souboru:


\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}

Můžete experimentovat s generováním textu pomocí textového editoru poháněného GPT od Hugging Face. V tomto editoru začnete psát svůj text a stisknutím [TAB] vám budou nabídnuty různé možnosti dokončení. Pokud jsou příliš krátké nebo s nimi nejste spokojeni, stiskněte [TAB] znovu a získáte další možnosti, včetně delších částí textu.

GPT jako rodina

GPT není jediný model, ale spíše kolekce modelů vyvinutých a trénovaných společností OpenAI.

Mezi modely GPT patří:

GPT-2 GPT 3 GPT-4
Jazykový model s až 1,5 miliardami parametrů. Jazykový model s až 175 miliardami parametrů 100T parametrů, přijímá jak obrazové, tak textové vstupy a generuje text.

Modely GPT-3 a GPT-4 jsou dostupné jako kognitivní služba od Microsoft Azure a také jako OpenAI API.

Prompt Engineering

Protože GPT bylo trénováno na obrovských objemech dat, aby porozumělo jazyku a kódu, poskytuje výstupy v reakci na vstupy (prompty). Prompty jsou vstupy nebo dotazy pro GPT, kdy uživatel poskytuje modelům instrukce k úlohám, které mají být dokončeny. Aby bylo dosaženo požadovaného výsledku, je potřeba co nejefektivnější prompt, což zahrnuje výběr správných slov, formátů, frází nebo dokonce symbolů. Tento přístup se nazývá Prompt Engineering.

Tato dokumentace vám poskytne více informací o prompt engineeringu.

✍️ Ukázkový notebook: Hraní s OpenAI-GPT

Pokračujte ve svém učení v následujících noteboocích:

Závěr

Nové obecné předtrénované jazykové modely nejen modelují strukturu jazyka, ale také obsahují obrovské množství přirozeného jazyka. Díky tomu mohou být efektivně využívány k řešení některých úloh z oblasti zpracování přirozeného jazyka v režimu zero-shot nebo few-shot.

Kvíz po přednášce