AI-For-Beginners/translations/uk/lessons/5-NLP/20-LangModels
localizeflow[bot] 132c5c3f8f chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:51:30 +00:00
..
GPT-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:51:30 +00:00

README.md

Попередньо навчені великі мовні моделі

У всіх попередніх завданнях ми навчали нейронну мережу виконувати певне завдання, використовуючи позначений набір даних. З великими трансформерними моделями, такими як BERT, ми використовуємо моделювання мови в самонавчальному режимі для створення мовної моделі, яка потім спеціалізується на конкретному завданні за допомогою додаткового навчання для певної галузі. Однак було продемонстровано, що великі мовні моделі також можуть вирішувати багато завдань без будь-якого навчання для конкретної галузі. Сімейство моделей, здатних це робити, називається GPT: Генеративний Попередньо Навчений Трансформер.

Тест перед лекцією

Генерація тексту та заплутаність

Ідея нейронної мережі, яка може виконувати загальні завдання без додаткового навчання, представлена в статті Language Models are Unsupervised Multitask Learners. Основна ідея полягає в тому, що багато інших завдань можна моделювати за допомогою генерації тексту, оскільки розуміння тексту фактично означає здатність його створювати. Оскільки модель навчена на величезній кількості тексту, що охоплює людські знання, вона також стає обізнаною в широкому спектрі тем.

Розуміння та здатність створювати текст також передбачає знання про навколишній світ. Люди значною мірою навчаються через читання, і мережа GPT схожа в цьому аспекті.

Мережі генерації тексту працюють, прогнозуючи ймовірність наступного слова $P(w_N). Однак безумовна ймовірність наступного слова дорівнює частоті цього слова в текстовому корпусі. GPT здатна надати нам **умовну ймовірність** наступного слова, враховуючи попередні: P(w_N | w_{n-1}, ..., w_0)$.

Ви можете дізнатися більше про ймовірності в нашій Програмі для початківців у сфері Data Science.

Якість моделі генерації тексту можна визначити за допомогою заплутаності. Це внутрішній показник, який дозволяє оцінити якість моделі без використання набору даних для конкретного завдання. Він базується на понятті ймовірності речення - модель присвоює високу ймовірність реченню, яке, ймовірно, є реальним (тобто модель не заплутана ним), і низьку ймовірність реченням, які мають менший сенс (наприклад, Чи може це робити що?). Коли ми даємо нашій моделі речення з реального текстового корпусу, ми очікуємо, що вони матимуть високу ймовірність і низьку заплутаність. Математично це визначається як нормалізована обернена ймовірність тестового набору:


\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}

Ви можете експериментувати з генерацією тексту, використовуючи текстовий редактор на основі GPT від Hugging Face. У цьому редакторі ви починаєте писати текст, і натискання [TAB] запропонує вам кілька варіантів завершення. Якщо вони занадто короткі або вас не задовольняють - натисніть [TAB] ще раз, і ви отримаєте більше варіантів, включаючи довші фрагменти тексту.

GPT - це сімейство

GPT - це не одна модель, а колекція моделей, розроблених і навчених OpenAI.

Серед моделей GPT є:

GPT-2 GPT-3 GPT-4
Мовна модель з до 1,5 мільярда параметрів. Мовна модель з до 175 мільярдів параметрів. 100T параметрів, приймає як зображення, так і текстові входи, а виходом є текст.

Моделі GPT-3 та GPT-4 доступні як когнітивна служба від Microsoft Azure та через API OpenAI.

Інженерія запитів

Оскільки GPT навчена на величезних обсягах даних для розуміння мови та коду, вона надає відповіді у відповідь на введення (запити). Запити - це введення або запити до GPT, де ви надаєте моделі інструкції щодо завдань, які вона має виконати. Щоб отримати бажаний результат, необхідно створити найефективніший запит, що включає вибір правильних слів, форматів, фраз або навіть символів. Цей підхід називається Інженерією запитів.

Ця документація надає більше інформації про інженерію запитів.

✍️ Приклад блокнота: Гра з OpenAI-GPT

Продовжуйте навчання за допомогою наступних блокнотів:

Висновок

Нові загальні попередньо навчені мовні моделі не лише моделюють структуру мови, але й містять величезну кількість природної мови. Таким чином, їх можна ефективно використовувати для вирішення деяких завдань обробки природної мови в режимах zero-shot або few-shot.

Тест після лекції