AI-For-Beginners/translations/ru/lessons/5-NLP/20-LangModels
localizeflow[bot] 7a7aeb92a1 chore(i18n): sync translations with latest source changes (chunk 1/1, 203 changes) 2026-01-30 01:10:04 +00:00
..
GPT-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-28 12:35:46 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 203 changes) 2026-01-30 01:10:04 +00:00

README.md

Предобученные крупные языковые модели

Во всех предыдущих задачах мы обучали нейронную сеть выполнять определённую задачу, используя размеченный набор данных. С крупными трансформерными моделями, такими как BERT, мы используем языковое моделирование в самосупервизируемом режиме, чтобы создать языковую модель, которая затем специализируется на конкретной задаче с дополнительным обучением в определённой области. Однако было доказано, что крупные языковые модели могут решать множество задач без какого-либо обучения, связанного с конкретной областью. Семейство моделей, способных на это, называется GPT: Генеративный Предобученный Трансформер.

Тест перед лекцией

Генерация текста и перплексия

Идея о том, что нейронная сеть может выполнять общие задачи без дополнительного обучения, представлена в статье Language Models are Unsupervised Multitask Learners. Основная мысль заключается в том, что многие другие задачи можно моделировать с помощью генерации текста, поскольку понимание текста фактически означает способность его создавать. Поскольку модель обучена на огромном объёме текста, охватывающем человеческие знания, она также становится осведомлённой в широком круге тем.

Понимание и способность создавать текст также подразумевают знание чего-то о мире вокруг нас. Люди в значительной степени учатся через чтение, и сеть GPT похожа в этом отношении.

Сети генерации текста работают, предсказывая вероятность следующего слова $P(w_N). Однако безусловная вероятность следующего слова равна частоте этого слова в текстовом корпусе. GPT может предоставить нам **условную вероятность** следующего слова, учитывая предыдущие: P(w_N | w_{n-1}, ..., w_0)$.

Подробнее о вероятностях вы можете прочитать в нашем курсе для начинающих по Data Science.

Качество модели генерации текста можно определить с помощью перплексии. Это внутренний метрик, который позволяет измерить качество модели без использования набора данных, связанного с конкретной задачей. Он основан на понятии вероятности предложения — модель присваивает высокую вероятность предложению, которое, скорее всего, является реальным (т.е. модель не озадачена им), и низкую вероятность предложениям, которые менее осмысленны (например, Может ли это что?). Когда мы предоставляем нашей модели предложения из реального текстового корпуса, мы ожидаем, что они будут иметь высокую вероятность и низкую перплексию. Математически это определяется как нормализованная обратная вероятность тестового набора:


\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}

Вы можете поэкспериментировать с генерацией текста, используя редактор текста на основе GPT от Hugging Face. В этом редакторе вы начинаете писать текст, и нажатие [TAB] предложит вам несколько вариантов завершения. Если они слишком короткие или вас не устраивают — нажмите [TAB] снова, и вы получите больше вариантов, включая более длинные фрагменты текста.

GPT — это семейство моделей

GPT — это не одна модель, а целая коллекция моделей, разработанных и обученных OpenAI.

Среди моделей GPT:

GPT-2 GPT-3 GPT-4
Языковая модель с до 1,5 миллиарда параметров. Языковая модель с до 175 миллиардов параметров. 100 триллионов параметров, принимает как изображения, так и текст, а выводит текст.

Модели GPT-3 и GPT-4 доступны как когнитивный сервис от Microsoft Azure и через API OpenAI.

Инженерия запросов (Prompt Engineering)

Поскольку GPT обучен на огромных объёмах данных для понимания языка и кода, он предоставляет ответы на входные данные (запросы). Запросы — это входные данные или вопросы для GPT, где пользователь даёт инструкции модели о задачах, которые она должна выполнить. Чтобы получить желаемый результат, необходимо составить наиболее эффективный запрос, что включает выбор правильных слов, форматов, фраз или даже символов. Этот подход называется инженерией запросов.

Эта документация предоставляет больше информации об инженерии запросов.

✍️ Пример блокнота: Работа с OpenAI-GPT

Продолжите обучение с помощью следующих блокнотов:

Заключение

Новые универсальные предобученные языковые модели не только моделируют структуру языка, но и содержат огромный объём естественного языка. Таким образом, их можно эффективно использовать для решения некоторых задач обработки естественного языка в режимах zero-shot или few-shot.

Тест после лекции