AI-For-Beginners/translations/bg/lessons/5-NLP/15-LanguageModeling
leestott fee00e62ca 🌐 Update translations via Co-op Translator 2025-08-30 01:17:50 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 01:17:50 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 01:17:50 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-26 01:51:51 +00:00

README.md

Моделиране на език

Семантичните вграждания, като Word2Vec и GloVe, всъщност са първа стъпка към моделиране на език - създаване на модели, които по някакъв начин разбират (или представляват) природата на езика.

Тест преди лекцията

Основната идея зад моделирането на език е обучението им върху немаркирани набори от данни по неуправляем начин. Това е важно, защото разполагаме с огромни количества немаркиран текст, докато количеството маркиран текст винаги ще бъде ограничено от усилията, които можем да вложим в маркирането. Най-често можем да изградим езикови модели, които могат да предсказват липсващи думи в текста, защото е лесно да се скрие случайна дума в текста и да се използва като тренировъчен пример.

Обучение на вграждания

В предишните примери използвахме предварително обучени семантични вграждания, но е интересно да видим как тези вграждания могат да бъдат обучени. Съществуват няколко възможни идеи, които могат да се използват:

  • N-Gram моделиране на език, при което предсказваме токен, като разглеждаме N предишни токена (N-грам).
  • Непрекъсната торба с думи (CBoW), при което предсказваме средния токен W_0 в последователност от токени W_{-N}, ..., W_N.
  • Skip-gram, където предсказваме набор от съседни токени {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} от средния токен W_0.

изображение от статия за преобразуване на думи във вектори

Изображение от тази статия

✍️ Примерни тетрадки: Обучение на CBoW модел

Продължете обучението си с помощта на следните тетрадки:

Заключение

В предишния урок видяхме, че вгражданията на думи работят като магия! Сега знаем, че обучението на вграждания на думи не е много сложна задача и трябва да можем да обучим собствени вграждания на думи за текстове, специфични за дадена област, ако е необходимо.

Тест след лекцията

Преглед и самостоятелно обучение

🚀 Задача: Обучение на Skip-Gram модел

В лабораторната работа ви предизвикваме да модифицирате кода от този урок, за да обучите Skip-Gram модел вместо CBoW. Прочетете подробностите

Отказ от отговорност:
Този документ е преведен с помощта на AI услуга за превод Co-op Translator. Въпреки че се стремим към точност, моля, имайте предвид, че автоматизираните преводи може да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Ние не носим отговорност за недоразумения или погрешни интерпретации, произтичащи от използването на този превод.