AI-For-Beginners/translations/pt/lessons/5-NLP/15-LanguageModeling
leestott 09060b7955 🌐 Update translations via Co-op Translator 2025-08-31 12:04:42 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-24 10:52:15 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-31 12:04:42 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-31 12:04:42 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-24 10:52:15 +00:00

README.md

Modelação de Linguagem

Embeddings semânticos, como Word2Vec e GloVe, são, na verdade, um primeiro passo em direção à modelação de linguagem - criar modelos que de alguma forma compreendem (ou representam) a natureza da linguagem.

Questionário pré-aula

A ideia principal por trás da modelação de linguagem é treiná-los em conjuntos de dados não rotulados de forma não supervisionada. Isto é importante porque temos grandes quantidades de texto não rotulado disponível, enquanto a quantidade de texto rotulado estará sempre limitada pelo esforço necessário para rotulá-lo. Na maioria das vezes, podemos construir modelos de linguagem que conseguem prever palavras em falta no texto, porque é fácil ocultar uma palavra aleatória no texto e usá-la como amostra de treino.

Treinar Embeddings

Nos nossos exemplos anteriores, utilizámos embeddings semânticos pré-treinados, mas é interessante ver como esses embeddings podem ser treinados. Existem várias ideias possíveis que podem ser utilizadas:

  • Modelação de linguagem N-Gram, onde prevemos um token olhando para os N tokens anteriores (N-grama).
  • Continuous Bag-of-Words (CBoW), onde prevemos o token central W_0 numa sequência de tokens W_{-N}, ..., W_N.
  • Skip-gram, onde prevemos um conjunto de tokens vizinhos {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} a partir do token central W_0.

imagem do artigo sobre conversão de palavras em vetores

Imagem retirada deste artigo

✍️ Notebooks de Exemplo: Treinar modelo CBoW

Continue a sua aprendizagem nos seguintes notebooks:

Conclusão

Na lição anterior vimos que os embeddings de palavras funcionam como magia! Agora sabemos que treinar embeddings de palavras não é uma tarefa muito complexa, e devemos ser capazes de treinar os nossos próprios embeddings para texto específico de domínio, se necessário.

Questionário pós-aula

Revisão & Estudo Autónomo

🚀 Tarefa: Treinar Modelo Skip-Gram

No laboratório, desafiamos-lhe a modificar o código desta lição para treinar um modelo skip-gram em vez de CBoW. Leia os detalhes

Aviso Legal:
Este documento foi traduzido utilizando o serviço de tradução por IA Co-op Translator. Embora nos esforcemos para garantir a precisão, é importante notar que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autoritária. Para informações críticas, recomenda-se a tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.