AI-For-Beginners/translations/id/lessons/5-NLP/15-LanguageModeling
localizeflow[bot] c0566b76f0 chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:14:00 +00:00
..
lab chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:14:00 +00:00
CBoW-PyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
CBoW-TF.ipynb 🌐 Update translations via Co-op Translator 2025-08-29 16:53:37 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 201 changes) 2026-01-30 02:14:00 +00:00

README.md

Pemodelan Bahasa

Embedding semantik, seperti Word2Vec dan GloVe, sebenarnya adalah langkah awal menuju pemodelan bahasa - menciptakan model yang dapat memahami (atau merepresentasikan) sifat dari bahasa.

Kuis sebelum pelajaran

Ide utama di balik pemodelan bahasa adalah melatihnya pada dataset tanpa label secara unsupervised. Hal ini penting karena kita memiliki jumlah teks tanpa label yang sangat besar, sementara jumlah teks berlabel selalu terbatas oleh upaya yang dapat kita lakukan untuk memberi label. Sebagian besar waktu, kita dapat membangun model bahasa yang dapat memprediksi kata yang hilang dalam teks, karena mudah untuk menyembunyikan kata secara acak dalam teks dan menggunakannya sebagai sampel pelatihan.

Melatih Embedding

Dalam contoh sebelumnya, kita menggunakan embedding semantik yang sudah dilatih sebelumnya, tetapi menarik untuk melihat bagaimana embedding tersebut dapat dilatih. Ada beberapa ide yang dapat digunakan:

  • Pemodelan bahasa N-Gram, di mana kita memprediksi sebuah token dengan melihat N token sebelumnya (N-gram).
  • Continuous Bag-of-Words (CBoW), di mana kita memprediksi token tengah W_0 dalam urutan token W_{-N}, ..., W_N.
  • Skip-gram, di mana kita memprediksi sekumpulan token tetangga {W_{-N},\dots, W_{-1}, W_1,\dots, W_N} dari token tengah W_0.

gambar dari makalah tentang mengonversi kata menjadi vektor

Gambar dari makalah ini

✍️ Contoh Notebook: Melatih Model CBoW

Lanjutkan pembelajaran Anda melalui notebook berikut:

Kesimpulan

Dalam pelajaran sebelumnya, kita telah melihat bahwa embedding kata bekerja seperti sihir! Sekarang kita tahu bahwa melatih embedding kata bukanlah tugas yang terlalu rumit, dan kita seharusnya dapat melatih embedding kata kita sendiri untuk teks spesifik domain jika diperlukan.

Kuis setelah pelajaran

Tinjauan & Studi Mandiri

🚀 Tugas: Melatih Model Skip-Gram

Dalam lab, kami menantang Anda untuk memodifikasi kode dari pelajaran ini untuk melatih model skip-gram alih-alih CBoW. Baca detailnya