|
|
||
|---|---|---|
| .. | ||
| GPT-PyTorch.ipynb | ||
| README.md | ||
README.md
Model Bahasa Besar yang Telah Dilatih
Dalam semua tugasan sebelumnya, kita melatih rangkaian neural untuk melaksanakan tugas tertentu menggunakan dataset berlabel. Dengan model transformer besar seperti BERT, kita menggunakan pemodelan bahasa secara kendiri untuk membina model bahasa, yang kemudian disesuaikan untuk tugas tertentu dengan latihan tambahan yang lebih spesifik kepada domain. Walau bagaimanapun, telah dibuktikan bahawa model bahasa besar juga boleh menyelesaikan banyak tugas tanpa latihan khusus domain. Keluarga model yang mampu melakukan ini dipanggil GPT: Generative Pre-Trained Transformer.
Kuiz Pra-Kuliah
Penjanaan Teks dan Perplexity
Idea rangkaian neural yang mampu melaksanakan tugas umum tanpa latihan tambahan diperkenalkan dalam kertas kerja Language Models are Unsupervised Multitask Learners. Idea utama adalah bahawa banyak tugas lain boleh dimodelkan menggunakan penjanaan teks, kerana memahami teks pada dasarnya bermaksud mampu menghasilkan teks. Oleh kerana model dilatih dengan sejumlah besar teks yang merangkumi pengetahuan manusia, ia juga menjadi berpengetahuan tentang pelbagai subjek.
Memahami dan mampu menghasilkan teks juga melibatkan pengetahuan tentang dunia di sekeliling kita. Manusia juga banyak belajar melalui pembacaan, dan rangkaian GPT serupa dalam aspek ini.
Rangkaian penjanaan teks berfungsi dengan meramalkan kebarangkalian perkataan seterusnya $P(w_N). Walau bagaimanapun, kebarangkalian tanpa syarat perkataan seterusnya adalah sama dengan kekerapan perkataan tersebut dalam korpus teks. GPT mampu memberikan **kebarangkalian bersyarat** perkataan seterusnya, berdasarkan perkataan sebelumnya: P(w_N | w_{n-1}, ..., w_0)$
Anda boleh membaca lebih lanjut tentang kebarangkalian dalam Kurikulum Data Science untuk Pemula.
Kualiti model penjanaan bahasa boleh ditentukan menggunakan perplexity. Ia adalah metrik intrinsik yang membolehkan kita mengukur kualiti model tanpa dataset khusus tugas. Ia berdasarkan konsep kebarangkalian ayat - model memberikan kebarangkalian tinggi kepada ayat yang berkemungkinan nyata (iaitu model tidak keliru dengannya), dan kebarangkalian rendah kepada ayat yang kurang masuk akal (contohnya, Bolehkah ia lakukan apa?). Apabila kita memberikan model kita ayat daripada korpus teks sebenar, kita menjangkakan ia mempunyai kebarangkalian tinggi dan perplexity rendah. Secara matematik, ia ditakrifkan sebagai kebarangkalian songsang normalisasi bagi set ujian:
\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}
Anda boleh bereksperimen dengan penjanaan teks menggunakan editor teks berkuasa GPT dari Hugging Face. Dalam editor ini, anda mula menulis teks anda, dan menekan [TAB] akan memberikan beberapa pilihan pelengkap. Jika pilihan tersebut terlalu pendek, atau anda tidak berpuas hati dengannya - tekan [TAB] sekali lagi, dan anda akan mendapat lebih banyak pilihan, termasuk teks yang lebih panjang.
GPT adalah Keluarga
GPT bukan satu model tunggal, tetapi koleksi model yang dibangunkan dan dilatih oleh OpenAI.
Di bawah model GPT, kita mempunyai:
| GPT-2 | GPT 3 | GPT-4 |
|---|---|---|
| Model bahasa dengan sehingga 1.5 bilion parameter. | Model bahasa dengan sehingga 175 bilion parameter | 100T parameter dan menerima input imej serta teks dan menghasilkan output teks. |
Model GPT-3 dan GPT-4 tersedia sebagai perkhidmatan kognitif dari Microsoft Azure, dan sebagai API OpenAI.
Kejuruteraan Prompt
Oleh kerana GPT telah dilatih dengan sejumlah besar data untuk memahami bahasa dan kod, ia memberikan output sebagai tindak balas kepada input (prompt). Prompt adalah input atau pertanyaan kepada GPT di mana seseorang memberikan arahan kepada model tentang tugas yang perlu diselesaikan. Untuk mendapatkan hasil yang diinginkan, anda memerlukan prompt yang paling efektif, yang melibatkan pemilihan kata-kata, format, frasa, atau simbol yang tepat. Pendekatan ini dipanggil Kejuruteraan Prompt.
Dokumentasi ini memberikan maklumat lanjut tentang kejuruteraan prompt.
✍️ Notebook Contoh: Bermain dengan OpenAI-GPT
Teruskan pembelajaran anda dalam notebook berikut:
Kesimpulan
Model bahasa pra-latih umum yang baru bukan sahaja memodelkan struktur bahasa, tetapi juga mengandungi sejumlah besar bahasa semula jadi. Oleh itu, ia boleh digunakan dengan berkesan untuk menyelesaikan beberapa tugas NLP dalam tetapan zero-shot atau few-shot.