AI-For-Beginners/translations/km/lessons/5-NLP/20-LangModels
localizeflow[bot] 15889730ce chore(i18n): sync translations with latest source changes (chunk 4/4, 60 changes) 2026-04-06 20:21:20 +00:00
..
GPT-PyTorch.ipynb chore(i18n): sync translations with latest source changes (chunk 4/4, 60 changes) 2026-04-06 20:21:20 +00:00
README.md chore(i18n): sync translations with latest source changes (chunk 4/4, 60 changes) 2026-04-06 20:21:20 +00:00

README.md

ម៉ូដែលភាសាច្រើនទំហំធំដែលបានបណ្ដុះស្រាប់

ក្នុងកិច្ចការមុនៗទាំងអស់របស់យើង យើងបានបណ្ដុះបណ្ដាលបណ្តាញសរសៃប្រព័ន្ធប្រព័ន្ធប្រព័ន្ធកណ្តាលដើម្បីអនុវត្តន៍កិច្ចការមួយជាមួយគ្រឿងទិន្នន័យដែលបានស្លាក។ ជាមួយម៉ូដែលបំលែងធំៗ ដូចជា BERT យើងប្រើការមូដែលភាសាក្នុងរបៀបផ្ទាល់ខ្លួនដោយខ្លួនឯងដើម្បីបង្កើតម៉ូដែលភាសា ដែលបន្ទាប់មកត្រូវបានជំនាញសម្រាប់កិច្ចការចុះក្រោមជាក់លាក់ដោយបណ្ដុះបណ្ដាលសម្រាប់វាលជាក់លាក់បន្ថែមទៀត។ ទោះបីយ៉ាងណា មានការបង្ហាញថា ម៉ូដែលភាសាធំៗអាចដោះស្រាយកិច្ចការច្រើនប្រភេទដោយគ្មានការបណ្ដុះបណ្ដាលសម្រាប់វាលជាក់លាក់ណាមួយ។ គ្រួសារម៉ូដែលដែលមានសមត្ថភាពធ្វើបានបែបនេះគឺហៅថា GPT: Generative Pre-Trained Transformer។

កម្រងសំណួរមុនបង្រៀន

ការបង្កើតអត្ថបទ និង Perplexity

គំនិតនៃបណ្តាញសរសៃប្រព័ន្ធអាចអនុវត្តកិច្ចការទូទៅដោយគ្មានការបណ្ដុះបណ្ដាលក្រោយត្រូវបានបង្ហាញក្នុងឯកសារ Language Models are Unsupervised Multitask Learners។ គំនិតចម្បងគឺកិច្ចការច្រើនផ្សេងទៀតអាចត្រូវបានម៉ូដែលដោយប្រើ ការបង្កើតអត្ថបទ ពីព្រោះការយល់ដឹងអត្ថបទមានន័យថាអាចផលិតវាបាន។ ពីព្រោះម៉ូដែលត្រូវបានបណ្ដុះបណ្ដាលលើអត្ថបទជាច្រើនដ៏ធំ ដែលរួមបញ្ចូលចំណេះដឹងរបស់មនុស្ស វាក៏ក្លាយជាមានចំណេះដឹងពីប្រធានបទជាច្រើនផងដែរ។

ការយល់ដឹង និងអាចផលិតអត្ថបទក៏មានន័យថាត្រូវដឹងអ្វីៗកុំផ្លែកពីពិភពដែលនៅជុំវិញយើងផងដែរ។ មនុស្សក៏រៀនតាមរយៈការអានដល់កម្រិតធំជាថ្មីៗ ហើយបណ្តាញ GPT គឺដូចជានោះផងដែរ។

បណ្តាញបង្កើតអត្ថបទដំណើរការតាមរយៈការទស្សនាព្រោងនៃពាក្យបន្ទាប់ $P(w_N)ប៉ុន្តែ ចំណុចកំណត់អន្យាក្នុងការទស្សនាព្រោងនៃពាក្យបន្ទាប់ដូចជាប្រសាររបស់ពាក្យនេះក្នុងអត្ថបទ។ GPT អាចផ្ដល់ឱ្យយើង **ចំណុចកំណត់ក្នុងការទស្សនាព្រោង** នៃពាក្យបន្ទាប់ ដែលមានលក្ខខណ្ឌដោយពាក្យមុនៗ:P(w_N | w_{n-1}, ..., w_0)$

អ្នកអាចអានបន្ថែមអំពីចំណុចកំណត់ក្នុងការទស្សនាព្រោងក្នុង កម្មវិធីសិក្សាពត៌មានវិទ្យាសម្រាប់អ្នកចាប់ផ្តើម

គុណភាពនៃម៉ូដែលបង្កើតភាសាអាចកំណត់ដោយប្រើ perplexity។ វាជាមេត្រដែលមានលក្ខណៈផ្ទាល់ខ្លួនដែលអនុញ្ញាតឲ្យយើងវាស់បានគុណភាពម៉ូដែលដោយគ្មានគ្រឿងទិន្នន័យសម្រាប់កិច្ចការជាក់លាក់ណាមួយ។ វាត្រូវបានគេពិចារណារក់នៅលើគំនិត ចំណុចកំណត់នៃវាក្យបថ - ម៉ូដែលផ្ដល់ចំណុចកំណត់ខ្ពស់ទៅវាក្យបថដែលមានសក្តានុពលដើម្បីជាការពិត (គឺម៉ូដែលមិន ភ្ញាក់ផ្អើល ពីវា), ហើយចំណុចកំណត់ទាបទៅវាក្យបថដែលមិនសមរម្យ (ឧ. Can it does what?)។ ពេលដែលយើងផ្ដល់ម៉ូដែលនូវវាក្យបថពីអត្ថបទពិត អ្នកនឹងរំពឹងថាវាត្រូវមានចំណុចកំណត់ខ្ពស់ និង perplexity ទាប។ ភាសាដោយគណិតវិទ្យា វាត្រូវបានកំណត់ជាចំនួនបំបែកក្រោមនៃចំណុចកំណត់ឧបករណ៍តេស្ត៖


\mathrm{Perplexity}(W) = \sqrt[N]{1\over P(W_1,...,W_N)}

អ្នកអាចសាកល្បងបង្កើតអត្ថបទដោយប្រើ កម្មវិធីកែសម្រួលអត្ថបទដែលដំណើរការជាមួយ GPT ពី Hugging Face។ នៅក្នុងកម្មវិធីកែសម្រួលនេះ អ្នកចាប់ផ្តើមសរសេរអត្ថបទរបស់អ្នក ហើយចុច [TAB] នឹងផ្ដល់ជម្រើសបញ្ចប់ជាច្រើន។ ប្រសិនបើវាខ្លីពេក ឬអ្នកមិនពេញចិត្ត អ្នកអាចចុច [TAB] ម្តងទៀត ហើយអ្នកនឹងទទួលបានជម្រើសបន្ថែម រួមមានអត្ថបទវែងជាង។

GPT គឺជាគ្រួសារ

GPT មិនមែនជាម៉ូដែលតែមួយទេ ប៉ុន្តែជាការប្រមូលផ្តុំម៉ូដែល ដែលបានអភិវឌ្ឍន៍ និងបណ្ដុះបណ្ដាលដោយ OpenAI

ក្រោមម៉ូដែល GPT យើងមាន៖

GPT-2 GPT 3 GPT-4
ម៉ូដែលភាសាមួយដែលមានរហូតដល់ 1.5 ពាន់លានពារ៉ាម៉ែត្រ។ ម៉ូដែលភាសាមួយដែលមានរហូតដល់ 175 ពាន់លានពារ៉ាមែត្រ 100T ពារ៉ាមែត្រ និងទទួលទ both រូបភាព និងអត្ថបទចូល និងបញ្ចេញអត្ថបទ។

ម៉ូដែល GPT-3 និង GPT-4 មានគ្រប់លក្ខណៈជាសេវាជំនាញខាងចំណេះដឹកដល់ផ្នែកចរិតពី Microsoft Azure (source) និង OpenAI API

វិស្វកម្មបញ្ចូលសុវត្ថិភាព

ដោយសារតែ GPT ត្រូវបានបណ្ដុះបណ្ដាលលើទិន្នន័យជាច្រើនដើម្បីយល់ភាសា និងកូដ វាផ្ដល់លទ្ធផលឆ្លើយតបនឹងការបញ្ចូល (prompts)។ Prompts គឺជាការបញ្ចូល ឬ សំណួរដែលស្នើដល់ម៉ូដែលដើម្បីអនុវត្តកិច្ចការដែលអ្នកត្រូវការបន្ទាប់។ ដើម្បីទទួលបានលទ្ធផលដែលចង់បាន អ្នកត្រូវការបញ្ចូលជាដ៏មានប្រសិទ្ធភាពសម្រាប់ការជ្រើសរើសពាក្យទ្រឹងទ្រាយ ប្រយោគ ឬ សញ្ញា។ វិធីសាស្រ្តនេះហៅថា វិស្វកម្មបញ្ចូល

ឯកសារនេះ ផ្ដល់ព័ត៌មានបន្ថែមអំពីវិស្វកម្មបញ្ចូល។

✍️ ឧទាហរណ៍កំណត់ត្រា៖ លេងជាមួយ OpenAI-GPT

បន្តការសិក្សារបស់អ្នកក្នុងកំណត់ត្រាដូចខាងក្រោម៖

សេចក្ដីសន្និដ្ឋាន

ម៉ូដែលភាសាថ្មីទូទៅដែលបានបណ្ដុះស្រាប់ មិនត្រឹមតែម៉ូដែលរចនាសម្ព័ន្ធភាសាប៉ុណ្ណោះទេ តែថែមទាំងផ្ទុកចំណុចច្រើននៃភាសាប្រពៃណី។ ដូច្នេះវាអាចប្រើបានយ៉ាងមានប្រសិទ្ធភាពក្នុងការដោះស្រាយកិច្ចការផ្នែក NLP មួយចំនួនដោយគ្មានការបណ្ដុះបណ្ដាល ឬ តិចតួច។

កម្រងសំណួរផ្ដើមក្រោយបង្រៀន


ការបព្ចាញ់
ឯកសារនេះត្រូវបានបកប្រែដោយប្រើសេវាបកប្រែ AI Co-op Translator។ ខណៈពេលដែលយើងខិតខំប្រឹងប្រែងក្នុងការធានាគុណភាពភាពត្រូវតែម្តង កុំភ្លេចថាការបកប្រែដោយស្វ័យប្រវត្តិអាចមានកំហុស ឬការខុសគ្នាផ្សេងៗ។ ឯកសារដើមនៅក្នុងភាសាដើមគួរត្រូវបានទទួលស្គាល់ជាឯកសារមូលដ្ឋានដ៏ត្រឹមត្រូវ។ សម្រាប់ព័ត៌មានដែលមានសារៈសំខាន់ យើងណែនាំឱ្យប្រើប្រាស់ការបកប្រែដោយមនុស្សវិជ្ជាជីវៈ។ យើងមិនទទួលខុសត្រូវចំពោះការយល់ច្រឡំ ឬការបកប្រែខុសព្រោះពីការប្រើប្រាស់ការបកប្រែនេះឡើយ។