# ការបណ្តុះបណ្តាលម៉ូឌែល Skip-Gram ការងារពហុភាសាចេញពី [មេរៀន AI សម្រាប់អ្នកចាប់ផ្ដើម](https://github.com/microsoft/ai-for-beginners)។ ## បេសកកម្ម ក្នុងមេរៀននេះ អ្នកត្រូវតែបណ្តុះបណ្តាលម៉ូឌែល Word2Vec ដោយប្រើជំនាញ Skip-Gram។ បណ្តុះបណ្តាលបណ្ដាញជាមួយ embedding ដើម្បីទាក់ទង់ពាក្យជិតខាងនៅក្នុងបញ្ចាំង Skip-Gram ដែលមានទទឹង $N$-tokens។ អ្នកអាចប្រើ [កូដពីមេរៀននេះ](../CBoW-TF.ipynb) ហើយកែប្រែវាបន្តិច។ ## សំណុំទិន្នន័យ អ្នកអាចប្រើសៀវភៅណាមួយគ្រប់ប្រភេទបាន។ អ្នកអាចស្វែងរកអត្ថបទឥតគិតថ្លៃជាច្រើននៅ [Project Gutenberg](https://www.gutenberg.org/), ឧទាហរណ៍ នេះគឺជាលីងផ្ទាល់ទៅកាន់ [រឿង Alice's Adventures in Wonderland](https://www.gutenberg.org/files/11/11-0.txt)) រៀបរៀងដោយ Lewis Carroll។ ឬអ្នកអាចប្រើរឿងរបៀបរបស់ Shakespeare ដែលអ្នកអាចទាញយកដោយប្រើកូដខាងក្រោម៖ ```python path_to_file = tf.keras.utils.get_file( 'shakespeare.txt', 'https://storage.googleapis.com/download.tensorflow.org/data/shakespeare.txt') text = open(path_to_file, 'rb').read().decode(encoding='utf-8') ``` ## ស្វែងយល់! បើអ្នកមានពេលវេលា និងចង់ទទួលបានការយល់ដឹងជ្រាលជ្រៅក្នុងប្រធាននេះ សូមព្យាយាមស្វែងរករឿងខ្លះៗ៖ * តើទំហំ embedding ធ្វើឲ្យលទ្ធផលមានភាពប៉ះពាល់យ៉ាងដូចម្តេច? * តើរចនាប័ទ្មអត្ថបទផ្សេងៗធ្វើឲ្យលទ្ធផលមានភាពខុសគ្នាយ៉ាងដូចម្តេច? * យកពាក្យប្រភេទខុសគ្នា និងពាក្យនិយមរបស់ពួកវា ចាប់យកតំណាងវ៉ិចទ័រ រួចប្រើ PCA ដើម្បីកាត់បន្ថយវិមាត្រទៅជាពីរ ហើយគូសពួកវានៅលើទីតាំង 2D។ តើអ្នកមើលឃើញលំនាំណាមួយទេ? --- **ការបដិសេធ**៖ ឯកសារនេះត្រូវបានបំលែងភាសាដោយប្រើសេវាកម្មបំលែងភាសា AI [Co-op Translator](https://github.com/Azure/co-op-translator)។ ខណៈពេលដែលយើងខិតខំធានារឿងភាពត្រឹមត្រូវ សូមយល់ឲ្យដឹងថាបំលែងភាសាដោយស្វ័យប្រវត្តិនេះអាចមានកំហុស ឬភាពមិនត្រឹមត្រូវ។ ឯកសារដើមជាភាសាទូទៅគួរត្រូវបានគេពិចារណាថាជាធនធានច្បាស់លាស់។ សម្រាប់ព័ត៌មានសំខាន់ៗ យើងស្នើឲ្យប្រើការបំលែងភាសារដោយអ្នកជំនាញមនុស្ស។ យើងមិនទទួលខុសត្រូវចំពោះការយល់ច្រឡំ ឬការបកស្រាយខុសណាមួយដែលកើតឡើងពីការប្រើប្រាស់បំលែងភាសានេះឡើយ។