|
|
||
|---|---|---|
| .. | ||
| README.md | ||
README.md
ការបណ្តុះបណ្តាលម៉ូឌែល Skip-Gram
ការងារពហុភាសាចេញពី មេរៀន AI សម្រាប់អ្នកចាប់ផ្ដើម។
បេសកកម្ម
ក្នុងមេរៀននេះ អ្នកត្រូវតែបណ្តុះបណ្តាលម៉ូឌែល Word2Vec ដោយប្រើជំនាញ Skip-Gram។ បណ្តុះបណ្តាលបណ្ដាញជាមួយ embedding ដើម្បីទាក់ទង់ពាក្យជិតខាងនៅក្នុងបញ្ចាំង Skip-Gram ដែលមានទទឹង N-tokens។ អ្នកអាចប្រើ កូដពីមេរៀននេះ ហើយកែប្រែវាបន្តិច។
សំណុំទិន្នន័យ
អ្នកអាចប្រើសៀវភៅណាមួយគ្រប់ប្រភេទបាន។ អ្នកអាចស្វែងរកអត្ថបទឥតគិតថ្លៃជាច្រើននៅ Project Gutenberg, ឧទាហរណ៍ នេះគឺជាលីងផ្ទាល់ទៅកាន់ រឿង Alice's Adventures in Wonderland) រៀបរៀងដោយ Lewis Carroll។ ឬអ្នកអាចប្រើរឿងរបៀបរបស់ Shakespeare ដែលអ្នកអាចទាញយកដោយប្រើកូដខាងក្រោម៖
path_to_file = tf.keras.utils.get_file(
'shakespeare.txt',
'https://storage.googleapis.com/download.tensorflow.org/data/shakespeare.txt')
text = open(path_to_file, 'rb').read().decode(encoding='utf-8')
ស្វែងយល់!
បើអ្នកមានពេលវេលា និងចង់ទទួលបានការយល់ដឹងជ្រាលជ្រៅក្នុងប្រធាននេះ សូមព្យាយាមស្វែងរករឿងខ្លះៗ៖
- តើទំហំ embedding ធ្វើឲ្យលទ្ធផលមានភាពប៉ះពាល់យ៉ាងដូចម្តេច?
- តើរចនាប័ទ្មអត្ថបទផ្សេងៗធ្វើឲ្យលទ្ធផលមានភាពខុសគ្នាយ៉ាងដូចម្តេច?
- យកពាក្យប្រភេទខុសគ្នា និងពាក្យនិយមរបស់ពួកវា ចាប់យកតំណាងវ៉ិចទ័រ រួចប្រើ PCA ដើម្បីកាត់បន្ថយវិមាត្រទៅជាពីរ ហើយគូសពួកវានៅលើទីតាំង 2D។ តើអ្នកមើលឃើញលំនាំណាមួយទេ?
ការបដិសេធ៖
ឯកសារនេះត្រូវបានបំលែងភាសាដោយប្រើសេវាកម្មបំលែងភាសា AI Co-op Translator។ ខណៈពេលដែលយើងខិតខំធានារឿងភាពត្រឹមត្រូវ សូមយល់ឲ្យដឹងថាបំលែងភាសាដោយស្វ័យប្រវត្តិនេះអាចមានកំហុស ឬភាពមិនត្រឹមត្រូវ។ ឯកសារដើមជាភាសាទូទៅគួរត្រូវបានគេពិចារណាថាជាធនធានច្បាស់លាស់។ សម្រាប់ព័ត៌មានសំខាន់ៗ យើងស្នើឲ្យប្រើការបំលែងភាសារដោយអ្នកជំនាញមនុស្ស។ យើងមិនទទួលខុសត្រូវចំពោះការយល់ច្រឡំ ឬការបកស្រាយខុសណាមួយដែលកើតឡើងពីការប្រើប្រាស់បំលែងភាសានេះឡើយ។