|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CBoW-PyTorch.ipynb | ||
| CBoW-TF.ipynb | ||
| README.md | ||
README.md
การสร้างแบบจำลองภาษา
การฝังเชิงความหมาย เช่น Word2Vec และ GloVe ถือเป็นก้าวแรกของ การสร้างแบบจำลองภาษา - การสร้างโมเดลที่สามารถ เข้าใจ (หรือ แสดงออก) ถึงธรรมชาติของภาษาได้ในบางรูปแบบ
แบบทดสอบก่อนเรียน
แนวคิดหลักของการสร้างแบบจำลองภาษาคือการฝึกโมเดลด้วยชุดข้อมูลที่ไม่มีการติดป้ายกำกับในลักษณะของการเรียนรู้แบบไม่มีผู้สอน (unsupervised learning) ซึ่งสำคัญมากเพราะเรามีข้อความที่ไม่มีการติดป้ายกำกับจำนวนมหาศาล ในขณะที่ข้อความที่มีการติดป้ายกำกับจะถูกจำกัดด้วยความพยายามที่เราสามารถใช้ในการติดป้ายกำกับได้ โดยส่วนใหญ่แล้ว เราสามารถสร้างแบบจำลองภาษาที่สามารถ ทำนายคำที่หายไป ในข้อความได้ เพราะการสุ่มปิดบังคำในข้อความและใช้เป็นตัวอย่างการฝึกสอนนั้นทำได้ง่าย
การฝึกฝังเชิงความหมาย
ในตัวอย่างก่อนหน้านี้ เราได้ใช้การฝังเชิงความหมายที่ผ่านการฝึกมาแล้ว แต่จะน่าสนใจมากหากเราได้เห็นว่าการฝังเหล่านั้นถูกฝึกอย่างไร มีแนวคิดหลายอย่างที่สามารถนำมาใช้ได้ เช่น:
- การสร้างแบบจำลองภาษาแบบ N-Gram ซึ่งเราทำนายโทเค็นโดยดูจากโทเค็นก่อนหน้า N ตัว (N-gram)
- Continuous Bag-of-Words (CBoW) ซึ่งเราทำนายโทเค็นตรงกลาง
W_0ในลำดับโทเค็นW_{-N}, ...,W_N - Skip-gram ซึ่งเราทำนายชุดโทเค็นที่อยู่ใกล้เคียง {
W_{-N},\dots, W_{-1}, W_1,\dots, W_N} จากโทเค็นตรงกลางW_0
ภาพจาก งานวิจัยนี้
✍️ ตัวอย่างโน้ตบุ๊ก: การฝึกโมเดล CBoW
เรียนรู้เพิ่มเติมได้ในโน้ตบุ๊กต่อไปนี้:
สรุป
ในบทเรียนก่อนหน้านี้ เราได้เห็นว่าการฝังคำทำงานได้อย่างน่าอัศจรรย์! ตอนนี้เรารู้แล้วว่าการฝึกฝังคำไม่ใช่เรื่องซับซ้อนมากนัก และเราควรจะสามารถฝึกฝังคำของเราเองสำหรับข้อความเฉพาะทางได้หากจำเป็น
แบบทดสอบหลังเรียน
การทบทวนและการศึกษาด้วยตนเอง
- บทเรียนอย่างเป็นทางการของ PyTorch เกี่ยวกับการสร้างแบบจำลองภาษา
- บทเรียนอย่างเป็นทางการของ TensorFlow เกี่ยวกับการฝึกโมเดล Word2Vec
- การใช้เฟรมเวิร์ก gensim เพื่อฝึกฝังคำที่ใช้บ่อยที่สุดในโค้ดเพียงไม่กี่บรรทัด อธิบายไว้ ในเอกสารนี้
🚀 งานที่ได้รับมอบหมาย: ฝึกโมเดล Skip-Gram
ในห้องปฏิบัติการ เราขอท้าให้คุณปรับเปลี่ยนโค้ดจากบทเรียนนี้เพื่อฝึกโมเดล Skip-Gram แทน CBoW อ่านรายละเอียด
ข้อจำกัดความรับผิดชอบ:
เอกสารนี้ได้รับการแปลโดยใช้บริการแปลภาษา AI Co-op Translator แม้ว่าเราจะพยายามให้การแปลมีความถูกต้อง แต่โปรดทราบว่าการแปลอัตโนมัติอาจมีข้อผิดพลาดหรือความไม่แม่นยำ เอกสารต้นฉบับในภาษาดั้งเดิมควรถือเป็นแหล่งข้อมูลที่เชื่อถือได้ สำหรับข้อมูลที่สำคัญ ขอแนะนำให้ใช้บริการแปลภาษาจากผู้เชี่ยวชาญ เราไม่รับผิดชอบต่อความเข้าใจผิดหรือการตีความที่ผิดพลาดซึ่งเกิดจากการใช้การแปลนี้
