AI-For-Beginners/translations/ml/lessons/6-Other/22-DeepRL
localizeflow[bot] 514f93318c chore(i18n): sync translations with latest source changes (chunk 1/1, 134 changes) 2026-01-30 03:04:27 +00:00
..
lab chore(i18n): sync translations with latest source changes (chunk 1/1, 134 changes) 2026-01-30 03:04:27 +00:00
CartPole-RL-PyTorch.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00
CartPole-RL-TF.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 134 changes) 2026-01-30 03:04:27 +00:00
notebook.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00
tmp.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00

README.md

ഡീപ് റീഇൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ്

റീഇൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് (RL) സൂപ്പർവൈസ്ഡ് ലേണിംഗിനും അൺസൂപ്പർവൈസ്ഡ് ലേണിംഗിനും പുറമേ ഒരു അടിസ്ഥാന മെഷീൻ ലേണിംഗ് പാരഡൈം ആയി കണക്കാക്കപ്പെടുന്നു. സൂപ്പർവൈസ്ഡ് ലേണിംഗിൽ നമുക്ക് ഫലങ്ങൾ അറിയപ്പെടുന്ന ഡാറ്റാസെറ്റിൽ ആശ്രയിക്കേണ്ടതുണ്ടെങ്കിലും, RL ചെയ്യുന്നതിലൂടെ പഠിക്കുന്നതിൽ ആധാരിതമാണ്. ഉദാഹരണത്തിന്, ഒരു കമ്പ്യൂട്ടർ ഗെയിം ആദ്യമായി കാണുമ്പോൾ, നാം നിയമങ്ങൾ അറിയാതെ പോലും കളിക്കാൻ തുടങ്ങുകയും, കളിച്ചുകൊണ്ടിരിക്കുമ്പോൾ നമ്മുടെ കഴിവുകൾ മെച്ചപ്പെടുത്താൻ കഴിയും.

പ്രീ-ലെക്ചർ ക്വിസ്

RL നടത്താൻ നമുക്ക് ആവശ്യമായത്:

  • ഗെയിമിന്റെ നിയമങ്ങൾ നിശ്ചയിക്കുന്ന ഒരു പരിസ്ഥിതി അല്ലെങ്കിൽ സിമുലേറ്റർ. സിമുലേറ്ററിൽ പരീക്ഷണങ്ങൾ നടത്താനും ഫലങ്ങൾ നിരീക്ഷിക്കാനും കഴിയണം.
  • പരീക്ഷണം എത്രത്തോളം വിജയകരമായിരുന്നുവെന്ന് സൂചിപ്പിക്കുന്ന ഒരു റിവാർഡ് ഫംഗ്ഷൻ. കമ്പ്യൂട്ടർ ഗെയിം കളിക്കാൻ പഠിക്കുമ്പോൾ, റിവാർഡ് നമ്മുടെ അന്തിമ സ്കോർ ആയിരിക്കും.

റിവാർഡ് ഫംഗ്ഷൻ അടിസ്ഥാനമാക്കി, നാം നമ്മുടെ പെരുമാറ്റം ക്രമീകരിച്ച് കഴിവുകൾ മെച്ചപ്പെടുത്തണം, അതിനാൽ അടുത്ത തവണ നാം മികച്ച രീതിയിൽ കളിക്കാനാകും. മറ്റ് മെഷീൻ ലേണിംഗ് തരംകളിൽ നിന്നും RL-യുടെ പ്രധാന വ്യത്യാസം, RL-യിൽ നാം സാധാരണയായി ഗെയിം അവസാനിപ്പിക്കാതെ ജയിച്ചോ തോറ്റോ എന്ന് അറിയില്ല എന്നതാണ്. അതിനാൽ, ഒരു പ്രത്യേക നീക്കം മാത്രം നല്ലതാണോ അല്ലയോ എന്ന് പറയാനാകില്ല - ഗെയിം അവസാനത്തിൽ മാത്രമേ നമുക്ക് റിവാർഡ് ലഭിക്കൂ.

RL നടത്തുമ്പോൾ, നാം സാധാരണയായി നിരവധി പരീക്ഷണങ്ങൾ നടത്തുന്നു. ഓരോ പരീക്ഷണത്തിലും, നാം ഇതുവരെ പഠിച്ച ഏറ്റവും മികച്ച തന്ത്രം പിന്തുടരുന്നതും (exploitation) പുതിയ സാധ്യതകൾ അന്വേഷിക്കുന്നതും (exploration) തമ്മിൽ സമതുലനം പാലിക്കണം.

OpenAI Gym

RL-ക്കായി മികച്ച ഉപകരണം OpenAI Gym ആണ് - ഇത് ഒരു സിമുലേഷൻ പരിസ്ഥിതി ആണ്, അതിൽ അറ്റാരി ഗെയിമുകളിൽ നിന്ന് പോൾ ബാലൻസിംഗ് പിന്നിലെ ഭൗതികശാസ്ത്രം വരെ പല പരിസ്ഥിതികളും സിമുലേറ്റ് ചെയ്യാം. ഇത് റീഇൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് ആൽഗോരിതങ്ങൾ പരിശീലിപ്പിക്കാൻ ഏറ്റവും ജനപ്രിയമായ സിമുലേഷൻ പരിസ്ഥിതികളിൽ ഒന്നാണ്, OpenAI ആണ് ഇതിന്റെ പരിപാലകൻ.

Note: OpenAI Gym-ൽ ലഭ്യമായ എല്ലാ പരിസ്ഥിതികളും ഇവിടെ കാണാം.

കാർട്ട്‌പോൾ ബാലൻസിംഗ്

നിങ്ങൾക്ക് സെഗ്വേ അല്ലെങ്കിൽ ജൈറോസ്കൂട്ടറുകൾ പോലുള്ള ആധുനിക ബാലൻസിംഗ് ഉപകരണങ്ങൾ കാണാമായിരിക്കും. അവ ഓട്ടോമാറ്റിക്കായി വീലുകൾ ക്രമീകരിച്ച് ബാലൻസ് നിലനിർത്തുന്നു, അത് ആക്സിലറോമീറ്റർ അല്ലെങ്കിൽ ജൈറോസ്കോപ്പ് സിഗ്നലിനെ അടിസ്ഥാനമാക്കിയാണ്. ഈ ഭാഗത്ത്, നാം സമാനമായ ഒരു പ്രശ്നം പരിഹരിക്കാൻ പഠിക്കും - ഒരു പോൾ ബാലൻസ് ചെയ്യുക. ഇത് ഒരു സിർകസ് കലാകാരൻ തന്റെ കൈയിൽ പോൾ ബാലൻസ് ചെയ്യേണ്ട സാഹചര്യം പോലെയാണ്, പക്ഷേ ഇത് 1D-യിൽ മാത്രമാണ്.

ബാലൻസിംഗ് ഒരു ലളിതമായ പതിപ്പ് കാർട്ട്‌പോൾ പ്രശ്നമായി അറിയപ്പെടുന്നു. കാർട്ട്‌പോൾ ലോകത്ത്, ഒരു ഹോരിസോണ്ടൽ സ്ലൈഡർ ഇടത്തോ വലത്തോ നീങ്ങാൻ കഴിയും, സ്ലൈഡറിന്റെ മുകളിൽ ഒരു വെർട്ടിക്കൽ പോൾ ബാലൻസ് ചെയ്യുകയാണ് ലക്ഷ്യം.

a cartpole

ഈ പരിസ്ഥിതി സൃഷ്ടിക്കുകയും ഉപയോഗിക്കുകയും ചെയ്യാൻ, നമുക്ക് പൈതൺ കോഡിന്റെ കുറച്ച് വരികൾ ആവശ്യമാണ്:

import gym
env = gym.make("CartPole-v1")

env.reset()
done = False
total_reward = 0
while not done:
   env.render()
   action = env.action_space.sample()
   observaton, reward, done, info = env.step(action)
   total_reward += reward

print(f"Total reward: {total_reward}")

ഓരോ പരിസ്ഥിതിയിലും സമാനമായ രീതിയിൽ ആക്‌സസ് ചെയ്യാം:

  • env.reset പുതിയ പരീക്ഷണം ആരംഭിക്കുന്നു
  • env.step ഒരു സിമുലേഷൻ ഘട്ടം നടത്തുന്നു. ഇത് ആക്ഷൻ സ്പേസ്-ൽ നിന്നുള്ള ഒരു ആക്ഷൻ സ്വീകരിക്കുകയും, ഓബ്സർവേഷൻ സ്പേസ്-ൽ നിന്നുള്ള ഓബ്സർവേഷൻ, കൂടാതെ റിവാർഡ്, ടെർമിനേഷൻ ഫ്ലാഗ് എന്നിവ തിരികെ നൽകുകയും ചെയ്യുന്നു.

മുകളിൽ കാണിച്ച ഉദാഹരണത്തിൽ, ഓരോ ഘട്ടത്തിലും നാം യാദൃച്ഛിക ആക്ഷൻ സ്വീകരിക്കുന്നതിനാൽ പരീക്ഷണത്തിന്റെ ആയുസ്സ് വളരെ ചെറുതാണ്:

non-balancing cartpole

RL ആൽഗോരിതത്തിന്റെ ലക്ഷ്യം ഒരു മോഡൽ - പോളിസി π - പരിശീലിപ്പിക്കുകയാണ്, അത് നൽകിയ സ്റ്റേറ്റിന് പ്രതികരിച്ച് ആക്ഷൻ തിരികെ നൽകും. പോളിസി പ്രൊബബിലിസ്റ്റിക് ആകാമെന്ന് കൂടി പരിഗണിക്കാം, ഉദാ: ഏതെങ്കിലും സ്റ്റേറ്റ് sക്കും ആക്ഷൻ aക്കും, ആക്ഷൻ a സ്വീകരിക്കാനുള്ള സാധ്യത π(a|s) നൽകും.

പോളിസി ഗ്രാഡിയന്റ് ആൽഗോരിതം

പോളിസി മോഡലാക്കാനുള്ള ഏറ്റവും വ്യക്തമായ മാർഗം, സ്റ്റേറ്റുകൾ ഇൻപുട്ടായി സ്വീകരിച്ച് അനുയോജ്യമായ ആക്ഷനുകൾ (അല്ലെങ്കിൽ ആക്ഷനുകളുടെ സാധ്യതകൾ) തിരികെ നൽകുന്ന ഒരു ന്യൂറൽ നെറ്റ്‌വർക്ക് സൃഷ്ടിക്കുകയാണ്. ഒരു അർത്ഥത്തിൽ, ഇത് സാധാരണ ക്ലാസിഫിക്കേഷൻ ടാസ്കിനോട് സാമ്യമുള്ളതാണ്, എന്നാൽ പ്രധാന വ്യത്യാസം - ഓരോ ഘട്ടത്തിലും എത്രയും നല്ല ആക്ഷൻ എടുക്കണമെന്ന് നമുക്ക് മുൻകൂട്ടി അറിയില്ല.

ഇവിടെ ആശയം ആ സാധ്യതകൾ കണക്കാക്കുകയാണ്. പരീക്ഷണത്തിലെ ഓരോ ഘട്ടത്തിലും നമുക്ക് ലഭിച്ച മൊത്തം റിവാർഡ് കാണിക്കുന്ന ക്യൂമുലേറ്റീവ് റിവാർഡുകൾ എന്ന വെക്ടർ നാം നിർമ്മിക്കുന്നു. കൂടാതെ, മുൻകാല റിവാർഡുകളുടെ പ്രാധാന്യം കുറയ്ക്കാൻ γ=0.99 എന്ന കോഫിഷ്യന്റ് ഉപയോഗിച്ച് റിവാർഡ് ഡിസ്കൗണ്ടിംഗ് പ്രയോഗിക്കുന്നു. തുടർന്ന്, പരീക്ഷണ പാതയിലെ ഉയർന്ന റിവാർഡ് നൽകുന്ന ഘട്ടങ്ങളെ ശക്തിപ്പെടുത്തുന്നു.

പോളിസി ഗ്രാഡിയന്റ് ആൽഗോരിതത്തെക്കുറിച്ച് കൂടുതൽ അറിയാനും പ്രവർത്തനത്തിൽ കാണാനും ഉദാഹരണ നോട്ട്‌ബുക്ക് കാണുക.

ആക്ടർ-ക്രിട്ടിക് ആൽഗോരിതം

പോളിസി ഗ്രാഡിയന്റ് സമീപനത്തിന്റെ മെച്ചപ്പെട്ട പതിപ്പ് ആക്ടർ-ക്രിട്ടിക് എന്നാണ്. ഇതിന്റെ പ്രധാന ആശയം, ന്യൂറൽ നെറ്റ്‌വർക്ക് രണ്ട് കാര്യങ്ങൾ തിരികെ നൽകാൻ പരിശീലിപ്പിക്കപ്പെടുക എന്നതാണ്:

  • എടുക്കേണ്ട ആക്ഷൻ നിർണ്ണയിക്കുന്ന പോളിസി - ഇതാണ് ആക്ടർ
  • ആ സ്റ്റേറ്റിൽ നിന്ന് പ്രതീക്ഷിക്കാവുന്ന മൊത്തം റിവാർഡ് - ഇത് ക്രിട്ടിക്.

ഒരു അർത്ഥത്തിൽ, ഈ ആർക്കിടെക്ചർ GAN പോലെയാണ്, രണ്ട് നെറ്റ്‌വർക്കുകൾ പരസ്പരം എതിരായി പരിശീലിപ്പിക്കപ്പെടുന്നു. ആക്ടർ എടുക്കേണ്ട ആക്ഷൻ നിർദ്ദേശിക്കുന്നു, ക്രിട്ടിക് ഫലത്തെ വിലയിരുത്താൻ ശ്രമിക്കുന്നു. എന്നാൽ, നമുക്ക് ഈ നെറ്റ്‌വർക്കുകൾ ഒരുമിച്ച് പരിശീലിപ്പിക്കുകയാണ് ലക്ഷ്യം.

പരീക്ഷണത്തിൽ നാം യഥാർത്ഥ ക്യൂമുലേറ്റീവ് റിവാർഡുകളും ക്രിട്ടിക് നൽകുന്ന ഫലങ്ങളും അറിയുന്നതിനാൽ, അവ തമ്മിലുള്ള വ്യത്യാസം കുറയ്ക്കുന്ന ലോസ് ഫംഗ്ഷൻ നിർമ്മിക്കുന്നത് എളുപ്പമാണ്. ഇതാണ് ക്രിട്ടിക് ലോസ്. പോളിസി ഗ്രാഡിയന്റ് ആൽഗോരിതത്തിൽ ഉപയോഗിച്ച സമാന സമീപനം ഉപയോഗിച്ച് ആക്ടർ ലോസ് കണക്കാക്കാം.

ഈ ആൽഗോരിതങ്ങളിൽ ഒന്നും പ്രവർത്തിപ്പിച്ച ശേഷം, നമ്മുടെ കാർട്ട്‌പോൾ ഇങ്ങനെ പ്രവർത്തിക്കുമെന്ന് പ്രതീക്ഷിക്കാം:

a balancing cartpole

✍️ അഭ്യാസങ്ങൾ: പോളിസി ഗ്രാഡിയന്റുകളും ആക്ടർ-ക്രിട്ടിക് RL

താഴെ കൊടുത്ത നോട്ട്‌ബുക്കുകളിൽ നിങ്ങളുടെ പഠനം തുടരുക:

മറ്റ് RL ടാസ്കുകൾ

ഇപ്പോൾ റീഇൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് ഗവേഷണത്തിന്റെ വേഗത്തിൽ വളരുന്ന മേഖലയാണ്. ചില രസകരമായ RL ഉദാഹരണങ്ങൾ:

  • അറ്റാരി ഗെയിമുകൾ കളിക്കാൻ കമ്പ്യൂട്ടർ പഠിപ്പിക്കൽ. ഈ പ്രശ്നത്തിൽ വെക്ടർ രൂപത്തിലുള്ള ലളിതമായ സ്റ്റേറ്റ് ഇല്ല, പകരം സ്ക്രീൻഷോട്ട് ഉണ്ട് - അതിനാൽ CNN ഉപയോഗിച്ച് ഈ സ്ക്രീൻ ഇമേജ് ഫീച്ചർ വെക്ടറായി മാറ്റി റിവാർഡ് വിവരങ്ങൾ എടുക്കണം. അറ്റാരി ഗെയിമുകൾ ജിമിൽ ലഭ്യമാണ്.
  • ചെസ്, ഗോ പോലുള്ള ബോർഡ് ഗെയിമുകൾ കളിക്കാൻ കമ്പ്യൂട്ടർ പഠിപ്പിക്കൽ. അടുത്തകാലത്ത് ആൽഫാ സീറോ പോലുള്ള സ്റ്റേറ്റ്-ഓഫ്-ദി-ആർട്ട് പ്രോഗ്രാമുകൾ രണ്ട് ഏജന്റുകൾ തമ്മിൽ കളിച്ച് തുടക്കം മുതൽ പരിശീലിപ്പിച്ചു, ഓരോ ഘട്ടത്തിലും മെച്ചപ്പെടുത്തുകയും ചെയ്തു.
  • വ്യവസായത്തിൽ, സിമുലേഷൻ ഉപയോഗിച്ച് നിയന്ത്രണ സംവിധാനങ്ങൾ സൃഷ്ടിക്കാൻ RL ഉപയോഗിക്കുന്നു. Bonsai എന്ന സേവനം പ്രത്യേകിച്ച് ഇതിന് രൂപകൽപ്പന ചെയ്തതാണ്.

സമാപനം

നാം ഇപ്പോൾ ഒരു റിവാർഡ് ഫംഗ്ഷൻ നൽകുകയും, ബുദ്ധിമുട്ടുള്ള തിരയൽ പ്രദേശം ബുദ്ധിമുട്ടോടെ അന്വേഷിക്കാനുള്ള അവസരം നൽകുകയും ചെയ്തുകൊണ്ട് ഏജന്റുകളെ മികച്ച ഫലങ്ങൾ നേടാൻ പരിശീലിപ്പിക്കുന്നത് പഠിച്ചു. രണ്ട് ആൽഗോരിതങ്ങൾ വിജയകരമായി പരീക്ഷിച്ചു, കുറഞ്ഞ സമയത്തിനുള്ളിൽ നല്ല ഫലം നേടി. എന്നാൽ, ഇത് RL-ലേക്കുള്ള നിങ്ങളുടെ യാത്രയുടെ തുടക്കമാണ്, കൂടുതൽ ആഴത്തിൽ പഠിക്കാൻ നിങ്ങൾക്ക് വേണമെങ്കിൽ വേറെ കോഴ്സ് എടുക്കുന്നത് പരിഗണിക്കണം.

🚀 ചലഞ്ച്

'മറ്റ് RL ടാസ്കുകൾ' വിഭാഗത്തിൽ കൊടുത്തിട്ടുള്ള പ്രയോഗങ്ങൾ പരിശോധിച്ച് ഒന്ന് നടപ്പിലാക്കാൻ ശ്രമിക്കുക!

പോസ്റ്റ്-ലെക്ചർ ക്വിസ്

അവലോകനം & സ്വയം പഠനം

ക്ലാസിക്കൽ റീഇൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് കുറിച്ച് കൂടുതൽ അറിയാൻ ഞങ്ങളുടെ Machine Learning for Beginners Curriculum കാണുക.

കമ്പ്യൂട്ടർ സൂപ്പർ മാരിയോ കളിക്കാൻ എങ്ങനെ പഠിക്കാമെന്ന് വിശദീകരിക്കുന്ന ഈ മികച്ച വീഡിയോ കാണുക.

അസൈൻമെന്റ്: മൗണ്ടൻ കാർ ട്രെയിൻ ചെയ്യുക

ഈ അസൈൻമെന്റിൽ നിങ്ങളുടെ ലക്ഷ്യം മറ്റൊരു ജിം പരിസ്ഥിതി - Mountain Car - പരിശീലിപ്പിക്കുകയാണ്.


അസൂയാ:
ഈ രേഖ AI വിവർത്തന സേവനം Co-op Translator ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, സ്വയം പ്രവർത്തിക്കുന്ന വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. അതിന്റെ മാതൃഭാഷയിലുള്ള യഥാർത്ഥ രേഖ അധികാരപരമായ ഉറവിടമായി കണക്കാക്കപ്പെടണം. നിർണായക വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിക്കുന്നതിൽ നിന്നുണ്ടാകുന്ന ഏതെങ്കിലും തെറ്റിദ്ധാരണകൾക്കോ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കോ ഞങ്ങൾ ഉത്തരവാദികളല്ല.