AI-For-Beginners/translations/kn/lessons/6-Other/22-DeepRL
localizeflow[bot] 514f93318c chore(i18n): sync translations with latest source changes (chunk 1/1, 134 changes) 2026-01-30 03:04:27 +00:00
..
lab chore(i18n): sync translations with latest source changes (chunk 1/1, 134 changes) 2026-01-30 03:04:27 +00:00
CartPole-RL-PyTorch.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00
CartPole-RL-TF.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 134 changes) 2026-01-30 03:04:27 +00:00
notebook.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00
tmp.ipynb Update translations via Co-op Translator v0.12.1 2025-11-26 12:22:03 +09:00

README.md

ಡೀಪ್ ರೀಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್

ರೀಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ (RL) ಅನ್ನು ಮೇಲ್ವಿಚಾರಿತ ಲರ್ನಿಂಗ್ ಮತ್ತು ಮೇಲ್ವಿಚಾರಣೆಯಿಲ್ಲದ ಲರ್ನಿಂಗ್ ಜೊತೆಗೆ ಮೂಲ ಯಂತ್ರ ಅಧ್ಯಯನ ಪರಿಕಲ್ಪನೆಗಳಲ್ಲಿ ಒಂದಾಗಿ ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ. ಮೇಲ್ವಿಚಾರಿತ ಲರ್ನಿಂಗ್‌ನಲ್ಲಿ ನಾವು ಫಲಿತಾಂಶಗಳು ತಿಳಿದಿರುವ ಡೇಟಾಸೆಟ್ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದ್ದರೆ, RL ಮಾಡುವ ಮೂಲಕ ಕಲಿಯುವಿಕೆ ಆಧಾರಿತವಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, ನಾವು ಮೊದಲ ಬಾರಿಗೆ ಕಂಪ್ಯೂಟರ್ ಆಟವನ್ನು ನೋಡಿದಾಗ, ನಿಯಮಗಳನ್ನು ತಿಳಿಯದೆ ಇದ್ದರೂ ಆಡಲು ಪ್ರಾರಂಭಿಸುತ್ತೇವೆ ಮತ್ತು ಆಟವಾಡುವ ಪ್ರಕ್ರಿಯೆಯಿಂದ ಮತ್ತು ನಮ್ಮ ವರ್ತನೆಯನ್ನು ಹೊಂದಿಕೊಳ್ಳುವ ಮೂಲಕ ನಮ್ಮ ಕೌಶಲ್ಯಗಳನ್ನು ಸುಧಾರಿಸಿಕೊಳ್ಳುತ್ತೇವೆ.

ಪೂರ್ವ-ಲೇಕ್ಚರ್ ಕ್ವಿಜ್

RL ನಡೆಸಲು ನಮಗೆ ಬೇಕಾಗಿರುವುದು:

  • ಆಟದ ನಿಯಮಗಳನ್ನು ನಿಗದಿಪಡಿಸುವ ಪರಿಸರ ಅಥವಾ ಸಿಮ್ಯುಲೇಟರ್. ನಾವು ಸಿಮ್ಯುಲೇಟರ್‌ನಲ್ಲಿ ಪ್ರಯೋಗಗಳನ್ನು ನಡೆಸಿ ಫಲಿತಾಂಶಗಳನ್ನು ಗಮನಿಸಬಹುದಾಗಿರಬೇಕು.
  • ನಮ್ಮ ಪ್ರಯೋಗ ಎಷ್ಟು ಯಶಸ್ವಿಯಾಗಿದೆ ಎಂದು ಸೂಚಿಸುವ ರಿವಾರ್ಡ್ ಫಂಕ್ಷನ್. ಕಂಪ್ಯೂಟರ್ ಆಟವನ್ನು ಕಲಿಯುವ ಸಂದರ್ಭದಲ್ಲಿ, ರಿವಾರ್ಡ್ ನಮ್ಮ ಅಂತಿಮ ಅಂಕಗಳು ಆಗಿರುತ್ತದೆ.

ರಿವಾರ್ಡ್ ಫಂಕ್ಷನ್ ಆಧಾರವಾಗಿ, ನಾವು ನಮ್ಮ ವರ್ತನೆಯನ್ನು ಹೊಂದಿಸಿಕೊಂಡು ನಮ್ಮ ಕೌಶಲ್ಯಗಳನ್ನು ಸುಧಾರಿಸಿಕೊಳ್ಳಬೇಕು, ಹೀಗಾಗಿ ಮುಂದಿನ ಬಾರಿ ನಾವು ಉತ್ತಮವಾಗಿ ಆಡಬಹುದು. ಇತರ ಯಂತ್ರ ಅಧ್ಯಯನ ಪ್ರಕಾರಗಳಿಗಿಂತ RL ನಲ್ಲಿ ಮುಖ್ಯ ವ್ಯತ್ಯಾಸವೆಂದರೆ, ನಾವು ಸಾಮಾನ್ಯವಾಗಿ ಆಟ ಮುಗಿಯುವವರೆಗೆ ಗೆಲುವು ಅಥವಾ ಸೋಲು ತಿಳಿಯದು. ಆದ್ದರಿಂದ, ಒಂದು ನಿರ್ದಿಷ್ಟ ಚಲನೆಯೇ ಒಳ್ಳೆಯದು ಅಥವಾ ಕೆಟ್ಟದು ಎಂದು ಹೇಳಲು ಸಾಧ್ಯವಿಲ್ಲ - ನಾವು ಆಟದ ಕೊನೆಯಲ್ಲಿ ಮಾತ್ರ ರಿವಾರ್ಡ್ ಪಡೆಯುತ್ತೇವೆ.

RL ಸಮಯದಲ್ಲಿ, ನಾವು ಸಾಮಾನ್ಯವಾಗಿ ಅನೇಕ ಪ್ರಯೋಗಗಳನ್ನು ನಡೆಸುತ್ತೇವೆ. ಪ್ರತಿ ಪ್ರಯೋಗದಲ್ಲಿ, ನಾವು ಈಗಾಗಲೇ ಕಲಿತ ಅತ್ಯುತ್ತಮ ತಂತ್ರವನ್ನು ಅನುಸರಿಸುವುದು (exploitation) ಮತ್ತು ಹೊಸ ಸಾಧ್ಯತೆಗಳ ಅನ್ವೇಷಣೆ (exploration) ನಡುವೆ ಸಮತೋಲನ ಸಾಧಿಸಬೇಕಾಗುತ್ತದೆ.

OpenAI Gym

RL ಗೆ ಅತ್ಯುತ್ತಮ ಸಾಧನವೆಂದರೆ OpenAI Gym — ಇದು ವಿವಿಧ ಪರಿಸರಗಳನ್ನು ಸಿಮ್ಯುಲೇಟ್ ಮಾಡಬಲ್ಲ ಸಿಮ್ಯುಲೇಷನ್ ಪರಿಸರ. ಇದು ಅಟಾರಿ ಆಟಗಳಿಂದ ಪ್ರಾರಂಭಿಸಿ ಪೋಲ್ ಬ್ಯಾಲೆನ್ಸಿಂಗ್‌ನ ಭೌತಶಾಸ್ತ್ರದವರೆಗೆ ಅನೇಕ ಪರಿಸರಗಳನ್ನು ಸಿಮ್ಯುಲೇಟ್ ಮಾಡಬಹುದು. ಇದು ರೀಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಆಲ್ಗಾರಿದಮ್‌ಗಳನ್ನು ತರಬೇತುಗೊಳಿಸಲು ಅತ್ಯಂತ ಜನಪ್ರಿಯ ಸಿಮ್ಯುಲೇಷನ್ ಪರಿಸರಗಳಲ್ಲಿ ಒಂದಾಗಿದೆ ಮತ್ತು OpenAI ಮೂಲಕ ನಿರ್ವಹಿಸಲಾಗುತ್ತದೆ.

ಗಮನಿಸಿ: OpenAI Gym ನಲ್ಲಿ ಲಭ್ಯವಿರುವ ಎಲ್ಲಾ ಪರಿಸರಗಳನ್ನು ನೀವು ಇಲ್ಲಿ ನೋಡಬಹುದು.

ಕಾರ್ಟ್‌ಪೋಲ್ ಬ್ಯಾಲೆನ್ಸಿಂಗ್

ನೀವು ಬಹುಶಃ ಸೆಗ್ವೇ ಅಥವಾ ಜೈರೋಸ್ಕೂಟರ್ಗಳಂತಹ ಆಧುನಿಕ ಬ್ಯಾಲೆನ್ಸಿಂಗ್ ಸಾಧನಗಳನ್ನು ನೋಡಿದ್ದೀರಾ. ಅವುಗಳು ತಾವು ಹೊಂದಿರುವ ಅಕ್ಸೆಲರೋಮೀಟರ್ ಅಥವಾ ಜೈರೋಸ್ಕೋಪ್‌ನ ಸಿಗ್ನಲ್‌ಗೆ ಪ್ರತಿಕ್ರಿಯಿಸಿ ಚಕ್ರಗಳನ್ನು ಹೊಂದಿಸಿ ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಬ್ಯಾಲೆನ್ಸ್ ಮಾಡುತ್ತವೆ. ಈ ವಿಭಾಗದಲ್ಲಿ, ನಾವು ಸಮಾನವಾದ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುವುದನ್ನು ಕಲಿಯುತ್ತೇವೆ — ಪೋಲ್ ಬ್ಯಾಲೆನ್ಸ್ ಮಾಡುವುದು. ಇದು ಸಿರ್ಕಸ್ ಕಲಾವಿದನು ತನ್ನ ಕೈಯಲ್ಲಿ ಪೋಲ್ ಬ್ಯಾಲೆನ್ಸ್ ಮಾಡಬೇಕಾಗಿರುವ ಪರಿಸ್ಥಿತಿಗೆ ಹೋಲುವದು — ಆದರೆ ಈ ಪೋಲ್ ಬ್ಯಾಲೆನ್ಸ್ 1D ನಲ್ಲಿ ಮಾತ್ರ ಸಂಭವಿಸುತ್ತದೆ.

ಬ್ಯಾಲೆನ್ಸಿಂಗ್‌ನ ಸರಳೀಕೃತ ಆವೃತ್ತಿಯನ್ನು ಕಾರ್ಟ್‌ಪೋಲ್ ಸಮಸ್ಯೆ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ಕಾರ್ಟ್‌ಪೋಲ್ ಜಗತ್ತಿನಲ್ಲಿ, ನಾವು ಎಡಕ್ಕೆ ಅಥವಾ ಬಲಕ್ಕೆ ಚಲಿಸುವ ಹೋರಿಜಾಂಟಲ್ ಸ್ಲೈಡರ್ ಹೊಂದಿದ್ದೇವೆ, ಮತ್ತು ಗುರಿ ಸ್ಲೈಡರ್ ಮೇಲ್ಭಾಗದಲ್ಲಿ ಲಂಬ ಪೋಲ್ ಅನ್ನು ಬ್ಯಾಲೆನ್ಸ್ ಮಾಡುವುದು.

a cartpole

ಈ ಪರಿಸರವನ್ನು ರಚಿಸಲು ಮತ್ತು ಬಳಸಲು, ನಮಗೆ ಕೆಲವು ಪೈಥಾನ್ ಕೋಡ್ ಸಾಲುಗಳು ಬೇಕಾಗುತ್ತವೆ:

import gym
env = gym.make("CartPole-v1")

env.reset()
done = False
total_reward = 0
while not done:
   env.render()
   action = env.action_space.sample()
   observaton, reward, done, info = env.step(action)
   total_reward += reward

print(f"Total reward: {total_reward}")

ಪ್ರತಿ ಪರಿಸರವನ್ನು ಸರಿಯಾದ ರೀತಿಯಲ್ಲಿ ಹೀಗೇ ಪ್ರವೇಶಿಸಬಹುದು:

  • env.reset ಹೊಸ ಪ್ರಯೋಗವನ್ನು ಪ್ರಾರಂಭಿಸುತ್ತದೆ
  • env.step ಸಿಮ್ಯುಲೇಷನ್ ಹೆಜ್ಜೆಯನ್ನು ನಡೆಸುತ್ತದೆ. ಇದು ಆಕ್ಷನ್ ಸ್ಪೇಸ್ನಿಂದ ಒಂದು ಆಕ್ಷನ್ ಅನ್ನು ಸ್ವೀಕರಿಸಿ, ಅಬ್ಜರ್ವೇಶನ್ ಸ್ಪೇಸ್ನಿಂದ ಒಂದು ಅಬ್ಜರ್ವೇಶನ್ ಅನ್ನು, ಜೊತೆಗೆ ರಿವಾರ್ಡ್ ಮತ್ತು ಟರ್ಮಿನೇಷನ್ ಫ್ಲ್ಯಾಗ್ ಅನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ.

ಮೇಲಿನ ಉದಾಹರಣೆಯಲ್ಲಿ ನಾವು ಪ್ರತಿ ಹೆಜ್ಜೆಯಲ್ಲಿ ಯಾದೃಚ್ಛಿಕ ಆಕ್ಷನ್ ಮಾಡುತ್ತಿದ್ದೇವೆ, ಆದ್ದರಿಂದ ಪ್ರಯೋಗದ ಆಯುಷ್ಯ ತುಂಬಾ ಕಡಿಮೆ:

non-balancing cartpole

RL ಆಲ್ಗಾರಿದಮ್ ಗುರಿ ಎಂದರೆ ಒಂದು ಮಾದರಿಯನ್ನು ತರಬೇತುಗೊಳಿಸುವುದು — ಇದನ್ನು ಪಾಲಿಸಿ π ಎಂದು ಕರೆಯುತ್ತಾರೆ — ಇದು ನೀಡಲಾದ ಸ್ಥಿತಿಗೆ ಪ್ರತಿಕ್ರಿಯಿಸಿ ಆಕ್ಷನ್ ಅನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ. ಪಾಲಿಸಿಯನ್ನು ಪ್ರಾಬಬಿಲಿಸ್ಟಿಕ್ ಆಗಿ ಪರಿಗಣಿಸಬಹುದು, ಉದಾ: ಯಾವುದೇ ಸ್ಥಿತಿ s ಮತ್ತು ಆಕ್ಷನ್ a ಗೆ π(a|s) ಎಂಬ ಪ್ರಾಬಬಿಲಿಟಿ ಹಿಂತಿರುಗಿಸುತ್ತದೆ, ಅಂದರೆ ನಾವು ಸ್ಥಿತಿ s ನಲ್ಲಿ a ತೆಗೆದುಕೊಳ್ಳಬೇಕು ಎಂಬ ಸಾಧ್ಯತೆ.

ಪಾಲಿಸಿ ಗ್ರೇಡಿಯೆಂಟ್ಸ್ ಆಲ್ಗಾರಿದಮ್

ಪಾಲಿಸಿಯನ್ನು ಮಾದರಿಮಾಡುವ ಅತ್ಯಂತ ಸ್ಪಷ್ಟ ವಿಧಾನವೆಂದರೆ ನ್ಯೂರಲ್ ನೆಟ್‌ವರ್ಕ್ ರಚಿಸುವುದು, ಇದು ಸ್ಥಿತಿಗಳನ್ನು ಇನ್‌ಪುಟ್ ಆಗಿ ತೆಗೆದು, ಸಂಬಂಧಿತ ಆಕ್ಷನ್‌ಗಳನ್ನು (ಅಥವಾ ಎಲ್ಲಾ ಆಕ್ಷನ್‌ಗಳ ಪ್ರಾಬಬಿಲಿಟಿಗಳನ್ನು) ಹಿಂತಿರುಗಿಸುತ್ತದೆ. ಇದು ಸಾಮಾನ್ಯ ವರ್ಗೀಕರಣ ಕಾರ್ಯದಂತೆ ಕಾಣಬಹುದು, ಆದರೆ ಪ್ರಮುಖ ವ್ಯತ್ಯಾಸವೆಂದರೆ ನಾವು ಪ್ರತಿ ಹೆಜ್ಜೆಯಲ್ಲಿ ಯಾವ ಆಕ್ಷನ್ ತೆಗೆದುಕೊಳ್ಳಬೇಕು ಎಂದು ಮುಂಚಿತವಾಗಿ ತಿಳಿಯದು.

ಇಲ್ಲಿ ಆ ಪ್ರಾಬಬಿಲಿಟಿಗಳನ್ನು ಅಂದಾಜಿಸುವುದು ಮುಖ್ಯ. ನಾವು ಸಂಚಿತ ರಿವಾರ್ಡ್‌ಗಳ ವೆಕ್ಟರ್ ರಚಿಸುತ್ತೇವೆ, ಇದು ಪ್ರತಿ ಹೆಜ್ಜೆಯಲ್ಲಿ ನಮ್ಮ ಒಟ್ಟು ರಿವಾರ್ಡ್ ಅನ್ನು ತೋರಿಸುತ್ತದೆ. ನಾವು ರಿವಾರ್ಡ್ ಡಿಸ್ಕೌಂಟಿಂಗ್ ಅನ್ನು ಕೂಡ ಅನ್ವಯಿಸುತ್ತೇವೆ, ಹಳೆಯ ರಿವಾರ್ಡ್‌ಗಳನ್ನು ಕೆಲವು ಗುಣಾಂಕ γ=0.99 ಮೂಲಕ ಗುಣಿಸಿ, ಹಳೆಯ ರಿವಾರ್ಡ್‌ಗಳ ಪಾತ್ರವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತೇವೆ. ನಂತರ, ಹೆಚ್ಚಿನ ರಿವಾರ್ಡ್ ನೀಡುವ ಹೆಜ್ಜೆಗಳನ್ನು ಹೆಚ್ಚು ಬಲಪಡಿಸುತ್ತೇವೆ.

ಪಾಲಿಸಿ ಗ್ರೇಡಿಯೆಂಟ್ ಆಲ್ಗಾರಿದಮ್ ಬಗ್ಗೆ ಹೆಚ್ಚಿನ ಮಾಹಿತಿಗಾಗಿ ಮತ್ತು ಅದನ್ನು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿರುವುದನ್ನು ನೋಡಲು ಉದಾಹರಣೆ ನೋಟ್‌ಬುಕ್ ನೋಡಿ.

ಆಕ್ಟರ್-ಕ್ರಿಟಿಕ್ ಆಲ್ಗಾರಿದಮ್

ಪಾಲಿಸಿ ಗ್ರೇಡಿಯೆಂಟ್ಸ್ ವಿಧಾನವನ್ನು ಸುಧಾರಿಸಿದ ಆವೃತ್ತಿ ಆಕ್ಟರ್-ಕ್ರಿಟಿಕ್ ಎಂದು ಕರೆಯಲ್ಪಡುತ್ತದೆ. ಇದರ ಮುಖ್ಯ ತತ್ವವೆಂದರೆ ನ್ಯೂರಲ್ ನೆಟ್‌ವರ್ಕ್ ಎರಡು ವಿಷಯಗಳನ್ನು ಹಿಂತಿರುಗಿಸುವಂತೆ ತರಬೇತುಗೊಳ್ಳಬೇಕು:

  • ಯಾವ ಆಕ್ಷನ್ ತೆಗೆದುಕೊಳ್ಳಬೇಕೆಂದು ನಿರ್ಧರಿಸುವ ಪಾಲಿಸಿ — ಇದನ್ನು ಆಕ್ಟರ್ ಎಂದು ಕರೆಯುತ್ತಾರೆ
  • ಈ ಸ್ಥಿತಿಯಲ್ಲಿ ನಾವು ಪಡೆಯಬಹುದಾದ ಒಟ್ಟು ರಿವಾರ್ಡ್ ಅಂದಾಜು — ಇದನ್ನು ಕ್ರಿಟಿಕ್ ಎಂದು ಕರೆಯುತ್ತಾರೆ.

ಈ ವಾಸ್ತವಿಕವಾಗಿ GAN ಅನ್ನು ಹೋಲುತ್ತದೆ, ಅಲ್ಲಿ ಎರಡು ನೆಟ್‌ವರ್ಕ್‌ಗಳು ಪರಸ್ಪರ ವಿರುದ್ಧವಾಗಿ ತರಬೇತಿಗೊಳ್ಳುತ್ತವೆ. ಆಕ್ಟರ್-ಕ್ರಿಟಿಕ್ ಮಾದರಿಯಲ್ಲಿ, ಆಕ್ಟರ್ ನಾವು ತೆಗೆದುಕೊಳ್ಳಬೇಕಾದ ಆಕ್ಷನ್ ಅನ್ನು ಸೂಚಿಸುತ್ತಾನೆ, ಮತ್ತು ಕ್ರಿಟಿಕ್ ಫಲಿತಾಂಶವನ್ನು ಅಂದಾಜಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಾನೆ. ಆದರೆ ನಮ್ಮ ಗುರಿ ಈ ಎರಡು ನೆಟ್‌ವರ್ಕ್‌ಗಳನ್ನು ಒಟ್ಟಿಗೆ ತರಬೇತಿಗೊಳಿಸುವುದು.

ನಾವು ಪ್ರಯೋಗದ ಸಮಯದಲ್ಲಿ ನಿಜವಾದ ಸಂಚಿತ ರಿವಾರ್ಡ್‌ಗಳು ಮತ್ತು ಕ್ರಿಟಿಕ್ ನೀಡಿದ ಫಲಿತಾಂಶಗಳನ್ನು ತಿಳಿದಿರುವುದರಿಂದ, ಅವುಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಲಾಸ್ ಫಂಕ್ಷನ್ ರಚಿಸುವುದು ಸುಲಭ. ಇದನ್ನು ಕ್ರಿಟಿಕ್ ಲಾಸ್ ಎಂದು ಕರೆಯುತ್ತಾರೆ. ಪಾಲಿಸಿ ಗ್ರೇಡಿಯೆಂಟ್ ಆಲ್ಗಾರಿದಮ್‌ನಂತೆ ನಾವು ಆಕ್ಟರ್ ಲಾಸ್ ಅನ್ನು ಲೆಕ್ಕಹಾಕಬಹುದು.

ಈ ಆಲ್ಗಾರಿದಮ್‌ಗಳನ್ನು ಒಂದು ಬಾರಿ ನಡೆಸಿದ ನಂತರ, ನಮ್ಮ ಕಾರ್ಟ್‌ಪೋಲ್ ಹೀಗೆ ವರ್ತಿಸಬಹುದು:

a balancing cartpole

✍️ ಅಭ್ಯಾಸಗಳು: ಪಾಲಿಸಿ ಗ್ರೇಡಿಯೆಂಟ್ಸ್ ಮತ್ತು ಆಕ್ಟರ್-ಕ್ರಿಟಿಕ್ RL

ಕೆಳಗಿನ ನೋಟ್‌ಬುಕ್‌ಗಳಲ್ಲಿ ನಿಮ್ಮ ಅಧ್ಯಯನವನ್ನು ಮುಂದುವರಿಸಿ:

ಇತರ RL ಕಾರ್ಯಗಳು

ಈಗಾಗಲೇ ರೀಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ವೇಗವಾಗಿ ಬೆಳೆಯುತ್ತಿರುವ ಸಂಶೋಧನಾ ಕ್ಷೇತ್ರವಾಗಿದೆ. ಕೆಲವು ಆಸಕ್ತಿದಾಯಕ RL ಉದಾಹರಣೆಗಳು:

  • ಕಂಪ್ಯೂಟರ್‌ಗೆ ಅಟಾರಿ ಆಟಗಳನ್ನು ಆಡಲು ಕಲಿಸುವುದು. ಈ ಸಮಸ್ಯೆಯ ಸವಾಲು ಎಂದರೆ ನಮಗೆ ಸರಳ ಸ್ಥಿತಿ ವೆಕ್ಟರ್ ಇಲ್ಲ, ಬದಲಿಗೆ ಸ್ಕ್ರೀನ್‌ಶಾಟ್ ಇದೆ — ಮತ್ತು ನಾವು CNN ಬಳಸಿ ಈ ಚಿತ್ರವನ್ನು ವೈಶಿಷ್ಟ್ಯ ವೆಕ್ಟರ್‌ಗೆ ಪರಿವರ್ತಿಸಬೇಕು ಅಥವಾ ರಿವಾರ್ಡ್ ಮಾಹಿತಿಯನ್ನು ಹೊರತೆಗೆಯಬೇಕು. ಅಟಾರಿ ಆಟಗಳು ಜಿಮ್‌ನಲ್ಲಿ ಲಭ್ಯವಿವೆ.
  • ಕಂಪ್ಯೂಟರ್‌ಗೆ ಚೆಸ್ ಮತ್ತು ಗೋಂತಹ ಬೋರ್ಡ್ ಆಟಗಳನ್ನು ಆಡಲು ಕಲಿಸುವುದು. ಇತ್ತೀಚೆಗೆ ಅಲ್ಫಾ ಜೀરો ಎಂಬ ಅತ್ಯಾಧುನಿಕ ಪ್ರೋಗ್ರಾಮ್ ಎರಡು ಏಜೆಂಟ್‌ಗಳು ಪರಸ್ಪರ ಎದುರಾಗಿ ಆಡುತ್ತಾ ಪ್ರತಿ ಹೆಜ್ಜೆಯಲ್ಲಿ ಸುಧಾರಿಸಿಕೊಂಡು ತರಬೇತಿಗೊಂಡಿದೆ.
  • ಕೈಗಾರಿಕೆಯಲ್ಲಿ, RL ಅನ್ನು ಸಿಮ್ಯುಲೇಷನ್‌ನಿಂದ ನಿಯಂತ್ರಣ ವ್ಯವಸ್ಥೆಗಳನ್ನು ರಚಿಸಲು ಬಳಸಲಾಗುತ್ತದೆ. Bonsai ಎಂಬ ಸೇವೆ ಇದಕ್ಕಾಗಿ ವಿಶೇಷವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ.

ಸಾರಾಂಶ

ನಾವು ಈಗ ಏಜೆಂಟ್‌ಗಳನ್ನು ತರಬೇತುಗೊಳಿಸುವುದನ್ನು ಕಲಿತಿದ್ದೇವೆ, ಅವರಿಗೆ ಆಟದ ಇಚ್ಛಿತ ಸ್ಥಿತಿಯನ್ನು ನಿರ್ಧರಿಸುವ ರಿವಾರ್ಡ್ ಫಂಕ್ಷನ್ ನೀಡುವುದರಿಂದ ಮತ್ತು ಹುಡುಕಾಟ ಸ್ಥಳವನ್ನು ಬುದ್ಧಿವಂತಿಕೆಯಿಂದ ಅನ್ವೇಷಿಸುವ ಅವಕಾಶ ನೀಡುವುದರಿಂದ ಉತ್ತಮ ಫಲಿತಾಂಶಗಳನ್ನು ಸಾಧಿಸಲು. ನಾವು ಎರಡು ಆಲ್ಗಾರಿದಮ್‌ಗಳನ್ನು ಯಶಸ್ವಿಯಾಗಿ ಪ್ರಯತ್ನಿಸಿ, ಸಾಪೇಕ್ಷವಾಗಿ ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಉತ್ತಮ ಫಲಿತಾಂಶ ಪಡೆದಿದ್ದೇವೆ. ಆದರೆ ಇದು RL ಯಾತ್ರೆಯ ಆರಂಭ ಮಾತ್ರ, ಮತ್ತು ನೀವು ಇದರಲ್ಲಿ ಇನ್ನಷ್ಟು ಆಳವಾಗಿ ತಿಳಿದುಕೊಳ್ಳಲು ಪ್ರತ್ಯೇಕ ಕೋರ್ಸ್ ತೆಗೆದುಕೊಳ್ಳುವುದು ಸೂಕ್ತ.

🚀 ಸವಾಲು

'ಇತರ RL ಕಾರ್ಯಗಳು' ವಿಭಾಗದಲ್ಲಿ ಉಲ್ಲೇಖಿಸಿದ ಅನ್ವಯಿಕೆಗಳನ್ನು ಅನ್ವೇಷಿಸಿ ಮತ್ತು ಒಂದನ್ನು ಅನುಷ್ಠಾನಗೊಳಿಸಲು ಪ್ರಯತ್ನಿಸಿ!

ಪೋಸ್ಟ್-ಲೇಕ್ಚರ್ ಕ್ವಿಜ್

ವಿಮರ್ಶೆ ಮತ್ತು ಸ್ವಯಂ ಅಧ್ಯಯನ

ನಮ್ಮ ಯಂತ್ರ ಅಧ್ಯಯನ ಆರಂಭಿಕರಿಗಾಗಿ ಪಠ್ಯಕ್ರಮ ನಲ್ಲಿ ಶ್ರೇಷ್ಟ ರೀಇನ್ಫೋರ್ಸ್ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಬಗ್ಗೆ ಇನ್ನಷ್ಟು ತಿಳಿದುಕೊಳ್ಳಿ.

ಕಂಪ್ಯೂಟರ್ ಸೂಪರ್ ಮಾರಿಯೋ ಆಟವನ್ನು ಹೇಗೆ ಕಲಿಯಬಹುದು ಎಂಬುದನ್ನು ವಿವರಿಸುವ ಈ ಅದ್ಭುತ ವೀಡಿಯೋ ವೀಕ್ಷಿಸಿ.

ಅಸೈನ್‌ಮೆಂಟ್: ಮೌಂಟನ್ ಕಾರ್ ತರಬೇತಿ

ಈ ಅಸೈನ್‌ಮೆಂಟ್ ಸಮಯದಲ್ಲಿ ನಿಮ್ಮ ಗುರಿ ಬೇರೆ ಜಿಮ್ ಪರಿಸರವನ್ನು ತರಬೇತುಗೊಳಿಸುವುದು — ಮೌಂಟನ್ ಕಾರ್.


ಅಸ್ವೀಕಾರ:
ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ Co-op Translator ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯಿಗಾಗಿ ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ತಪ್ಪುಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದು ಎಂದು ದಯವಿಟ್ಟು ಗಮನಿಸಿ. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ ಅಥವಾ ತಪ್ಪು ವಿವರಣೆಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಾಗುವುದಿಲ್ಲ.