AI-For-Beginners/translations/te/lessons/4-ComputerVision/08-TransferLearning/TrainingTricks.md

22 KiB
Raw Blame History

డీప్ లెర్నింగ్ శిక్షణ చిట్కాలు

న్యూరల్ నెట్‌వర్క్లు లోతుగా మారుతున్న కొద్దీ, వాటి శిక్షణ ప్రక్రియ మరింత కష్టతరమవుతుంది. ఒక ప్రధాన సమస్యగా పిలవబడేది వానిషింగ్ గ్రాడియెంట్స్ లేదా ఎక్స్‌ప్లోడింగ్ గ్రాడియెంట్స్ సమస్య. ఈ పోస్ట్ ఆ సమస్యల గురించి మంచి పరిచయాన్ని ఇస్తుంది.

డీప్ నెట్‌వర్క్ల శిక్షణను మరింత సమర్థవంతంగా చేయడానికి కొన్ని సాంకేతికతలు ఉపయోగించవచ్చు.

విలువలను సరైన పరిధిలో ఉంచడం

సంఖ్యాత్మక లెక్కింపులు స్థిరంగా ఉండాలంటే, మన న్యూరల్ నెట్‌వర్క్‌లోని అన్ని విలువలు సాధారణంగా [-1..1] లేదా [0..1] పరిధిలో ఉండేలా చూసుకోవాలి. ఇది కఠినమైన నియమం కాదు, కానీ ఫ్లోటింగ్ పాయింట్ లెక్కింపుల స్వభావం ప్రకారం, విభిన్న పరిమాణాల విలువలను ఖచ్చితంగా కలిపి నిర్వహించడం కష్టం. ఉదాహరణకు, 10-10 మరియు 1010 ను కలిపితే, మనం సాధారణంగా 1010 ను పొందుతాము, ఎందుకంటే చిన్న విలువ పెద్దదైన ఆర్డర్‌కు మార్చబడుతుంది, అందువల్ల మాంటిస్సా (mantissa) పోతుంది.

అధిక భాగం యాక్టివేషన్ ఫంక్షన్లు [-1..1] పరిధిలో నాన్-లీనియర్ ఉంటాయి, కాబట్టి అన్ని ఇన్‌పుట్ డేటాను [-1..1] లేదా [0..1] పరిధిలో స్కేల్ చేయడం మంచిది.

ప్రారంభ బరువు ప్రారంభీకరణ

సిద్ధాంతంగా, నెట్‌వర్క్ లేయర్ల ద్వారా విలువలు ఒకే పరిధిలో ఉండాలి. కాబట్టి, విలువల పంపిణీని నిలుపుకునే విధంగా బరువులను ప్రారంభీకరించడం ముఖ్యం.

సాధారణ పంపిణీ N(0,1) మంచిది కాదు, ఎందుకంటే మనకు n ఇన్‌పుట్లు ఉంటే, అవుట్‌పుట్ యొక్క స్టాండర్డ్ డివియేషన్ n అవుతుంది, మరియు విలువలు [0..1] పరిధి నుండి బయటకు వెళ్లే అవకాశం ఉంటుంది.

క్రింది ప్రారంభీకరణలు తరచుగా ఉపయోగిస్తారు:

  • యూనిఫార్మ్ పంపిణీ -- uniform
  • N(0,1/n) -- gaussian
  • N(0,1/√n_in) ఇది ఇన్‌పుట్లు సున్నా సగటు మరియు 1 స్టాండర్డ్ డివియేషన్ ఉన్నప్పుడు అదే సగటు/స్టాండర్డ్ డివియేషన్ నిలుపుతుంది
  • N(0,√2/(n_in+n_out)) -- దీనిని Xavier initialization (glorot) అంటారు, ఇది ఫార్వర్డ్ మరియు బ్యాక్‌వర్డ్ ప్రొపగేషన్ సమయంలో సిగ్నల్స్‌ను పరిధిలో ఉంచడంలో సహాయపడుతుంది

బ్యాచ్ నార్మలైజేషన్

సరైన బరువు ప్రారంభీకరణ ఉన్నప్పటికీ, శిక్షణ సమయంలో బరువులు అనియంత్రితంగా పెద్దవిగా లేదా చిన్నవిగా మారవచ్చు, అవి సిగ్నల్స్‌ను సరైన పరిధి నుండి బయటకు తీసుకెళ్తాయి. మనం సిగ్నల్స్‌ను తిరిగి తీసుకురావడానికి నార్మలైజేషన్ సాంకేతికతలను ఉపయోగించవచ్చు. వాటిలో కొన్ని ఉన్నాయి (బరువు నార్మలైజేషన్, లేయర్ నార్మలైజేషన్), కానీ ఎక్కువగా ఉపయోగించేది బ్యాచ్ నార్మలైజేషన్.

బ్యాచ్ నార్మలైజేషన్ భావన ఏమిటంటే, మినీబ్యాచ్‌లోని అన్ని విలువలను పరిగణలోకి తీసుకుని, ఆ విలువల ఆధారంగా నార్మలైజేషన్ (అంటే సగటు తీసి, స్టాండర్డ్ డివియేషన్‌తో భాగించడం) చేయడం. ఇది ఒక నెట్‌వర్క్ లేయర్‌గా అమలు చేయబడుతుంది, ఇది బరువులు వర్తింపజేసిన తర్వాత, యాక్టివేషన్ ఫంక్షన్ ముందు ఈ నార్మలైజేషన్ చేస్తుంది. ఫలితంగా, మనం ఎక్కువ తుది ఖచ్చితత్వం మరియు వేగవంతమైన శిక్షణను చూడగలుగుతాము.

ఇది బ్యాచ్ నార్మలైజేషన్ పై మూల పత్రం, వికీపీడియా వివరణ, మరియు మంచి పరిచయ బ్లాగ్ పోస్ట్ (మరియు రష్యన్‌లో).

డ్రాప్‌అవుట్

డ్రాప్‌అవుట్ అనేది శిక్షణ సమయంలో యాదృచ్ఛికంగా కొన్ని శాతం న్యూరాన్లను తొలగించే ఆసక్తికర సాంకేతికత. ఇది ఒక లేయర్‌గా అమలు చేయబడుతుంది, దీనికి ఒక పారామీటర్ ఉంటుంది (తొలగించాల్సిన న్యూరాన్ల శాతం, సాధారణంగా 10%-50%), మరియు శిక్షణ సమయంలో ఇది ఇన్‌పుట్ వెక్టర్‌లో యాదృచ్ఛిక అంశాలను జీరో చేస్తుంది, తద్వారా తదుపరి లేయర్‌కు పంపుతుంది.

ఇది విచిత్రమైన ఆలోచనగా అనిపించవచ్చు, కానీ మీరు Dropout.ipynb నోట్బుక్‌లో MNIST అంకెల వర్గీకరణ శిక్షణపై డ్రాప్‌అవుట్ ప్రభావాన్ని చూడవచ్చు. ఇది శిక్షణ వేగాన్ని పెంచుతుంది మరియు తక్కువ శిక్షణ ఎపోక్స్‌లో ఎక్కువ ఖచ్చితత్వాన్ని సాధించడానికి సహాయపడుతుంది.

ఈ ప్రభావాన్ని కొన్ని విధాలుగా వివరించవచ్చు:

  • ఇది మోడల్‌కు యాదృచ్ఛిక షాక్‌లా భావించవచ్చు, ఇది ఆప్టిమైజేషన్‌ను లోకల్ మినిమమ్ నుండి బయటకు తీస్తుంది
  • ఇది అప్రత్యక్ష మోడల్ సగటుగా భావించవచ్చు, ఎందుకంటే డ్రాప్‌అవుట్ సమయంలో మనం కొంచెం భిన్నమైన మోడల్‌ను శిక్షణ ఇస్తున్నట్లు అనుకోవచ్చు

కొంతమంది చెబుతారు, మద్యం తాగిన వ్యక్తి ఏదైనా నేర్చుకోవడానికి ప్రయత్నిస్తే, అతను మత్తులో లేని వ్యక్తి కంటే మరుసటి ఉదయం ఆ విషయం మెరుగ్గా గుర్తుంచుకుంటాడని, ఎందుకంటే కొంతమంది న్యూరాన్లు సరిగ్గా పనిచేయకపోవడం వల్ల మెదడు అర్థం చేసుకోవడానికి మెరుగ్గా అనుకూలమవుతుందని. మనం దీన్ని స్వయంగా పరీక్షించలేదు ఇది నిజమో కాదో.

ఓవర్‌ఫిట్టింగ్ నివారణ

డీప్ లెర్నింగ్‌లో ఒక ముఖ్యమైన అంశం ఓవర్‌ఫిట్టింగ్ నివారించడం. చాలా శక్తివంతమైన న్యూరల్ నెట్‌వర్క్ మోడల్ ఉపయోగించాలనిపించినా, మోడల్ పారామీటర్ల సంఖ్యను శిక్షణ నమూనాల సంఖ్యతో సమతుల్యం చేయాలి.

మనం ముందుగా పరిచయం చేసిన ఓవర్‌ఫిట్టింగ్ భావనను మీరు బాగా అర్థం చేసుకోవాలి!

ఓవర్‌ఫిట్టింగ్ నివారించడానికి కొన్ని మార్గాలు ఉన్నాయి:

  • ఎర్లీ స్టాప్పింగ్ -- వాలిడేషన్ సెట్ లో లోపాన్ని నిరంతరం పర్యవేక్షించి, వాలిడేషన్ లోపం పెరగడం ప్రారంభించినప్పుడు శిక్షణను ఆపడం.
  • స్పష్టమైన బరువు డికే / రెగ్యులరైజేషన్ -- బరువుల అధిక పరిమాణాలకు లాస్ ఫంక్షన్‌కు అదనపు శిక్షణా జరిమానా జోడించడం, ఇది మోడల్‌ను అస్థిర ఫలితాల నుండి రక్షిస్తుంది
  • మోడల్ సగటు -- అనేక మోడల్స్‌ను శిక్షణ ఇస్తూ, ఫలితాలను సగటు చేయడం. ఇది వైవిధ్యాన్ని తగ్గించడంలో సహాయపడుతుంది.
  • డ్రాప్‌అవుట్ (అప్రత్యక్ష మోడల్ సగటు)

ఆప్టిమైజర్లు / శిక్షణ అల్గోరిథమ్స్

శిక్షణలో మరో ముఖ్య అంశం మంచి శిక్షణ అల్గోరిథమ్ ఎంచుకోవడం. సాంప్రదాయ గ్రాడియెంట్ డిసెంట్ సరైన ఎంపిక అయినప్పటికీ, అది కొన్నిసార్లు చాలా నెమ్మదిగా ఉండవచ్చు లేదా ఇతర సమస్యలకు దారితీస్తుంది.

డీప్ లెర్నింగ్‌లో, మనం స్టోకాస్టిక్ గ్రాడియెంట్ డిసెంట్ (SGD) ఉపయోగిస్తాము, ఇది శిక్షణ సెట్ నుండి యాదృచ్ఛికంగా ఎంచుకున్న మినీబ్యాచ్‌లపై వర్తించే గ్రాడియెంట్ డిసెంట్. బరువులు ఈ సూత్రం ద్వారా సవరించబడతాయి:

wt+1 = wt - η∇ℒ

మోమెంటం

మోమెంటం SGDలో, మనం గత దశల నుండి గ్రాడియెంట్ యొక్క ఒక భాగాన్ని నిలుపుకుంటాము. ఇది మనం ఇనర్షియాతో ఎక్కడో కదులుతున్నప్పుడు, విభిన్న దిశలో పంచ్ వచ్చినా, మన మార్గం తక్షణమే మారదు, కానీ మొదటి కదలిక యొక్క కొంత భాగాన్ని కొనసాగిస్తుంది. ఇక్కడ మనం వేగం సూచించడానికి మరో వెక్టర్ v ను పరిచయం చేస్తాము:

  • vt+1 = γ vt - η∇ℒ
  • wt+1 = wt + vt+1

ఇక్కడ γ పారామీటర్ ఇనర్షియాను ఎంత మేర పరిగణలోకి తీసుకుంటుందో సూచిస్తుంది: γ=0 అంటే సాంప్రదాయ SGD; γ=1 అంటే శుద్ధమైన మోషన్ సమీకరణం.

ఆడమ్, అడాగ్రాడ్, మొదలైనవి

ప్రతి లేయర్‌లో మనం సిగ్నల్స్‌ను Wi అనే మ్యాట్రిక్స్‌తో గుణిస్తాము, ||Wi|| ఆధారంగా, గ్రాడియెంట్ 0కి దగ్గరగా తగ్గిపోవచ్చు లేదా ఎప్పటికీ పెరిగిపోవచ్చు. ఇదే Exploding/Vanishing Gradients సమస్య యొక్క మూలం.

ఈ సమస్యకు ఒక పరిష్కారం గ్రాడియెంట్ దిశను మాత్రమే ఉపయోగించడం, మరియు పరిమాణాన్ని పరిగణలోకి తీసుకోకపోవడం, అంటే:

wt+1 = wt - η(∇ℒ/||∇ℒ||), ఇక్కడ ||∇ℒ|| = √∑(∇ℒ)2

ఈ అల్గోరిథమ్‌ను Adagrad అంటారు. అదే భావనను ఉపయోగించే ఇతర అల్గోరిథమ్స్: RMSProp, Adam

Adam అనేది అనేక అప్లికేషన్లకు చాలా సమర్థవంతమైన అల్గోరిథమ్‌గా పరిగణించబడుతుంది, కాబట్టి మీరు ఏది ఉపయోగించాలో తెలియకపోతే - Adam ఉపయోగించండి.

గ్రాడియెంట్ క్లిప్పింగ్

గ్రాడియెంట్ క్లిప్పింగ్ పై చెప్పిన ఆలోచనకు విస్తరణ. ||∇ℒ|| ≤ θ అయితే, మేము అసలు గ్రాడియెంట్‌ను బరువు ఆప్టిమైజేషన్‌లో పరిగణిస్తాము, మరియు ||∇ℒ|| > θ అయితే, గ్రాడియెంట్‌ను దాని నార్మ్‌తో భాగిస్తాము. ఇక్కడ θ ఒక పారామీటర్, ఎక్కువ సందర్భాల్లో θ=1 లేదా θ=10 తీసుకోవచ్చు.

లెర్నింగ్ రేట్ డికే

శిక్షణ విజయానికి η అనే లెర్నింగ్ రేట్ పారామీటర్ చాలా ముఖ్యం. పెద్ద η విలువలు వేగవంతమైన శిక్షణకు దారితీస్తాయని భావించడం తార్కికం, ఇది శిక్షణ ప్రారంభంలో మనం సాధారణంగా కోరుకునేది, తరువాత చిన్న η విలువ నెట్‌వర్క్‌ను సున్నితంగా సర్దుబాటు చేయడానికి సహాయపడుతుంది. కాబట్టి, ఎక్కువ సందర్భాల్లో శిక్షణ సమయంలో η ను తగ్గించడం మంచిది.

దీన్ని ప్రతి ఎపోక్ తర్వాత η ను కొంత సంఖ్య (ఉదా. 0.98) తో గుణించడం ద్వారా చేయవచ్చు, లేదా మరింత క్లిష్టమైన లెర్నింగ్ రేట్ షెడ్యూల్ ఉపయోగించవచ్చు.

వివిధ నెట్‌వర్క్ ఆర్కిటెక్చర్లు

మీ సమస్యకు సరైన నెట్‌వర్క్ ఆర్కిటెక్చర్ ఎంచుకోవడం కష్టం కావచ్చు. సాధారణంగా, మనం మన ప్రత్యేక పనికి (లేదా దానికి సమానమైన పనికి) పనిచేసిన ఆర్కిటెక్చర్‌ను ఎంచుకుంటాము. కంప్యూటర్ విజన్ కోసం న్యూరల్ నెట్‌వర్క్ ఆర్కిటెక్చర్లపై మంచి సమీక్ష ఇది.

మన దగ్గర ఉన్న శిక్షణ నమూనాల సంఖ్యకు తగినంత శక్తివంతమైన ఆర్కిటెక్చర్ ఎంచుకోవడం ముఖ్యం. చాలా శక్తివంతమైన మోడల్ ఎంచుకోవడం ఓవర్‌ఫిట్టింగ్ కు దారితీస్తుంది.

మరొక మంచి మార్గం అవసరమైన సంక్లిష్టతకు ఆటోమేటిక్‌గా సర్దుబాటు అయ్యే ఆర్కిటెక్చర్ ఉపయోగించడం. కొంత మేరకు, ResNet ఆర్కిటెక్చర్ మరియు Inception స్వయంచాలకంగా సర్దుబాటు అవుతాయి. కంప్యూటర్ విజన్ ఆర్కిటెక్చర్లపై మరింత సమాచారం.


అస్పష్టత:
ఈ పత్రాన్ని AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో పొరపాట్లు లేదా తప్పిదాలు ఉండవచ్చు. మూల పత్రం దాని స్వదేశీ భాషలో అధికారిక మూలంగా పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదం వాడకంలో ఏర్పడిన ఏవైనా అపార్థాలు లేదా తప్పుదారితీసే అర్థాలు కోసం మేము బాధ్యత వహించము.