AI-For-Beginners/translations/bn/lessons/4-ComputerVision/07-ConvNets/CNN_Architectures.md

12 KiB
Raw Blame History

পরিচিত CNN আর্কিটেকচার

VGG-16

VGG-16 একটি নেটওয়ার্ক যা ২০১৪ সালে ImageNet টপ-৫ শ্রেণীবিন্যাসে ৯২.% সঠিকতা অর্জন করেছিল। এর স্তর কাঠামো নিম্নরূপ:

ImageNet Layers

যেমনটি দেখা যাচ্ছে, VGG একটি ঐতিহ্যবাহী পিরামিড আর্কিটেকচার অনুসরণ করে, যা কনভোলিউশন-পুলিং স্তরের একটি ক্রম।

ImageNet Pyramid

ছবি Researchgate থেকে

ResNet

ResNet একটি মডেলের পরিবার যা ২০১৫ সালে Microsoft Research দ্বারা প্রস্তাবিত হয়েছিল। ResNet-এর মূল ধারণা হল রেসিডুয়াল ব্লক ব্যবহার করা:

ছবি এই পেপার থেকে

আইডেন্টিটি পাস-থ্রু ব্যবহারের কারণ হল আমাদের স্তরকে পূর্ববর্তী স্তরের ফলাফল এবং রেসিডুয়াল ব্লকের আউটপুটের মধ্যে পার্থক্য পূর্বাভাস করতে সক্ষম করা - তাই নাম রেসিডুয়াল। এই ব্লকগুলি প্রশিক্ষণ করা অনেক সহজ, এবং কয়েক শতাধিক ব্লক নিয়ে নেটওয়ার্ক তৈরি করা সম্ভব (সবচেয়ে সাধারণ ভ্যারিয়েন্টগুলি হল ResNet-52, ResNet-101 এবং ResNet-152)।

আপনি এই নেটওয়ার্কটিকে ডেটাসেটের সাথে তার জটিলতা সামঞ্জস্য করতে সক্ষম হিসাবে ভাবতে পারেন। প্রথমে, যখন আপনি নেটওয়ার্ক প্রশিক্ষণ শুরু করেন, তখন ওজনের মান ছোট থাকে এবং বেশিরভাগ সংকেত আইডেন্টিটি স্তরগুলির মাধ্যমে যায়। প্রশিক্ষণ চলাকালীন ওজন বড় হয়ে যায়, নেটওয়ার্ক প্যারামিটারগুলির গুরুত্ব বৃদ্ধি পায়, এবং নেটওয়ার্কটি সঠিকভাবে প্রশিক্ষণ চিত্র শ্রেণীবিন্যাস করার জন্য প্রয়োজনীয় এক্সপ্রেসিভ পাওয়ার সামঞ্জস্য করে।

Google Inception

Google Inception আর্কিটেকচার এই ধারণাটিকে আরও এক ধাপ এগিয়ে নিয়ে যায় এবং প্রতিটি নেটওয়ার্ক স্তরকে বিভিন্ন পথের সমন্বয়ে তৈরি করে:

ছবি Researchgate থেকে

এখানে, আমাদের ১x১ কনভোলিউশনগুলির ভূমিকা জোর দিতে হবে, কারণ প্রথমে এগুলি অর্থবোধ করে না। কেন আমরা ১x১ ফিল্টার দিয়ে ছবির উপর চালাব? তবে, মনে রাখতে হবে যে কনভোলিউশন ফিল্টারগুলি বিভিন্ন গভীরতার চ্যানেলগুলির সাথে কাজ করে (মূলত - RGB রঙ, পরবর্তী স্তরে - বিভিন্ন ফিল্টারের জন্য চ্যানেল), এবং ১x১ কনভোলিউশন বিভিন্ন প্রশিক্ষণযোগ্য ওজন ব্যবহার করে ইনপুট চ্যানেলগুলিকে একত্রিত করতে ব্যবহৃত হয়। এটি চ্যানেল মাত্রার উপর ডাউনস্যাম্পলিং (পুলিং) হিসাবেও দেখা যেতে পারে।

এখানে ১x১ কনভোলিউশন সম্পর্কে একটি ভালো ব্লগ পোস্ট এবং মূল পেপার

MobileNet

MobileNet হল ছোট আকারের মডেলের একটি পরিবার, যা মোবাইল ডিভাইসের জন্য উপযুক্ত। যদি আপনার সম্পদ সীমিত থাকে এবং সামান্য সঠিকতা ত্যাগ করতে পারেন, তবে এগুলি ব্যবহার করুন। এর মূল ধারণা হল ডেপথওয়াইজ সেপারেবল কনভোলিউশন, যা স্থানীয় কনভোলিউশন এবং গভীরতার চ্যানেলের উপর ১x১ কনভোলিউশন দ্বারা কনভোলিউশন ফিল্টার উপস্থাপন করতে দেয়। এটি প্যারামিটারের সংখ্যা উল্লেখযোগ্যভাবে কমিয়ে দেয়, নেটওয়ার্কটিকে ছোট আকারে তৈরি করে এবং কম ডেটা দিয়ে প্রশিক্ষণ দেওয়া সহজ করে।

এখানে MobileNet সম্পর্কে একটি ভালো ব্লগ পোস্ট

উপসংহার

এই ইউনিটে, আপনি কম্পিউটার ভিশন নিউরাল নেটওয়ার্কের মূল ধারণা শিখেছেন - কনভোলিউশনাল নেটওয়ার্ক। বাস্তব জীবনের আর্কিটেকচারগুলি যা ইমেজ ক্লাসিফিকেশন, অবজেক্ট ডিটেকশন, এবং এমনকি ইমেজ জেনারেশন নেটওয়ার্ককে শক্তি প্রদান করে, সবই CNN-এর উপর ভিত্তি করে তৈরি, শুধু আরও স্তর এবং কিছু অতিরিক্ত প্রশিক্ষণ কৌশল সহ।

🚀 চ্যালেঞ্জ

সংযুক্ত নোটবুকে, নীচে উল্লেখ রয়েছে কীভাবে আরও বেশি সঠিকতা অর্জন করা যায়। কিছু পরীক্ষা-নিরীক্ষা করুন এবং দেখুন আপনি কি আরও বেশি সঠিকতা অর্জন করতে পারেন।

পোস্ট-লেকচার কুইজ

পর্যালোচনা ও স্ব-অধ্যয়ন

যদিও CNN সাধারণত কম্পিউটার ভিশন কাজের জন্য ব্যবহৃত হয়, এটি সাধারণত নির্দিষ্ট আকারের প্যাটার্ন বের করার জন্য ভালো। উদাহরণস্বরূপ, যদি আমরা শব্দ নিয়ে কাজ করি, আমরা অডিও সিগনালে কিছু নির্দিষ্ট প্যাটার্ন খুঁজতে CNN ব্যবহার করতে চাই - এই ক্ষেত্রে ফিল্টারগুলি ১-ডাইমেনশনাল হবে (এবং এই CNN-কে 1D-CNN বলা হবে)। এছাড়াও, কখনও কখনও 3D-CNN ব্যবহার করা হয় বহু-মাত্রিক স্থানে বৈশিষ্ট্য বের করার জন্য, যেমন ভিডিওতে কিছু নির্দিষ্ট ঘটনা ঘটছে - CNN সময়ের সাথে বৈশিষ্ট্যের পরিবর্তনের নির্দিষ্ট প্যাটার্নগুলি ধরতে পারে। CNN দিয়ে করা যেতে পারে এমন অন্যান্য কাজ সম্পর্কে কিছু পর্যালোচনা এবং স্ব-অধ্যয়ন করুন।

অ্যাসাইনমেন্ট

এই ল্যাবে, আপনাকে বিভিন্ন বিড়াল এবং কুকুরের জাত শ্রেণীবিন্যাস করতে হবে। এই ছবিগুলি MNIST ডেটাসেটের তুলনায় আরও জটিল এবং উচ্চতর মাত্রার, এবং ১০টির বেশি শ্রেণী রয়েছে।

অস্বীকৃতি:
এই নথিটি AI অনুবাদ পরিষেবা Co-op Translator ব্যবহার করে অনুবাদ করা হয়েছে। আমরা যথাসম্ভব সঠিক অনুবাদের চেষ্টা করি, তবে অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। নথিটির মূল ভাষায় রচিত সংস্করণটিকেই প্রামাণিক উৎস হিসেবে বিবেচনা করা উচিত। গুরুত্বপূর্ণ তথ্যের জন্য পেশাদার মানব অনুবাদ সুপারিশ করা হয়। এই অনুবাদ ব্যবহারের ফলে সৃষ্ট কোনো ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়ী নই।