AI-For-Beginners/translations/pl/lessons/4-ComputerVision/07-ConvNets
leestott b9c43e4edf 🌐 Update translations via Co-op Translator 2025-08-31 14:13:46 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-31 14:13:46 +00:00
CNN_Architectures.md 🌐 Update translations via Co-op Translator 2025-08-24 10:52:15 +00:00
ConvNetsPyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-31 14:13:46 +00:00
ConvNetsTF.ipynb 🌐 Update translations via Co-op Translator 2025-08-31 14:13:46 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-24 10:52:15 +00:00

README.md

Konwolucyjne Sieci Neuronowe

Wcześniej zauważyliśmy, że sieci neuronowe całkiem dobrze radzą sobie z obrazami, a nawet perceptron z jedną warstwą potrafi rozpoznawać odręczne cyfry z zestawu danych MNIST z zadowalającą dokładnością. Jednak zestaw danych MNIST jest wyjątkowy, ponieważ wszystkie cyfry są wyśrodkowane na obrazie, co upraszcza zadanie.

Quiz przed wykładem

W rzeczywistości chcemy być w stanie rozpoznawać obiekty na zdjęciu niezależnie od ich dokładnej lokalizacji na obrazie. Wizja komputerowa różni się od ogólnej klasyfikacji, ponieważ gdy próbujemy znaleźć określony obiekt na zdjęciu, skanujemy obraz w poszukiwaniu specyficznych wzorów i ich kombinacji. Na przykład, szukając kota, najpierw możemy poszukiwać poziomych linii, które mogą tworzyć wąsy, a następnie określona kombinacja wąsów może wskazać, że to faktycznie zdjęcie kota. Ważna jest względna pozycja i obecność określonych wzorów, a nie ich dokładne położenie na obrazie.

Aby wyodrębnić wzory, użyjemy pojęcia filtrów konwolucyjnych. Jak wiadomo, obraz jest reprezentowany przez macierz 2D lub tensor 3D z głębią kolorów. Zastosowanie filtra oznacza, że bierzemy stosunkowo małą macierz jądra filtra i dla każdego piksela w oryginalnym obrazie obliczamy średnią ważoną z sąsiednich punktów. Możemy to sobie wyobrazić jako małe okno przesuwające się po całym obrazie i uśredniające wszystkie piksele zgodnie z wagami w macierzy jądra filtra.

Filtr krawędzi pionowych Filtr krawędzi poziomych

Obraz autorstwa Dmitry Soshnikov

Na przykład, jeśli zastosujemy filtry krawędzi pionowych i poziomych o rozmiarze 3x3 do cyfr z MNIST, możemy uzyskać wyróżnienia (np. wysokie wartości) tam, gdzie w oryginalnym obrazie występują krawędzie pionowe i poziome. Tak więc te dwa filtry mogą być używane do "wyszukiwania" krawędzi. Podobnie możemy projektować różne filtry, aby wyszukiwać inne wzory na niskim poziomie:

Obraz Leung-Malik Filter Bank

Jednak, podczas gdy możemy projektować filtry ręcznie, aby wyodrębniać pewne wzory, możemy również zaprojektować sieć w taki sposób, aby sama uczyła się wzorów automatycznie. To jedna z głównych idei stojących za CNN.

Główne idee stojące za CNN

Działanie CNN opiera się na następujących ważnych założeniach:

  • Filtry konwolucyjne mogą wyodrębniać wzory
  • Możemy zaprojektować sieć w taki sposób, aby filtry były trenowane automatycznie
  • Możemy użyć tego samego podejścia do znajdowania wzorów w cechach na wysokim poziomie, a nie tylko w oryginalnym obrazie. W ten sposób ekstrakcja cech w CNN działa na hierarchii cech, zaczynając od kombinacji pikseli na niskim poziomie, aż po kombinacje części obrazu na wyższym poziomie.

Hierarchiczna Ekstrakcja Cech

Obraz z artykułu Hislop-Lynch, opartego na ich badaniach

✍️ Ćwiczenia: Konwolucyjne Sieci Neuronowe

Kontynuujmy eksplorację działania konwolucyjnych sieci neuronowych i dowiedzmy się, jak możemy osiągnąć trenowalne filtry, pracując z odpowiednimi notatnikami:

Architektura Piramidy

Większość CNN używanych do przetwarzania obrazów stosuje tak zwaną architekturę piramidy. Pierwsza warstwa konwolucyjna zastosowana do oryginalnych obrazów zazwyczaj ma stosunkowo niewielką liczbę filtrów (8-16), które odpowiadają różnym kombinacjom pikseli, takim jak poziome/pionowe linie lub kreski. Na następnym poziomie zmniejszamy wymiar przestrzenny sieci i zwiększamy liczbę filtrów, co odpowiada większej liczbie możliwych kombinacji prostych cech. Z każdą warstwą, w miarę zbliżania się do końcowego klasyfikatora, wymiary przestrzenne obrazu maleją, a liczba filtrów rośnie.

Na przykład, spójrzmy na architekturę VGG-16, sieci, która osiągnęła 92,7% dokładności w klasyfikacji top-5 ImageNet w 2014 roku:

Warstwy ImageNet

Piramida ImageNet

Obraz z Researchgate

Najbardziej Znane Architektury CNN

Kontynuuj naukę o najbardziej znanych architekturach CNN

Zastrzeżenie:
Ten dokument został przetłumaczony za pomocą usługi tłumaczenia AI Co-op Translator. Chociaż dokładamy wszelkich starań, aby zapewnić poprawność tłumaczenia, prosimy pamiętać, że automatyczne tłumaczenia mogą zawierać błędy lub nieścisłości. Oryginalny dokument w jego rodzimym języku powinien być uznawany za autorytatywne źródło. W przypadku informacji o kluczowym znaczeniu zaleca się skorzystanie z profesjonalnego tłumaczenia przez człowieka. Nie ponosimy odpowiedzialności za jakiekolwiek nieporozumienia lub błędne interpretacje wynikające z korzystania z tego tłumaczenia.