|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CNN_Architectures.md | ||
| ConvNetsPyTorch.ipynb | ||
| ConvNetsTF.ipynb | ||
| README.md | ||
README.md
Συνελικτικά Νευρωνικά Δίκτυα
Έχουμε δει προηγουμένως ότι τα νευρωνικά δίκτυα είναι αρκετά καλά στην επεξεργασία εικόνων, και ακόμη και ένας απλός perceptron ενός επιπέδου μπορεί να αναγνωρίσει χειρόγραφα ψηφία από το σύνολο δεδομένων MNIST με ικανοποιητική ακρίβεια. Ωστόσο, το σύνολο δεδομένων MNIST είναι πολύ ιδιαίτερο, καθώς όλα τα ψηφία είναι κεντραρισμένα μέσα στην εικόνα, γεγονός που απλοποιεί το έργο.
Κουίζ πριν τη διάλεξη
Στην πραγματική ζωή, θέλουμε να μπορούμε να αναγνωρίζουμε αντικείμενα σε μια εικόνα ανεξάρτητα από την ακριβή τους θέση μέσα σε αυτή. Η υπολογιστική όραση διαφέρει από τη γενική ταξινόμηση, διότι όταν προσπαθούμε να βρούμε ένα συγκεκριμένο αντικείμενο σε μια εικόνα, σαρώνουμε την εικόνα αναζητώντας συγκεκριμένα μοτίβα και τους συνδυασμούς τους. Για παράδειγμα, όταν ψάχνουμε για μια γάτα, μπορεί αρχικά να αναζητήσουμε οριζόντιες γραμμές που σχηματίζουν μουστάκια, και στη συνέχεια ένας συγκεκριμένος συνδυασμός από μουστάκια μπορεί να μας υποδείξει ότι πρόκειται για εικόνα γάτας. Η σχετική θέση και η παρουσία συγκεκριμένων μοτίβων είναι σημαντική, και όχι η ακριβής τους θέση στην εικόνα.
Για να εξάγουμε μοτίβα, θα χρησιμοποιήσουμε την έννοια των συνελικτικών φίλτρων. Όπως γνωρίζετε, μια εικόνα αναπαρίσταται από έναν δισδιάστατο πίνακα ή έναν τρισδιάστατο τανυστή με βάθος χρώματος. Η εφαρμογή ενός φίλτρου σημαίνει ότι παίρνουμε έναν σχετικά μικρό πίνακα πυρήνα φίλτρου, και για κάθε pixel στην αρχική εικόνα υπολογίζουμε τον σταθμισμένο μέσο όρο με τα γειτονικά σημεία. Μπορούμε να το δούμε σαν ένα μικρό παράθυρο που γλιστρά πάνω από ολόκληρη την εικόνα, εξομαλύνοντας όλα τα pixels σύμφωνα με τα βάρη στον πίνακα πυρήνα φίλτρου.
![]() |
![]() |
|---|
Εικόνα από τον Dmitry Soshnikov
Για παράδειγμα, αν εφαρμόσουμε φίλτρα 3x3 για κάθετες και οριζόντιες άκρες στα ψηφία του MNIST, μπορούμε να εντοπίσουμε σημεία με υψηλές τιμές όπου υπάρχουν κάθετες και οριζόντιες άκρες στην αρχική μας εικόνα. Έτσι, αυτά τα δύο φίλτρα μπορούν να χρησιμοποιηθούν για να "αναζητήσουν" άκρες. Παρομοίως, μπορούμε να σχεδιάσουμε διαφορετικά φίλτρα για να εντοπίσουμε άλλα μοτίβα χαμηλού επιπέδου:
Εικόνα του Leung-Malik Filter Bank
Ωστόσο, ενώ μπορούμε να σχεδιάσουμε τα φίλτρα για να εξάγουμε κάποια μοτίβα χειροκίνητα, μπορούμε επίσης να σχεδιάσουμε το δίκτυο με τέτοιο τρόπο ώστε να μαθαίνει τα μοτίβα αυτόματα. Αυτή είναι μία από τις βασικές ιδέες πίσω από τα CNN.
Βασικές ιδέες πίσω από τα CNN
Ο τρόπος λειτουργίας των CNN βασίζεται στις εξής σημαντικές ιδέες:
- Τα συνελικτικά φίλτρα μπορούν να εξάγουν μοτίβα
- Μπορούμε να σχεδιάσουμε το δίκτυο με τέτοιο τρόπο ώστε τα φίλτρα να εκπαιδεύονται αυτόματα
- Μπορούμε να χρησιμοποιήσουμε την ίδια προσέγγιση για να βρούμε μοτίβα σε χαρακτηριστικά υψηλού επιπέδου, όχι μόνο στην αρχική εικόνα. Έτσι, η εξαγωγή χαρακτηριστικών από τα CNN λειτουργεί σε μια ιεραρχία χαρακτηριστικών, ξεκινώντας από συνδυασμούς pixels χαμηλού επιπέδου, μέχρι συνδυασμούς υψηλότερου επιπέδου από μέρη της εικόνας.
Εικόνα από μια εργασία των Hislop-Lynch, βασισμένη στην έρευνά τους
✍️ Ασκήσεις: Συνελικτικά Νευρωνικά Δίκτυα
Ας συνεχίσουμε να εξερευνούμε πώς λειτουργούν τα συνελικτικά νευρωνικά δίκτυα και πώς μπορούμε να επιτύχουμε εκπαιδεύσιμα φίλτρα, δουλεύοντας μέσα από τα αντίστοιχα notebooks:
Αρχιτεκτονική Πυραμίδας
Τα περισσότερα CNN που χρησιμοποιούνται για επεξεργασία εικόνας ακολουθούν τη λεγόμενη αρχιτεκτονική πυραμίδας. Το πρώτο συνελικτικό επίπεδο που εφαρμόζεται στις αρχικές εικόνες έχει συνήθως σχετικά μικρό αριθμό φίλτρων (8-16), τα οποία αντιστοιχούν σε διαφορετικούς συνδυασμούς pixels, όπως οριζόντιες/κάθετες γραμμές ή πινελιές. Στο επόμενο επίπεδο, μειώνουμε τη χωρική διάσταση του δικτύου και αυξάνουμε τον αριθμό των φίλτρων, που αντιστοιχούν σε περισσότερους πιθανούς συνδυασμούς απλών χαρακτηριστικών. Με κάθε επίπεδο, καθώς προχωράμε προς τον τελικό ταξινομητή, οι χωρικές διαστάσεις της εικόνας μειώνονται και ο αριθμός των φίλτρων αυξάνεται.
Ως παράδειγμα, ας δούμε την αρχιτεκτονική του VGG-16, ενός δικτύου που πέτυχε ακρίβεια 92.7% στην ταξινόμηση top-5 του ImageNet το 2014:
Εικόνα από Researchgate
Γνωστότερες Αρχιτεκτονικές CNN
Συνεχίστε τη μελέτη σας για τις γνωστότερες αρχιτεκτονικές CNN
Αποποίηση Ευθύνης:
Αυτό το έγγραφο έχει μεταφραστεί χρησιμοποιώντας την υπηρεσία αυτόματης μετάφρασης AI Co-op Translator. Παρόλο που καταβάλλουμε προσπάθειες για ακρίβεια, παρακαλούμε να έχετε υπόψη ότι οι αυτόματες μεταφράσεις ενδέχεται να περιέχουν λάθη ή ανακρίβειες. Το πρωτότυπο έγγραφο στη μητρική του γλώσσα θα πρέπει να θεωρείται η αυθεντική πηγή. Για κρίσιμες πληροφορίες, συνιστάται επαγγελματική ανθρώπινη μετάφραση. Δεν φέρουμε ευθύνη για τυχόν παρεξηγήσεις ή εσφαλμένες ερμηνείες που προκύπτουν από τη χρήση αυτής της μετάφρασης.




