Variational Autoencoder (VAE)

Τι είναι ένας VAE;

Ένας Variational Autoencoder (VAE) είναι μια αρχιτεκτονική τεχνητών νευρωνικών δικτύων που χρησιμοποιείται στο machine learning και στο genAI. Ανήκει στην κατηγορία των generative models, τα οποία είναι αλγόριθμοι σχεδιασμένοι για τη δημιουργία νέων δεδομένων που μοιάζουν με τα δεδομένα του training dataset. Σε αντίθεση με τους παραδοσιακούς autoencoders που αντιστοιχίζουν τα δεδομένα εισόδου σε ένα σταθερό, ντετερμινιστικό διάνυσμα, ένας VAE αντιστοιχίζει τα δεδομένα σε μια πιθανοτική κατανομή, συνήθως Gaussian που χαρακτηρίζεται από στατιστικό mean και variance. Αυτή η πιθανοτική αντιστοίχιση διασφαλίζει ότι η αναπαράσταση στο latent space είναι δομημένη και συνεχής. Κατά συνέπεια, ένας VAE μπορεί να εκτελέσει sampling τυχαίων στατιστικών τιμών από αυτό το latent space και να τις αποκωδικοποιήσει για να παράγει ολοκαίνουργια, συνθετικά δεδομένα, όπως εικόνες, κείμενο ή ακολουθίες ήχου, τα οποία διατηρούν τις υποκείμενες στατιστικές ιδιότητες των αρχικών δεδομένων εκπαίδευσης.

Πώς λειτουργεί η αρχιτεκτονική ενός VAE;

Η αρχιτεκτονική ενός Variational Autoencoder αποτελείται από δύο κύρια νευρωνικά δίκτυα που εκπαιδεύονται ταυτόχρονα: τον encoder και τον decoder. Ο encoder επεξεργάζεται πολυδιάστατα δεδομένα εισόδου, όπως μια εικόνα, και τα συμπιέζει σε μια αναπαράσταση χαμηλότερων διαστάσεων. Αντί να εξάγει ένα μόνο σύνολο συντεταγμένων, ο encoder εξάγει τις στατιστικές παραμέτρους μιας πιθανοτικής κατανομής για κάθε latent variable. Ένας μηχανισμός sampling επιλέγει στη συνέχεια ένα σημείο δεδομένων από αυτή την κατανομή. Ο decoder λαμβάνει αυτό το σημείο από το latent space και το ανακατασκευάζει στην αρχική, πολυδιάστατη μορφή εισόδου. Κατά τη διάρκεια του training, το σύστημα βελτιστοποιεί δύο στόχους ταυτόχρονα: ελαχιστοποιεί το reconstruction error, το οποίο μετρά με πόση ακρίβεια ο decoder αναπαράγει την αρχική είσοδο, και ομαλοποιεί το latent space ώστε οι κατανομές να παραμένουν κοντά σε μια τυπική κανονική κατανομή.

Ποιο είναι το θεωρητικό υπόβαθρο πίσω από τους Variational Autoencoders;

Οι Variational Autoencoders βασίζονται στο Bayesian inference και στην θεωρία της πληροφορίας, χρησιμοποιώντας συγκεκριμένα ένα μαθηματικό πλαίσιο που ονομάζεται variational inference για την προσέγγιση μη υπολογίσιμων κατανομών πιθανότητας. Στη στατιστική, ο ακριβής υπολογισμός της κατανομής πιθανότητας κρυφών μεταβλητών είναι συχνά υπολογιστικά αδύνατος για πολύπλοκα datasets. Οι VAEs λύνουν αυτό το πρόβλημα εισάγοντας ένα παραμετρικό μοντέλο συμπερασμού (τον νευρωνικό encoder) για την προσέγγιση της πραγματικής οπίσθιας κατανομής. Για να μετρήσουν και να ελαχιστοποιήσουν τη διαφορά μεταξύ της προσεγγιστικής κατανομής και της κατανομής στόχου, οι VAEs χρησιμοποιούν μια στατιστική μετρική που ονομάζεται Kullback-Leibler divergence. Η συνολική διαδικασία εκπαίδευσης μεγιστοποιεί μια στατιστική ποσότητα γνωστή ως Evidence Lower Bound (ELBO). Με τη μεγιστοποίηση αυτού του ορίου, το μοντέλο βελτιώνει ταυτόχρονα την ακρίβεια των ανακατασκευών των δεδομένων του και διασφαλίζει ότι το latent space παραμένει συνεχές και καλά δομημένο, χωρίς να βασίζεται σε πολύπλοκη μαθηματική ολοκλήρωση.

Ποια είναι η διαφορά μεταξύ ενός τυπικού Autoencoder και ενός Variational Autoencoder;

Η κύρια διαφορά έγκειται στο πώς αναπαριστούν τα συμπιεσμένα δεδομένα στο latent space και στην ικανότητά τους να παράγουν νέο περιεχόμενο. Ένας τυπικός autoencoder είναι ένα διακριτικό μοντέλο σχεδιασμένο καθαρά για συμπίεση δεδομένων και απαλοιφή θορύβου. Κωδικοποιεί μια είσοδο σε ένα μόνο, σταθερό σημείο συντεταγμένων στο latent space. Επειδή δεν υπάρχουν δομικοί περιορισμοί στο πώς οργανώνονται αυτά τα σημεία, το latent space περιέχει κενές περιοχές και ασυνέχειες. Αν επιλεγεί μια τυχαία συντεταγμένη από μια κενή περιοχή στο latent space ενός τυπικού autoencoder, ο decoder θα παράγει μια παραμορφωμένη έξοδο χωρίς νόημα. Αντίθετα, ένας Variational Autoencoder επιβάλλει μια συνεχή πιθανοτική δομή στο latent space. Επειδή κάθε είσοδος αντιστοιχίζεται σε μια πιθανοτική κατανομή αντί για ένα σταθερό σημείο, οι επικαλυπτόμενες κατανομές εξαλείφουν τα κενά. Αυτή η δομική κανονικότητα μετατρέπει το μοντέλο από ένα απλό εργαλείο συμπίεσης σε ένα ισχυρό παραγωγικό μοντέλο, ικανό να συνθέτει ρεαλιστικά νέα δεδομένα από οποιοδήποτε τυχαία επιλεγμένο σημείο του latent space.

Ποιες είναι οι κύριες εφαρμογές και οι περιορισμοί των VAEs στο σύγχρονο Data Science;

Στο σύγχρονο data science, οι Variational Autoencoders χρησιμοποιούνται ευρέως για εργασίες που απαιτούν συνεχή παραγωγή δεδομένων, representation learning και anomaly detection. Οι κοινές εφαρμογές περιλαμβάνουν τη δημιουργία συνθετικών datasets εικόνων, τη σύνθεση χημικών μοριακών δομών για την ανακάλυψη φαρμάκων, την παραγωγή ομιλίας και τη δημιουργία recommendation systems μέσω της μοντελοποίησης πολύπλοκων μοτίβων συμπεριφοράς χρηστών.

Στο anomaly detection, οι VAEs εντοπίζουν ακανόνιστα σημεία δεδομένων μετρώντας το σφάλμα αναπροσαρμογής. Τα δεδομένα που αποκλίνουν σημαντικά από την κατανομή εκπαίδευσης εμφανίζουν ασυνήθιστα υψηλά σφάλματα ανακατασκευής. Ωστόσο, οι VAEs παρουσιάζουν και συγκεκριμένους τεχνικούς περιορισμούς. Όταν εφαρμόζονται στην παραγωγή εικόνων υψηλής ανάλυσης, συχνά παράγουν αποτελέσματα που είναι ελαφρώς θολά σε σύγκριση με εναλλακτικά generative models, όπως τα Generative Adversarial Networks (GANs) ή τα Diffusion Models. Αυτή η θολούρα συμβαίνει επειδή η στατιστική loss function υπολογίζει τον μέσο όρο των πιθανών παραλλαγών των pixels, δίνοντας προτεραιότητα στη συνολική στατιστική κάλυψη έναντι της λεπτής, τοπικής λεπτομέρειας.