Skip to main content

Einführung in Autoencoder

Autoencoder sind eine Klasse neuronaler Netzwerke, die hauptsächlich für unüberwachtes Lernen und Dimensionsreduktion verwendet werden. Die grundlegende Idee hinter Autoencodern besteht darin, Eingabedaten in eine niedrigerdimensionale Darstellung zu kodieren und sie anschließend wieder in die ursprünglichen Daten zu dekodieren, mit dem Ziel, den Rekonstruktionsfehler zu minimieren. Die grundlegende Architektur eines Autoencoders besteht aus zwei Hauptkomponenten: dem Encoder und dem Decoder.
  • Encoder: Der Encoder ist dafür verantwortlich, die Eingabedaten in eine komprimierte oder latente Darstellung umzuwandeln. Er besteht typischerweise aus einer oder mehreren Neuronenschichten, die die Dimensionen der Eingabe schrittweise reduzieren.
  • Decoder: Der Decoder hingegen nimmt die vom Encoder erzeugte komprimierte Darstellung und versucht, die ursprünglichen Eingabedaten zu rekonstruieren. Wie der Encoder besteht er häufig aus einer oder mehreren Schichten, jedoch in umgekehrter Reihenfolge, wobei die Dimensionen schrittweise erhöht werden.

Überblick über Variational Autoencoders (VAEs)

Variational Autoencoders (VAEs) adressieren einige der Einschränkungen traditioneller Autoencoder, indem sie einen probabilistischen Ansatz für Kodierung und Dekodierung einführen. Die Motivation hinter VAEs liegt in ihrer Fähigkeit, neue Datenbeispiele zu erzeugen, indem aus einer gelernten Verteilung im latenten Raum gesampelt wird, anstatt aus einem festen latenten Vektor, wie es bei einfachen Autoencodern der Fall war. Dadurch eignen sie sich für generative Aufgaben.
  • Probabilistische Natur: Im Gegensatz zu deterministischen Autoencodern modellieren VAEs den latenten Raum als Wahrscheinlichkeitsverteilung. Dadurch entsteht eine Wahrscheinlichkeitsverteilungsfunktion über die Eingabekodierungen, statt nur eines einzelnen festen Vektors, was eine differenziertere Darstellung von Unsicherheit in den Daten ermöglicht. Der Decoder sampelt anschließend aus dieser Wahrscheinlichkeitsverteilung.
  • Rolle des latenten Raums: Der latente Raum in VAEs dient als kontinuierliche, strukturierte Darstellung der Eingabedaten. Da er von vornherein kontinuierlich ist, ermöglicht dies eine einfache Interpolation. Jeder Punkt im latenten Raum entspricht einer potenziellen Ausgabe, wodurch fließende Übergänge zwischen verschiedenen Datenpunkten möglich werden und sichergestellt wird, dass Punkte, die im latenten Raum näher beieinanderliegen, zu ähnlichen Generierungen führen.
Das Konzept lässt sich anhand eines einfachen Beispiels veranschaulichen, wie unten dargestellt. Encoder innerhalb eines neuronalen Netzwerks haben die Aufgabe, eine Darstellung von Eingabebildern in Form eines Vektors zu erlernen. Dieser Vektor kapselt verschiedene Merkmale wie das Lächeln einer Person, Haarfarbe, Geschlecht, Alter usw. und wird als Vektor ähnlich wie [0.4, 0.03, 0.032, …] dargestellt. In dieser Illustration wird der Fokus auf eine einzelne latente Darstellung eingegrenzt, nämlich das Attribut eines „Lächelns“. Autoencoder vs. VAEs - Sciforce MediumIm Kontext von Vanilla Autoencoders (AE) wird das Lächeln-Merkmal als fester, deterministischer Wert gekapselt. Im Gegensatz dazu sind Variational Autoencoders (VAEs) bewusst so gestaltet, dass sie dieses Merkmal als probabilistische Verteilung kapseln. Diese Designentscheidung erleichtert die Einführung von Variabilität in generierten Bildern, indem das Sampling von Werten aus der angegebenen Wahrscheinlichkeitsverteilung ermöglicht wird.
Zusammenfassend gehen VAEs über die reine Datenrekonstruktion hinaus; sie erzeugen neue Beispiele und bieten ein probabilistisches Framework zum Verständnis latenter Darstellungen. Die Einbeziehung probabilistischer Elemente in die Architektur des Modells hebt VAEs von traditionellen Autoencodern ab. Im Vergleich zu traditionellen Autoencodern bieten VAEs ein umfassenderes Verständnis der Datenverteilung, wodurch sie besonders leistungsstark für generative Aufgaben sind.
Zuletzt geändert am 15. Mai 2026