Modellarchitekturen
Visuelle Encoder
Wandeln Pixel in Feature Maps, Patch-Token oder gepoolte Vektoren um, die von nachgelagerten Klassifikatoren, Suchsystemen, Decodern oder multimodalen Modellen verarbeitet werden können.
Denkmodell
Ein visueller Leser. Er erzeugt Repräsentationen; zur Generierung wird ein Decoder oder generatives Modell benötigt.
Datenfluss
- Bild oder Frames
- Patch-, Faltungs- oder Hybrid-Stem
- Vision Backbone
- Räumliche Token / Feature Pyramid / gepoolter Vektor
- Task Head oder Modalitätsverknüpfer
So wird trainiert
Überwachte Labels, Maskiertes Bildmodellierung, Selbst-Destillation, Rekonstruktion und bild-text-kontrastive Ziele erzeugen unterschiedliche visuelle Invarianten und Detaillierungsgrade im räumlichen Bereich.
So läuft die Inferenz
Der Encoder wird einmal pro Bild oder Frame-Batch ausgeführt. Aggregierte Ausgaben eignen sich für Retrieval und Klassifikation; dichte Token-Karten bewahren mehr räumliche Informationen für Erkennung oder multimodale Schlussfolgerungen.
Stärken
- Wiederverwendbare visuelle Features
- Effiziente Klassifikation, Retrieval und Wahrnehmung
- Kann Bilder über einen Projektor oder Cross-Attention mit Sprachmodellen verbinden
Zielkonflikte
- Auflösung und Patch-Größe bestimmen Informationsverlust und Token-Kosten
- Trainingsziele erzeugen unterschiedliche blinde Flecken
- Ein gepoolter Vektor ist für viele räumliche Aufgaben unzureichend
Geeignet, wenn
- Das System muss visuellen Inhalt verstehen oder abrufen
- Sie können zwischen gepoolten und räumlichen Features basierend auf der Aufgabe wählen
- Kleine Texte, Diagramme und domänenspezifische Bilder werden explizit evaluiert
Vermeiden oder hinterfragen, wenn
- Visuelle Generierung wird fälschlicherweise vom Encoder allein erwartet
- Die Eingangsauflösung entfernt notwendige Details
- Ein generischer Bild-Benchmark ersetzt die tatsächliche Domäne
Beispielhafte veröffentlichte Familien
- • Vision Transformer (ViT)
- • Faltungs- und hierarchische Vision Backbones
- • Der Image Tower in CLIP
Häufig kombiniert mit
Kontrastive und Dual EncoderMultimodale FusionsmodelleBild- und Videogeneratoren