Modellarchitekturen
Multimodale Fusionsmodelle
Verbinden modalitätsspezifische Encoder und Generatoren durch Projektion, Cross-Attention, gemeinsame Tokenräume oder Kombinationen davon.
Denkmodell
„Multimodal“ bezeichnet die Eingaben und Ausgaben, nicht eine bestimmte Topologie. Fragen Sie immer, wo Modalitäten kodiert, fusioniert und dekodiert werden.
Datenfluss
- Text / Bild / Audio / Video
- Modalitätscoder oder Tokenizer
- Projektor, Cross-Attention oder gemeinsames Backbone
- Gemeinsame Repräsentation / Sprachdekoder
- Text-, Medien- oder Aktionsausgabe
So wird trainiert
Systeme kombinieren kontrastives Alignment, Captioning oder Next-Token-Likelihood, Maskierungsziele, gepaarte Anweisungsdaten und manchmal separat vortrainierte, eingefrorene Komponenten.
So läuft die Inferenz
Eingaben werden als Modalitätstoken oder Merkmale kodiert, vor oder innerhalb des Sprach- beziehungsweise Generationsmodells zusammengeführt und in eine oder mehrere Modalitäten dekodiert. Das Verstehen einer Eingabe setzt nicht voraus, dass das System diese Modalität auch erzeugen kann.
Stärken
- Verankert Sprache in visuellen oder akustischen Eingaben
- Unterstützt Dokument-, Diagramm-, Bild-, Video- und Audio-Workflows
- Kann starke, vortrainierte Modalitätskomponenten wiederverwenden
Zielkonflikte
- Modalitätsungleichgewicht und Connector-Engpässe
- Medien-Token verbrauchen beträchtlichen Kontext und Rechenleistung
- Bewertung muss Wahrnehmung, Verankerung, Argumentation und Generierung trennen
Geeignet, wenn
- Die Aufgabe tatsächlich von nicht-textuellen Beweisen abhängt
- Modalitätsspezifische Slices und Abstinenz werden bewertet
- Die Architektur genügend Details für Kosten- und Datenschutzprüfungen offenlegt
Vermeiden oder hinterfragen, wenn
- Ein Transkript, OCR-Ergebnis oder strukturierter Extraktor ausreichend ist
- “Unterstützt Bilder” bedeutet vermeintlich präzise Wahrnehmung
- Sensitiver Medienumgang und -speicherung sind undefiniert
Beispielhafte veröffentlichte Familien
- • Flamingo Cross-Attention Architektur
- • BLIP-2 gelerntes Querying Connector
- • Systeme mit gemeinsamem Token-Multimodal-Dekoder