Modellarchitekturen
Praxisleitfaden zu Modellarchitekturen
Architekturen generativer Modelle
Verstehen Sie die Technik hinter Text-, Embedding-, Bild-, Video-, Audio- und multimodalen Produkten. Wählen Sie anschließend bewusst Grundarchitektur, Repräsentation, Generator und Systemrahmen.
22 Architekturfamilien · 5 Gruppen · eine Seite je Familie
Der entscheidende Unterschied
Eine Fähigkeit ist keine Architektur
„Chat“, „Bild“ und „multimodal“ beschreiben eine Schnittstelle. Decoder-only, Zustandsraum, DiT und MoE beschreiben interne Berechnungen. RAG und Werkzeugnutzung bezeichnen das Laufzeitsystem um ein Modell. Ein Produktionssystem kann zu Recht alle drei Arten von Bezeichnung tragen.
= Chat-Fähigkeit
+ Decoder-only-Grundarchitektur
+ Retrieval und Neusortierung
+ typisierter Werkzeug-Controller
+ Richtlinien und menschliche Eskalation
Architekturpass erstellen
- 1Fähigkeit: Ein- und Ausgaben, Aufgabe der Nutzer und erforderliche Nachweise
- 2Repräsentation: Token, Vektoren, Pixel, Codec-Codes oder kontinuierliche latente Variablen
- 3Grundarchitektur: Encoder, Decoder, Seq2Seq, Attention, SSM oder Hybrid
- 4Kapazität: Dicht oder expertenbasiert geroutet; gesamte gegenüber aktiven Parametern
- 5Generierung: Autoregressiv, Diffusion/Fluss, adversariell oder deterministisch
- 6System: Retrieval, Werkzeuge, Validatoren, Berechtigungen, Überwachung und Menschen
Alle 22 Familien durchsuchen
Jede Familie hat eine eigene Seite zu Training, Inferenz, Stärken, Zielkonflikten und Auswahlkriterien.
Produktfunktionen
Was das Produkt akzeptiert und ausgibt. Dies sind Bereitstellungsformen, keine wechselseitig ausschließenden neuronalen Architekturen.
Text- und Chat-Sprachmodelle
Texte werden Token für Token generiert, üblicherweise mit einem kausalen Decoder, der für die Vorhersage des nächsten Tokens trainiert wurde und anschließend an Anweisungen angepasst wird.
Embedding-Modelle
Text, Bilder, Audio, Benutzer oder Artikel werden in Vektoren abgebildet, deren Geometrie so trainiert wird, dass eine nützliche Vorstellung von Ähnlichkeit erhalten bleibt.
Bildgenerierung & -bearbeitung
Synthetisieren oder transformieren von Pixeln, meist durch einen Text- oder Bildkonditionierer, einen latenten Generator und einen Bilddekodierer.
Videogenerierung
Räumliche und zeitliche Strukturen werden gemeinsam aus Frame-, Patch- oder latenten Videorepräsentationen mit bildübergreifender Berechnung erzeugt.
Audio-, Sprach- & Musikmodelle
Eine Familie von aufgabenspezifischen Pipelines: Spracherkennung, Sprachsynthese, Audioverständnis, Stimmkonvertierung, Klangerzeugung und Musikerzeugung stellen keine einheitliche Architektur dar.
Kernnetzwerke
Wie Informationen durch das trainierbare Netzwerk fließen. Ein bereitgestelltes Modell kann mehrere dieser Optionen kombinieren.
Encoder-only Transformer
Jedes Eingabetoken berücksichtigt Token auf beiden Seiten, wodurch kontextuelle Repräsentationen entstehen und eine offene Generierungsschleife vermieden wird.
Decoder-only Transformer
Verwenden Sie eine Kausalmaske, sodass jede Position nur frühere Tokens berücksichtigt – passend zum linksseitigen Generierungsprozess, der von den meisten allgemeinen Chatmodellen verwendet wird.
Encoder–Decoder-Transformer
Eine Eingabesequenz bidirektional codieren, anschließend eine Ausgabesequenz kausal generieren und dabei die codierte Quelle durch Cross-Attention berücksichtigen.
Mixture of Experts (MoE)
Ersetzen Sie ausgewählte dichte Subschichten durch zahlreiche Expertennetzwerke und einen gelernten Router, der nur einen kleinen Teil für jedes Token aktiviert.
Zustandsraum- und rekurrente Modelle
Aktualisieren Sie einen kompakten Zustand, während Token eintreffen, anstatt eine explizite Aufmerksamkeitsbeziehung zwischen jedem Positionspaar aufrechtzuerhalten.
Repräsentation & Generierung
Wie Bilder, Audio, Video und andere hochdimensionale Ausgaben repräsentiert, gelernt und abgetastet werden.
Autoencoder, VAEs & gelernte Tokenizer
Lernen Sie einen Encoder, der Daten komprimiert, und einen Decoder, der sie rekonstruiert; Variations- und Quantisierungsverfahren formen den latenten Raum für Sampling oder nachgelagerte Generierung.
Generative Adversarial Networks (GANs)
Trainieren Sie einen Generator, um einen Diskriminator zu täuschen, während der Diskriminator lernt, generierte Samples von Trainingsdaten zu unterscheiden.
Normalisierende Strömungen
Eine einfache Verteilung wird durch eine Folge invertierbarer Abbildungen mit berechenbaren Jacobi-Determinanten in eine komplexe Datenverteilung transformiert.
Diffusionsmodelle und score-basierte Generierung
Lernen Sie, einen allmählichen Rauschprozess umzukehren, indem Daten durch wiederholte Transformation von Rauschen in eine Stichprobe erzeugt werden.
Latente Diffusion
Führen Sie die Diffusion in dem unterdimensionalen latenten Raum eines Autoencoders aus und decodieren Sie dann die generierte Repräsentation zurück zu Pixeln oder einem anderen Signal.
Diffusionstransformatoren (DiT)
Ein Transformer verarbeitet verrauschte Bild- oder Video-Patches als Entrauschungsnetzwerk in einem diffusions- oder flussbasierten generativen Prozess.
Autoregressive visuelle & Audio-Modelle
Bilder, Videos oder Audiodaten werden in diskrete Codes umgewandelt und deren Reihenfolge vorhergesagt, oft mit einem kausalen Transformer.
Modalitäten-Schnittstellen
Wie Vision, Text, Audio und andere Modalitäten kodiert, ausgerichtet, verschmolzen oder mit einem Generator verbunden werden.
Visuelle Encoder
Wandeln Pixel in Feature Maps, Patch-Token oder gepoolte Vektoren um, die von nachgelagerten Klassifikatoren, Suchsystemen, Decodern oder multimodalen Modellen verarbeitet werden können.
Kontrastive und Dual Encoder
Zwei Eingaben werden unabhängig voneinander kodiert (z. B. eine Anfrage und ein Dokument oder ein Bild und eine Bildunterschrift) und passende Paare werden so trainiert, dass sie sich in der Nähe zueinander befinden.
Multimodale Fusionsmodelle
Verbinden modalitätsspezifische Encoder und Generatoren durch Projektion, Cross-Attention, gemeinsame Tokenräume oder Kombinationen davon.
KI-Systemarchitekturen
Laufzeitstrukturen um ein Modell herum, die Wissen, Werkzeuge, Kontrolle und verifizierbares Verhalten hinzufügen.
Retrieval-augmentierte & hybride Systeme
Bei Anfragen werden Belege zur Laufzeit abgerufen und einem Generator, Klassifikator oder Agenten bereitgestellt, anstatt sich ausschließlich auf die Modellparameter zu verlassen.
Systeme zur Werkzeugnutzung und Schlussfolgerung
Platzieren Sie ein Modell innerhalb eines Controllers, der planen, typisierte Tools aufrufen, Ergebnisse prüfen, überarbeiten, verifizieren, stoppen und die Kontrolle an eine Person weitergeben kann.