Architectures de modèles
Guide des architectures de modèles
Architectures de modèles génératifs
Comprenez les composants des produits de texte, plongements, image, vidéo, audio et multimodaux, puis choisissez consciemment le réseau central, la représentation, le générateur et l’enveloppe système.
22 familles d’architectures · 5 groupes · une page par famille
La distinction essentielle
Une capacité n’est pas une architecture
« Chat », « image » et « multimodal » décrivent une interface. Décodeur seul, espace d’états, DiT et MoE décrivent le calcul interne. RAG et l’usage d’outils décrivent le système d’exécution autour du modèle. Un système en production peut légitimement porter ces trois types d’étiquette.
= capacité de chat
+ architecture à décodeur seul
+ recherche et reclassement
+ contrôleur d’outils typé
+ règles et transfert à un humain
Rédiger un passeport d’architecture
- 1Capacité: Entrées, sorties, tâche utilisateur et preuves requises
- 2Représentation: Jetons, vecteurs, pixels, codes de codec ou variables latentes continues
- 3Réseau central: Encodeur, décodeur, seq2seq, attention, SSM ou hybride
- 4Capacité du modèle: Dense ou routée vers des experts ; paramètres totaux et actifs
- 5Génération: Autorégressive, diffusion/flux, antagoniste ou déterministe
- 6Système: Recherche, outils, validateurs, permissions, supervision et humains
Parcourir les 22 familles
Chaque famille possède une page sur l’entraînement, l’inférence, les atouts, les compromis et les critères de sélection.
Capacités du produit
Ce que le produit accepte et renvoie. Ce sont des formes de déploiement, et non des architectures neuronales mutuellement exclusives.
Modèles de langage pour texte et chat
Générer du texte un jeton à la fois, généralement avec un décodeur causal entraîné pour prédire le prochain jeton et ensuite adapté pour suivre les instructions.
Modèles d’embeddings
Cartographier du texte, des images, de l'audio, des utilisateurs ou des éléments en vecteurs dont la géométrie est entraînée pour préserver une notion utile de similarité.
Génération et édition d'images
Synthétiser ou transformer des pixels, le plus souvent grâce à un conditionnement textuel ou image, un générateur latent et un décodeur d'image.
Génération vidéo
Générer conjointement la structure spatiale et temporelle à partir de représentations vidéo fondées sur des trames, des patchs ou des variables latentes, avec des calculs entre trames.
Modèles audio, vocaux et musicaux
Une famille de pipelines spécifiques aux tâches : la reconnaissance automatique de la parole (ASR), la synthèse vocale (TTS), la compréhension audio, la conversion vocale, la génération sonore et la génération musicale ne constituent pas une seule architecture.
Architectures fondamentales
Comment l'information circule au sein du réseau entraînable. Un modèle déployé peut combiner plusieurs de ces choix.
Transformers à encodeur uniquement
Permettre à chaque jeton d'entrée de prendre en compte les jetons des deux côtés, produisant ainsi des représentations contextuelles plutôt qu'une boucle de génération ouverte.
Transformers à décodeur uniquement
Utilisez un masque causal pour que chaque position ne voit que les jetons précédents, ce qui correspond au processus de génération gauche à droite utilisé par la plupart des modèles de discussion grand public.
Transformers encodeur–décodeur
Encoder une entrée de manière bidirectionnelle, puis générer une sortie de manière causale tout en effectuant un mécanisme d'attention croisée sur la source encodée.
Mélange d’experts (MoE)
Remplacez les sous-couches denses sélectionnées par de nombreux réseaux experts et un routeur appris qui n'active qu'un petit sous-ensemble pour chaque jeton.
Modèles d'espace d'état et récurrents
Mettre à jour un état compact au fur et à mesure que les jetons arrivent, sans conserver une relation d'attention explicite entre chaque paire de positions.
Représentation et génération
Comment les images, l’audio, la vidéo et les autres sorties multidimensionnelles sont représentées, apprises et échantillonnées.
Autoencodeurs, VAE et tokeniseurs appris
Apprendre un encodeur qui compresse les données et un décodeur qui les reconstruit ; les variantes variationnelles et quantifiées façonnent l'espace latent pour l'échantillonnage ou la génération en aval.
Réseaux antagonistes génératifs (GAN)
Entraînez un générateur pour tromper un discriminateur tandis que ce dernier apprend à distinguer les échantillons générés des données d'entraînement.
Flots normalisants
Transforme une distribution simple en une distribution de données complexe par le biais d'une séquence de transformations inversibles avec des Jacobiennes calculables.
Génération par diffusion et basée sur les scores
Apprendre à inverser un processus de bruitage progressif, produisant des données en transformant de manière répétée le bruit vers un échantillon.
Diffusion latente
Effectuer une diffusion dans l'espace latent de dimension inférieure d'un autoencodeur, puis décoder la représentation générée pour obtenir des pixels ou un autre signal.
Transformers de diffusion (DiT)
Utilisez un Transformer appliqué à des patchs d'image ou de vidéo bruités comme réseau de débruitage au sein d'un processus génératif par diffusion ou par flux.
Modèles visuels et audio autorégressifs
Convertir des images, des vidéos ou de l'audio en codes discrets et prédire ces codes selon un ordre, souvent avec un Transformer causal.
Interfaces multimodales
Comment les données visuelles, le texte, l’audio et d’autres modalités sont encodés, alignés, fusionnés ou reliés à un générateur.
Encodeurs de vision
Convertir des pixels en cartes de caractéristiques, jetons de patchs ou vecteurs pondérés que les classificateurs, moteurs de recherche, décodeurs ou modèles multimodaux peuvent utiliser.
Encodeurs contrastifs et duaux
Encoder deux entrées indépendamment (par exemple, une requête et un document ou une image et une légende) et entraîner des paires à se rapprocher.
Modèles de fusion multimodale
Connecter les encodeurs et générateurs spécifiques à chaque modalité via des projections, une attention croisée, des espaces de jetons partagés ou des combinaisons de ces mécanismes.
Architectures de systèmes d'IA
Structures d'exécution autour d'un modèle qui ajoutent des connaissances, des outils, le contrôle et un comportement vérifiable.
Systèmes augmentés par la recherche et hybrides
Récupérer les preuves au moment de la requête et les fournir à un générateur, un classificateur ou un agent plutôt que de se fier uniquement aux paramètres du modèle.
Systèmes utilisant des outils et du raisonnement
Placez un modèle au sein d’un contrôleur capable de planifier, d’appeler des outils typés, d’inspecter les résultats, de réviser, de vérifier, d’arrêter et de passer le contrôle à une personne.