Architectures de modèles
Matrice de sélection des modèles
Partez de la tâche utilisateur et du mode de défaillance. Il s’agit de bases à tester, pas de vainqueurs universels.
| Besoin produit | Base à tester en premier | Pourquoi elle convient | Points à surveiller |
|---|---|---|---|
| Assistant conversationnel ouvert ou copilote de codage | LM uniquement décodeur + récupération/outils si nécessaire | Génération flexible et adaptation de tâche en contexte | Ancrage, injection de prompt, autorité des outils, latence sérielle |
| Classification, extraction ou reclassement à grande échelle | Modèle uniquement encodeur ou encodeur–décodeur compact | Une prédiction limitée en un passage peut être moins coûteuse et plus facile à calibrer | Décalage de domaine, longueur d'entrée, calibration de l'étiquette |
| Traduction, transcription ou transformation conforme à la source | Modèle encodeur–décodeur | La mémoire source dédiée conditionne chaque jeton généré | Omissions, noms/chiffres, longueur source, latence de décodage |
| Recherche sémantique dans un vaste corpus | Encodeur dual + index vectoriel + reclasseur optionnel | Les candidats peuvent être intégrés une fois et recherchés efficacement | Rappel, négatifs, filtres, calibration du score |
| Réponses à partir de connaissances actuelles ou privées | RAG hybride + reclasseur + générateur ancré | La connaissance reste externe, inspectable et actualisable | Ingestion, contrôle d'accès, preuves manquantes, contexte empoisonné |
| Création ou modification d'images | Diffusion latente avec un débruiteur U-Net ou DiT | La génération itérative dans un espace compressé permet un conditionnement fort et des modifications précises | Perte de détails du codec, latence de l'échantillonnage, droits et provenance |
| Création vidéo | Diffusion spatio-temporelle latente ou générateur de média-jetons | À la fois les détails visuels et la dépendance temporelle sont modélisés | Dérive d'identité, mouvement, durée, puissance de calcul, synchronisation audio |
| Reconnaissance vocale | Encodeur–décodeur audio conçu pour l'ASR | Sépare la compréhension acoustique de la génération de texte | Langue, accent, chevauchement, bruit, délai en streaming |
| Longue séquence en streaming avec un budget d’état restreint | SSM/récurrent ou hybride attention–SSM | Transmet un état récurrent compact au lieu d'un cache d'attention complet | Rappel exact à longue portée, prise en charge du noyau, débit réel |
| Document multimodal ou assistant de graphique | Encodeur vision + décodeur linguistique + récupération de document | Préserve les preuves visuelles tout en ancrant les réponses dans les pages sources | Petit texte, références spatiales, coût des jetons multimédias, citations |
| Actions fiables dans les systèmes métier | LM utilisant des outils à l'intérieur d'une politique/contrôleur déterministe | Le langage gère l'intention tandis que le code fait respecter les autorisations et les effets secondaires | Idempotence, approbations, nouvelles tentatives, schémas, piste d'audit |
Ouvrez une famille dans la barre latérale pour consulter ses détails.