Architectures de modèles
Modèles d’embeddings
Cartographier du texte, des images, de l'audio, des utilisateurs ou des éléments en vecteurs dont la géométrie est entraînée pour préserver une notion utile de similarité.
Modèle mental
Un système de coordonnées appris. La proximité signifie « similaire selon l'objectif d'entraînement », et non équivalent universellement ou factuellement lié.
Flux de données
- Élément d'entrée
- Encodeur
- Agrégation (pooling) ou projection
- Vecteur de longueur fixe
- Recherche de similarité, clustering ou classificateur
Entraînement
Objectifs contrastifs, apprentissage métrique, classification ou appariements de données rapprochent les correspondances utiles et écartent les éléments négatifs. La stratégie d'échantillonnage négatif et les données du domaine définissent ce que signifie la similarité.
Exécution de l’inférence
Chaque élément est encodé en une seule passe. Les vecteurs stockés permettent une recherche approximative rapide des plus proches voisins ; un encodeur croisé peut reclasser le petit ensemble de candidats avec une interaction plus fine.
Atouts
- Récupération sémantique efficace sur de grandes collections
- Caractéristiques réutilisables pour le clustering, l'acheminement, les recommandations et la déduplication
- Les vecteurs candidats peuvent être calculés et indexés à l'avance
Compromis
- Un seul vecteur supprime les détails au niveau du jeton
- La similarité se dégrade en cas de dérive du domaine, de la langue ou du temps
- Les scores ne sont pas des probabilités étalonnées, mais spécifiques au modèle et à l'index
À utiliser lorsque
- Vous avez besoin d'une récupération sémantique de candidats
- Le corpus est trop volumineux pour un scoring par paires
- Vous pouvez évaluer le rappel sur des requêtes représentatives de la production
À éviter ou remettre en question lorsque
- La correspondance lexicale exacte est la seule exigence
- Vous avez besoin d'une réponse générée plutôt que d'une représentation
- Un seuil de similarité serait déployé sans étalonnage
Familles publiées à titre d’exemple
- • Encodeurs de phrases dérivés de BERT
- • Les tours séparés de texte et d'image utilisés par CLIP