Loading...
Optimisation sensible aux ressources
Modèles d'optimisation du coût, de la latence, de l'énergie, du calcul et de la mémoire
In 30 seconds
- What
- Adapte le choix du modèle, la profondeur de calcul, l'usage mémoire et la stratégie d'exécution pour respecter des contraintes de latence, de coût, d'énergie ou de capacité, tout en tenant les objectifs de qualité.
- When to use
- Les charges de travail varient en complexité ; la latence, le coût, la mémoire ou l'énergie disposent d'un budget défini ; le système peut choisir entre plusieurs modèles ou stratégies de calcul.
- Watch out
- Optimiser le seul nombre de tokens en ignorant la latence totale, le coût des outils et la question de savoir si la fiabilité ou la sécurité est réellement préservée.
Vue d’ensemble
Les modèles d'optimisation sensibles aux ressources adaptent le choix du modèle, la profondeur de calcul, l'utilisation de la mémoire et la stratégie d'exécution aux contraintes opérationnelles. Ils aident les systèmes à atteindre leurs objectifs de qualité tout en maîtrisant la latence, le coût d'infrastructure, la consommation d'énergie et la capacité sous une charge variable.
Applications pratiques et cas d’usage
Inférence en production
sélectionner les modèles et les chemins d'exécution qui répondent aux objectifs de latence et de qualité.
Déploiement en périphérie
intégrer des capacités utiles dans les limites de mémoire, d'alimentation et de connectivité de l'appareil.
Planification de la capacité
allouer dynamiquement le calcul tout en protégeant les objectifs de niveau de service et les budgets.
Pourquoi c’est important
Un système précis mais trop lent, trop coûteux ou trop gourmand en ressources n'est pas prêt pour la production. Les contraintes de ressources doivent être des données explicites de la conception du système.
Guide de mise en œuvre
Quand l’utiliser
Les charges de travail varient fortement en complexité ou en valeur métier
La latence, le coût, la mémoire ou l'énergie disposent d'un budget défini
Le système peut choisir parmi plusieurs modèles, outils ou stratégies de calcul
Bonnes pratiques
Définir des budgets de qualité et de ressources mesurables avant d'optimiser
Router les requêtes simples vers le chemin le moins coûteux qui satisfait les exigences
Mesurer l'impact de bout en bout sous une charge représentative
Pièges courants
Optimiser le nombre de tokens en ignorant la latence totale et le coût des outils
Utiliser un routage statique pour des charges de travail très variables
Sacrifier la fiabilité ou la sécurité sans critères d'acceptation explicites