Guide de l’inférence IA
Inférence edge et mobile
Déploiement edge et mobile
Déployez les modèles pris en charge sur des plateformes mobiles, IoT et edge. La compatibilité et les performances dépendent du modèle exact, du runtime, de l’accélérateur, du budget mémoire, du système d’exploitation et des limites thermiques.
Fonctionnalités clés
OpenInfer
Plateforme en accès anticipé pour déployer des modèles IA sur des cibles de calcul hétérogènes
Fonctionnalités clés
Points d’attention sur les performances
Usage mémoire
La quantification peut réduire l’usage mémoire, mais le gain et la perte de qualité dépendent du modèle, de la précision, du runtime et du jeu d’évaluation
Autonomie de la batterie
L’inférence locale réduit l’usage du réseau mais peut augmenter le calcul et la consommation d’énergie de l’appareil ; profilez la session complète
Accélération matérielle
Mesurez les NPU, GPU et chemins CPU disponibles ; le backend le plus rapide varie selon le modèle et l’appareil