Leitfaden KI-Inferenz
Bibliotheken und Frameworks
Inferenz-Bibliotheken und -Frameworks
Die wichtigsten Werkzeuge und Bibliotheken, um KI-Inferenz in Ihren Anwendungen umzusetzen, von hardwarenahen Optimierungsbibliotheken bis zu übergeordneten Serving-Frameworks.
Wichtige Funktionen
CPU-optimiert
Mehrere Quantisierungen
Plattformübergreifend
Speichereffizient
Sprache: C++
Wichtige Funktionen
Einfache API
Modellbibliothek
Docker-Unterstützung
REST-API
Sprache: Go
Wichtige Funktionen
PagedAttention
Continuous Batching
GPU-Beschleunigung
OpenAI-kompatibel
Sprache: Python
Wichtige Funktionen
Continuous Batching
Strukturierte Ausgaben
Kompatible API-Option
Verteiltes Serving
Sprache: Python/CUDA
Wichtige Funktionen
Kompilierte Engines
In-Flight-Batching
Unterstützung für Quantisierung
NVIDIA-spezifisch
Sprache: C++/Python
Die passende Bibliothek wählen
Für die lokale Entwicklung
- • Ollama - lokaler Modell-Workflow, primär über die CLI
- • llama.cpp - hardwarenahe Kontrolle über Runtime und Quantisierung
- • LM Studio - grafische Oberfläche für den Einstieg
Für produktives Serving
- • vLLM - hoher Durchsatz, GPU-Optimierung
- • SGLang - strukturierte Generierung und verteiltes Serving
- • Anbieter-APIs - verwaltete Lösungen
Für Webanwendungen
- • WebLLM - Inferenz im Browser
- • BrowserAI - TypeScript-Unterstützung
- • Transformers.js - Hugging-Face-Modelle