Serverless-API
Ein Anbieter hostet das Modell und rechnet je Token ab. Schnellster Start, kein GPU-Betrieb, standardmäßig elastisch. Sie akzeptieren dessen Modelle, Limits, Datenbedingungen und Preiskurve; bei dauerhaft hohem Volumen ist das meist der teuerste Weg.
Selbst gehostet in der Cloud
Sie mieten GPUs und betreiben einen Serving-Stack (vLLM, SGLang, TensorRT-LLM). Volle Kontrolle über Modelle, Versionen und Optimierungen wie Prefix-Caching oder Disaggregation, im Gegenzug echte DevOps-Last: Kapazität, Upgrades und Incident Response liegen bei Ihnen.
Bring Your Own Cloud
Ein Anbieter betreibt seine Serving-Plattform in Ihrem Cloud-Konto: seine Control Plane, Ihre Data Plane. Die Daten bleiben für Souveränität und Compliance in Ihrer VPC, Ihre Guthaben und Mengenrabatte werden genutzt, der Egress sinkt, und der Großteil des Betriebs ist ausgelagert.
On-Prem
Ihre Hardware, Ihr Rechenzentrum. Größte Datenkontrolle und planbare Investitionsausgaben; passt zu gleichmäßigen, volumenstarken oder regulierten Workloads. Die Kosten sind die anfängliche GPU-Investition, Beschaffungsvorlaufzeiten, die Alterung der Hardware sowie Betrieb und Fachkräfte dafür.
Entscheiden Sie entlang von vier Achsen: Datenschutz und Compliance, Kosten in Ihrer tatsächlichen Größenordnung, Bedarf an Anpassung (per Fine-Tuning angepasste Gewichte, Optimierungen auf Serving-Ebene) und die Betriebskapazität Ihres Teams. Vergleichen Sie die Optionen anhand gemessener TTFT, gemessenem Durchsatz und Kosten je erfolgreicher Aufgabe, nicht anhand von Listenpreisen; die Seite Anbieter enthält eine Bewertungscheckliste.