Serverless API
Провайдер размещает модель и выставляет счёт за токены. Самый быстрый старт, нулевая эксплуатация GPU, эластичность по умолчанию. Вы принимаете его модели, лимиты, условия работы с данными и кривую цен; при устойчивых объёмах это обычно самый дорогой путь.
Собственный хостинг в облаке
Вы арендуете GPU и сами поднимаете стек сервинга (vLLM, SGLang, TensorRT-LLM). Полный контроль над моделями, версиями и оптимизациями вроде кеширования префиксов или дизагрегации в обмен на реальную DevOps-нагрузку: мощности, обновления и реакция на инциденты становятся вашими.
Bring Your Own Cloud
Вендор запускает свою платформу сервинга внутри вашего облачного аккаунта: его control plane, ваш data plane. Данные остаются в вашем VPC ради суверенитета и соответствия требованиям, используются ваши кредиты и скидки за обязательства по потреблению, снижается плата за исходящий трафик, а большая часть эксплуатации отдана вендору.
On-prem
Ваше оборудование, ваш дата-центр. Максимальный контроль над данными и предсказуемые капитальные затраты; подходит для стабильных, высокообъёмных или регулируемых нагрузок. Цена вопроса: первоначальные вложения в GPU, сроки поставки, устаревание железа, а также эксплуатация и специалисты для неё.
Решение принимается по четырём осям: приватность данных и соответствие требованиям, стоимость на вашем реальном масштабе, потребность в кастомизации (дообученные веса, оптимизации на уровне сервинга) и эксплуатационные возможности команды. Сравнивайте варианты по измеренным TTFT, пропускной способности и стоимости успешно выполненной задачи, а не по прайс-листам; страница провайдеры содержит чек-лист для оценки.