Serverless API
由服务商托管模型并按 token 计费。启动最快,无需运维 GPU,默认具备弹性。代价是要接受对方的模型、限额、数据条款和价格曲线;在持续的大用量下,这通常是最贵的一条路。
在任何东西上线之前需要做的决策:模型如何托管、哪个模型和哪块 GPU 适配这个工作负载、显存这笔账算不算得平,以及用哪个服务框架来跑。
由服务商托管模型并按 token 计费。启动最快,无需运维 GPU,默认具备弹性。代价是要接受对方的模型、限额、数据条款和价格曲线;在持续的大用量下,这通常是最贵的一条路。
你租用 GPU 并自己运行一套服务栈(vLLM、SGLang、TensorRT-LLM)。对模型、版本以及前缀缓存、分离式部署等优化拥有完全控制权,换来的是实打实的 DevOps 负担:容量、升级和故障响应都归你。
厂商把自己的服务平台部署到你的云账号里运行:控制面归它,数据面归你。数据留在你的 VPC 内以满足主权和合规要求,可以用掉你的云代金券和承诺用量折扣,还能减少出网流量,同时把大部分运维工作外包出去。
你的硬件,你的机房。数据控制力最强,资本开支可预测;适合稳定、大用量或受监管的工作负载。代价是前期的 GPU 投入、采购周期、硬件老化,以及运转它所需的运维能力和人才。
沿四个维度来决策:数据隐私与合规、在你真实规模下的成本、定制化需求(微调后的权重、服务层优化),以及团队的运维能力。用实测的 TTFT、吞吐量和单次成功任务成本来比较各个选项,而不是用标价; 服务商 页面提供了一份评估清单。
在租用任何机器之前先估算一遍。显存由三类消耗者共享:
然后用你真实的提示词长度和输出长度做一次压测来验证,因为碎片化和调度器行为会把实际上限压到算术值以下。
框架负责批处理、KV 缓存管理、流式输出和多 GPU 执行,而且大多提供兼容 OpenAI 的 API,让应用保持可移植。
vLLM 和 SGLang 是主流的开源引擎(连续批处理、PagedAttention 式显存管理、结构化输出支持)。TensorRT-LLM 能在 NVIDIA 硬件上压榨出最高性能,但集成成本更高;LMDeploy 侧重量化后的高并发服务。
llama.cpp(以及构建在它之上的 Ollama)借助 GGUF 量化覆盖 CPU 和单机场景;MLC-LLM 把模型编译到手机和浏览器上运行。它们优先考虑体积和可移植性,而不是总吞吐量。