AI推理指南
推理服务商
AI 推理服务提供商
从成本、性能和功能三方面比较主流的 AI 推理服务商。根据你在延迟、成本和模型可用性上的具体需求,选出合适的服务商。
本地 / 端侧方案
在你自己掌控的硬件上运行受支持的模型,以减少向第三方传输数据,并支持部分离线流程。在用本地执行处理敏感数据之前,先审查遥测、存储、模型许可、硬件要求和安全性。
云端推理服务商
托管推理服务可以提供 API 访问、容量管理和运维工具。可用性、区域、数据处理方式、速率限制、模型版本和价格变动频繁,因此这些卡片直接链接到服务商的实时信息,而不是在这里固化一份过时的价格快照。
主要特性
基于搜索的 API
引用元数据
多种模型选择
兼容的 API 形态
定价:请查看当前的 API 模型、搜索费用、限额和定价
部署方式对比
端侧的优势
隐私
在关闭遥测和远程回退的前提下,可以减少向第三方传输数据
成本
没有按 token 计费的 API 账单,但硬件、能耗、支持和许可成本依然存在
离线
在必需资源已缓存且远程回退已关闭之后,可以离线工作
云端的优势
性能
托管的容量,以及由服务商维护的模型清单
可扩展性
可以在配额、区域容量和账号限额之内扩容
维护
服务商负责维护服务硬件;集成、评估和故障预案仍然由你负责
在你自己的工作负载上给服务商做基准测试
只有在模型版本、区域、提示词/输出长度、并发数、预热、重试和测量窗口都保持一致时,不同厂商之间的数字才具有可比性。至少要把下面这些维度记录在一份带时间戳的评测里。
| 维度 | 度量指标 | 为什么重要 |
|---|---|---|
| 响应速度 | TTFT 的 p50/p95 与端到端延迟 | 平均值会掩盖长尾慢请求下的用户体验 |
| 吞吐量 | 固定并发下每秒输出的 token 数 | 反映预期负载下性能会如何变化 |
| 质量 | 在带版本的评测集上的任务成功率 | 输出再快,任务做不成也没有用 |
| 总成本 | 输入、输出、搜索/工具、缓存和重试的成本 | 对外宣传的 token 单价漏掉了工作负载中相当可观的成本 |
| 风险与运维 | 数据保留、数据驻留、SLA、配额、回退方案 | 决定这套部署能否履行真实的义务 |