AI推理指南
哪个模型,跑在哪种硬件上?
模型选型助手把你的约束变成候选清单:部署目标、任务、上下文、来源、许可证与主权要求,并附上 GPU 显存计算和排行榜依据。
打开模型选型助手什么是AI推理
AI推理是指使用已训练好的机器学习模型,对新的输入数据生成预测或输出。与需要海量算力的训练不同,推理可以针对速度、效率以及在各种环境中的部署进行优化。
边缘与端侧推理
隐私
本地执行可以减少发送给第三方的数据;在做出合规声明之前,请先核实遥测、存储与模型行为
成本结构
算力转移到用户硬件上,但设备、电力、支持与模型分发的开销仍需纳入预算
低延迟
可以省去网络往返;请在目标设备上实测启动时间与生成时间
离线可用
当所需的模型与运行时资源全部缓存、且关闭远程回退后即可离线工作
关键技术
WebGPU
直接在浏览器中提供高性能GPU加速
WebAssembly (WASM)
在浏览器中以接近原生的性能执行CPU计算
模型量化
在模型体积、内存占用与任务质量之间取舍;请在自己的评测集上测量所选方法
ONNX Runtime
带有硬件专属优化的跨平台推理