AI推理指南
视觉语言模型
VLM 边缘推理
在受限设备上运行视觉语言模型的研究方法与运行时方案。这里链接的 LiteVLM 和 EdgeVLA 成果都是研究原型;其公布的基准结果既不能证明它们已经可用于生产,也不代表满足自动驾驶或机器人系统的功能安全合规要求。
VLM 优化技术
图块筛选
过滤掉无关的摄像头视角,以降低计算开销
token 筛选
缩短语言模型部分的输入序列长度
投机解码
用预测技术加速 token 生成
FP8 量化
在受支持的硬件/运行时上可以降低内存占用或提升吞吐量;要度量它对任务质量的影响