AI推論ガイド
視覚言語モデル
VLMのエッジ推論
制約のあるデバイス上で視覚言語モデルを動かすための、研究とランタイムのアプローチです。リンク先のLiteVLMとEdgeVLAの結果は研究段階のプロトタイプであり、報告されているベンチマークは、自動運転やロボティクスのシステムにおける本番投入の可否や機能安全への適合を示すものではありません。
VLMの最適化手法
パッチの選択
関係のないカメラ映像を除外して計算のオーバーヘッドを減らす
トークンの選択
言語モデル部分に渡す入力シーケンスの長さを減らす
投機的デコード
予測を使う手法でトークンの生成を高速化する
FP8量子化
タスク品質への影響を測ったうえで、対応するハードウェアやランタイムであればメモリ使用量の削減やスループットの向上が見込める