AI推論ガイド
エッジとモバイルの推論
エッジとモバイルへのデプロイ
対応するモデルをモバイル、IoT、エッジのプラットフォームにデプロイします。互換性と性能は、実際のモデル、ランタイム、アクセラレータ、メモリ予算、OS、熱の制約によって決まります。
主な特徴
公開されている1.4B-2.7Bのバリアント
モバイルを想定した評価
Snapdragonでのデモ
CLIPベースの視覚処理
プラットフォーム:Android/Jetson/デスクトップの研究デモ
主な特徴
アーリーアクセス
デプロイ用のツール
ヘテロジニアスな計算基盤に注力
対応ランタイムは要確認
プラットフォーム:最新の対応一覧を確認
主な特徴
モデルの量子化
ハードウェアによる高速化
クロスプラットフォーム
最適化されたカーネル
プラットフォーム:モバイル/組み込み
性能面で考えること
メモリ使用量
量子化はメモリ使用量を減らせるが、削減幅と品質の低下はモデル、精度、ランタイム、評価セットによって変わる
バッテリーの持ち
ローカル推論はネットワークの利用を減らす一方で、デバイスの計算量と消費電力を増やすことがあるため、セッション全体をプロファイルする
ハードウェアによる高速化
最も速いバックエンドはモデルとデバイスによって変わるため、利用できるNPU、GPU、CPUの経路をベンチマークする