AI推論ガイド
どのモデルを、どのハードウェアで?
モデルアドバイザーは、デプロイ先・タスク・コンテキスト・提供元・ライセンス・主権要件からショートリストを作成し、GPUメモリ計算とリーダーボードの根拠を添えて提示します。
モデルアドバイザーを開くAI推論とは
AI推論とは、学習済みの機械学習モデルを使って、新しい入力データから予測や出力を生成する処理です。膨大な計算資源を必要とする学習とは異なり、推論は速度、効率、そしてさまざまな環境への展開に向けて最適化できます。
エッジとデバイス上での推論
プライバシー
ローカル実行は第三者に送るデータを減らせます。コンプライアンスを主張する前に、テレメトリ、保存、モデルの挙動を確認してください
コスト構造
計算はユーザーの端末に移りますが、端末、電力、サポート、モデル配布の費用は依然として見込む必要があります
低レイテンシ
ネットワーク往復を避けられます。対象端末で起動時間と生成時間を実測してください
オフライン対応
必要なモデルとランタイム資産をすべてキャッシュし、リモートへのフォールバックを無効にすれば、オフラインでも動作します
主要な技術
WebGPU
ブラウザ上で直接使える高性能なGPUアクセラレーション
WebAssembly (WASM)
ブラウザでのCPU計算をネイティブに近い性能で実行
モデル量子化
モデルサイズとメモリ使用量を、タスク品質と引き換えに調整します。選んだ手法は評価セットで必ず測定してください
ONNX Runtime
ハードウェア固有の最適化を備えたクロスプラットフォーム推論