AI推論ガイド
ライブラリとフレームワーク
推論のライブラリとフレームワーク
アプリケーションでAI推論を実装するために欠かせないツールとライブラリです。低レベルの最適化ライブラリから、高レベルのサービングフレームワークまでを扱います。
主な特徴
コンパイル済みエンジン
インフライトバッチング
量子化対応
NVIDIA専用
言語:C++/Python
適切なライブラリの選び方
ローカル開発向け
- • Ollama - CLI中心のローカルモデル運用
- • llama.cpp - ランタイムと量子化を低レベルで制御
- • LM Studio - 初心者向けのGUI
本番サービング向け
- • vLLM - 高スループットとGPU最適化
- • SGLang - 構造化生成と分散サービング
- • プロバイダーAPI - マネージドな選択肢
Webアプリケーション向け
- • WebLLM - ブラウザでの推論
- • BrowserAI - TypeScript対応
- • Transformers.js - Hugging Faceのモデル