Руководство по инференсу
Какая модель и на каком железе?
Подбор модели превращает ваши ограничения в шорт-лист: цель развертывания, задача, контекст, происхождение, лицензия и суверенитет, с расчетом памяти GPU и ссылками на лидерборды.
Открыть подбор моделиЧто такое ИИ-инференс
Инференс это использование уже обученной модели машинного обучения для получения предсказаний или генерации ответов на новых входных данных. В отличие от обучения, которое требует огромных вычислительных ресурсов, инференс можно оптимизировать под скорость, эффективность и работу в самых разных средах.
Инференс на устройстве и на границе сети
Приватность
Локальное выполнение сокращает объём данных, уходящих третьим сторонам; проверьте телеметрию, хранение и поведение модели, прежде чем заявлять о соответствии требованиям
Структура затрат
Вычисления переносятся на оборудование пользователя, но устройства, электроэнергию, поддержку и доставку моделей всё равно нужно закладывать в бюджет
Низкая задержка
Позволяет обойтись без сетевых обращений; измеряйте время запуска и генерации на целевых устройствах
Работа офлайн
Возможна, когда все нужные модели и ресурсы среды выполнения закешированы, а обращения к удалённым сервисам отключены
Ключевые технологии
WebGPU
Высокопроизводительное GPU-ускорение прямо в браузере
WebAssembly (WASM)
Производительность, близкая к нативной, для вычислений на CPU в браузере
Квантизация модели
Обменивает размер модели и потребление памяти на качество решения задачи; измерьте выбранный метод на своём наборе для оценки
ONNX Runtime
Кроссплатформенный инференс с оптимизациями под конкретное железо