Выберите поддерживаемый стек, который работает именно с вашим чекпоинтом, целью обучения, ускорителем, форматом артефактов и путём развёртывания. Списки возможностей меняются быстрее, чем сами концепции.
Transformers + PEFT + TRL
Композируемые Python API, когда нужен контроль над загрузкой, адаптерами, тренерами и целями выравнивания.
Проверить: Зафиксируйте взаимно совместимые версии и проверьте именно вашу архитектуру модели, квантизатор и распределённый запуск.
Набор инструментов, ориентированный на оптимизированные локальные и облачные процессы посттренировки для поддерживаемых комбинаций.
Проверить: Считайте заявленные вендором цифры скорости и памяти привязанными к конкретной нагрузке; воспроизведите качество и пропускную способность у себя.
PyTorch FSDP и DeepSpeed умеют шардировать состояние модели и работу оптимизатора. Это слои масштабирования, а не замена данным, оценке или управлению выпусками.
MLX и MLX LM позволяют экспериментировать локально на Apple silicon. Проверьте текущую поддержку моделей и тюнинга, прежде чем считать их равноценными рецепту для CUDA.
Фиксируйте код, окружение, ревизию датасета, параметры, чекпоинты, метрики и артефакты оценки. Дашборд не заменяет воспроизводимые входные данные.
Чек-лист перед запуском
Поддерживаемый пример покрывает именно вашу ревизию модели и чат-шаблон.
Фреймворк поддерживает выбранный ускоритель, точность и распределённую топологию.
Обучение и инференс согласованы по форматам адаптера, токенизатора, квантизации и чекпоинтов.
Маскирование датасета проверено, и лосс считается только по нужным токенам.
До платного запуска успешно пройдены тест на переобучение одного батча и тест возобновления с чекпоинта.
Версии зависимостей, дайджест контейнера и ревизия исходников зафиксированы.
Примеры Torchtune остаются полезным историческим источником, но официальный репозиторий сообщает, что активная поддержка была свёрнута в 2025 году. Не делайте его новой продакшен-зависимостью, не приняв этот риск сопровождения. Прочитать уведомление о поддержке.