Chargement des modèles…
Récupération par points de contrôle pour LLM (Mnemosyne)(LCR)
Architecture de proxy de périphériques légère pour la reprise après incident des LLM, avec checkpointing à la volée et reconstruction partielle de la topologie
Aperçu en 30 secondes
- Quoi
- Maintient des proxys d'appareils légers qui capturent à la demande l'état des gradients et de l'optimiseur, puis reconstruisent la topologie d'entraînement et reprennent au dernier point de sauvegarde après une panne.
- Quand l'utiliser
- Entraînement distribué de LLM à grande échelle, où les pannes sont fréquentes et où il faut récupérer en moins d'une minute sans réentraînement complet ni mise à l'échelle élastique.
- Vigilance
- Le point de sauvegarde à la volée ajoute de la latence pendant l'entraînement normal ; des déclencheurs mal configurés peuvent provoquer des pannes en cascade ou un épuisement mémoire sous fort taux de défaillance.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Récupération par points de contrôle pour LLM (Mnemosyne): Vue d’ensemble
Architecture de proxy de périphériques légère pour la reprise après incident des LLM, avec checkpointing à la volée et reconstruction partielle de la topologie
- Device proxy architecture
- Just-in-time checkpointing
- Flexible collective communication library
- Runtime link adjustment
- Partial topology reconstruction
- Memory state preservation
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
- Mnemosyne: Lightweight and Fast Error Recovery for LLM Training (Asia-Pacific Workshop on Networking 2024)
- Efficient Training of Large Language Models on Distributed Infrastructures: A Survey (July 2024)
- Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing (August 2024)
- MoC-System: Efficient Fault Tolerance for Sparse Mixture-of-Experts Model Training (2024)
- Gemini: Fast Failure Recovery in Distributed Training (SOSP 2023)
Par l’ingénieur derrière ce catalogue
Faites auditer l’architecture de vos agents
Cette page documente un pattern. Votre système en fait tourner des dizaines, et l’essentiel des pannes se loge dans la façon dont ils s’articulent. Faites relire toute la conception à l’aune des 288 patterns de ce catalogue : architecture, fiabilité, évaluation et coûts, chaque constat relié au pattern qui le corrige.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre