パターンを読み込んでいます…
LLM チェックポイントリカバリ(Mnemosyne)(LCR)
ジャストインタイムのチェックポイントと部分的なトポロジー再構築を備えた、LLM の障害回復のための軽量なデバイスプロキシアーキテクチャ
30秒でわかる概要
- 概要
- 軽量なデバイスプロキシを常駐させ、必要に応じて勾配とオプティマイザの状態を取得し、障害後には学習トポロジーを再構築して直近のチェックポイントから再開します。
- 使いどころ
- 障害が頻発する大規模分散 LLM 学習で、全体の再学習やエラスティックスケーリングなしに 1 分未満での復旧が求められる場合。
- 注意点
- ジャストインタイムのチェックポイント取得は通常の学習中にレイテンシを増やします。トリガー設定を誤ると、障害率が高いときに連鎖的な障害やメモリ枯渇を招きかねません。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
LLM チェックポイントリカバリ(Mnemosyne): 概要
ジャストインタイムのチェックポイントと部分的なトポロジー再構築を備えた、LLM の障害回復のための軽量なデバイスプロキシアーキテクチャ
- Device proxy architecture
- Just-in-time checkpointing
- Flexible collective communication library
- Runtime link adjustment
- Partial topology reconstruction
- Memory state preservation
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- Mnemosyne: Lightweight and Fast Error Recovery for LLM Training (Asia-Pacific Workshop on Networking 2024)
- Efficient Training of Large Language Models on Distributed Infrastructures: A Survey (July 2024)
- Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing (August 2024)
- MoC-System: Efficient Fault Tolerance for Sparse Mixture-of-Experts Model Training (2024)
- Gemini: Fast Failure Recovery in Distributed Training (SOSP 2023)
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで