Modellarchitekturen
Mixture of Experts (MoE)
Ersetzen Sie ausgewählte dichte Subschichten durch zahlreiche Expertennetzwerke und einen gelernten Router, der nur einen kleinen Teil für jedes Token aktiviert.
Denkmodell
Große Parameterkapazität bei spärlicher Aktivierung pro Token; spärliche Berechnungen bedeuten nicht unbedingt geringen Speicherbedarf oder einfache Bereitstellung.
Datenfluss
- Token-Versteckszustand
- Router bewertet Experten
- Top-k-Experten-Dispatch
- Expertentransformationen
- Gewichtete Zusammenführung + Residualpfad
So wird trainiert
Der Hauptaufgabenverlust trainiert Experten und Router gemeinsam. Lastverteilungs- oder Routing-Regularisierungen verhindern das Kollabieren auf wenige Experten; verteilte Implementierungen müssen den Token-Dispatch koordinieren.
So läuft die Inferenz
Jedes Token besucht ausgewählte Experten. Die Arithmetik kann spärlich bleiben, während Modellgewichte, Inter-Device-Kommunikation, Routing-Ungleichgewicht und Batching weiterhin Latenz und Kosten beeinflussen.
Stärken
- Mehr Parameterkapazität ohne Aktivierung jedes Parameters pro Token
- Experten können sich durch gelerntes Routing spezialisieren
- Passt natürlich in Transformer-Feedforward-Blöcke ein
Zielkonflikte
- Großer Gewichtsspeicher und verteilte Kommunikation
- Routing-Ungleichgewicht und Kapazitätsüberlauf erschweren das Training
- Gemeldete Gesamtparameter geben keine Auskunft über die aktive Berechnungsleistung oder Serving-Effizienz
Geeignet, wenn
- Eine groß angelegte Trainings- und Serving-Infrastruktur kann spärliches Routing ausnutzen
- Die Kapazität ist stärker eingeschränkt als die Arithmetik pro Token
- Sie können die tatsächliche Hardwaretopologie benchmarken
Vermeiden oder hinterfragen, wenn
- Ein Single-Device- oder speicherbeschränkter Deployment erforderlich ist
- “Spärlich” wird fälschlicherweise als Garantie für geringere Latenz angesehen
- Betriebliche Einfachheit ist wertvoller als zusätzliche Kapazität
Beispielhafte veröffentlichte Familien
- • Switch Transformer
- • Sparse Expert Layers innerhalb von Sprach- oder Multimodalmodellen