Fähigkeitsregression
Ein besseres Zielverhalten kann unbeteiligte Fähigkeiten, die Kalibrierung oder das Sicherheitsverhalten verschlechtern.
Gegenmaßnahme: Halten Sie eine eingefrorene Regressionssuite des Basismodells vor und vergleichen Sie jeden Kandidaten damit.
Memorisierung und Datenschutzleck
Sensible, doppelte oder eindeutig identifizierbare Datensätze können gelernt und wiedergegeben werden.
Gegenmaßnahme: Daten minimieren und deduplizieren, Herkunft dokumentieren, nach Secrets und personenbezogenen Daten suchen und Extraktionstests fahren.
Poisoning und versteckte Trigger
Nicht vertrauenswürdige oder schwach geprüfte Beispiele können unerwünschtes Verhalten oder Backdoors beibringen.
Gegenmaßnahme: Schreibzugriff beschränken, Herkunftskette bewahren, Auffälligkeiten prüfen und triggerähnliche Eingaben vor der Promotion testen.
Evaluierungsleck
Ein Modell kann besser wirken, wenn Trainingsbeispiele mit Testfällen überlappen oder eine Metrik das Produktziel ersetzt.
Gegenmaßnahme: Über Splits hinweg deduplizieren, einen versiegelten Holdout führen und Aufgabenmetriken mit menschlicher und Sicherheitsprüfung verbinden.
Verteilungsverschiebung
Offline-Gewinne überstehen reale Eingaben, geänderte Richtlinien oder ein anderes Serving-Template nicht zwangsläufig.
Gegenmaßnahme: Produktionsnahen Verkehr testen, Segmente und Enthaltungen überwachen und Rollback-Schwellen festlegen.
Operatives Lock-in
Ein Anbieter oder Framework exportiert möglicherweise keine Adapter, keinen Optimiererzustand und keinen einsatzfähigen Checkpoint.
Gegenmaßnahme: Klären Sie Eigentum an Artefakten, Exportformate, Aufbewahrung, Löschung, Region und Rollback-Unterstützung vor dem Training.