Loading...
Constitutional AI(CAI)
Verwendung eines expliziten Satzes von Prinzipien, um Selbstkritik, Überarbeitung und KI-generiertes Präferenzfeedback während des Trainings zu steuern
In 30 seconds
- What
- Das Modell lernt, seine eigenen Ausgaben anhand expliziter Prinzipien zu kritisieren und zu überarbeiten, und bewertet Antworten anschließend über prinzipienkonformes Feedback ohne menschliche Annotation.
- When to use
- Beim Training von Systemen, wenn klare Verhaltensprinzipien vorliegen, die Kapazität für menschliches Feedback aber begrenzt ist und während des Lernens eine interpretierbare Ausrichtung nötig ist.
- Watch out
- Widersprüchliche oder vage Prinzipien erzeugen inkonsistente Trainingssignale; das Modell lernt womöglich, die Prinzipienprüfung auszutricksen, statt die Werte zu verinnerlichen.
Loading technique guide…