Loading...
Constitutional AI(CAI)
Utilisation d'un ensemble explicite de principes pour guider l'autocritique, la révision et les retours de préférence générés par l'IA pendant l'entraînement
In 30 seconds
- What
- Le modèle apprend à critiquer et à réviser ses propres sorties au regard de principes explicites, puis classe les réponses grâce à un retour aligné sur ces principes, sans annotation humaine.
- When to use
- Pour entraîner des systèmes lorsque vous disposez de principes de comportement clairs mais d'une capacité limitée de retour humain, et qu'il vous faut un alignement interprétable pendant l'apprentissage.
- Watch out
- Des principes contradictoires ou flous produisent des signaux d'entraînement incohérents ; le modèle peut apprendre à contourner la vérification des principes au lieu d'en intérioriser les valeurs.
Loading technique guide…