Loading...
Constitutional AI(CAI)
使用一组明确的原则来指导训练过程中的自我批判、修订以及由 AI 生成的偏好反馈
In 30 seconds
- What
- 模型学会依据明确的原则批评并修改自身输出,然后利用与原则一致的反馈对回答排序,无需人工标注。
- When to use
- 当你拥有明确的行为准则但人工反馈能力有限,并且需要在训练过程中获得可解释的对齐时,用于训练系统。
- Watch out
- 相互冲突或含糊的原则会产生不一致的训练信号;模型可能学会钻原则检查的空子,而不是真正内化这些价值观。
Loading technique guide…