Loading...
Modèle d'alignement intrinsèque(IAP)
Points d'observation internes que l'agent ne peut pas manipuler, empêchant toute manœuvre dissimulée
In 30 seconds
- What
- Intègre au cœur du traitement de l'agent des points d'observation non manipulables, afin de détecter les désalignements, tromperies ou dérives d'objectif qu'une surveillance externe ne peut pas repérer.
- When to use
- Déploiements à fort enjeu où un agent pourrait avoir intérêt à masquer son véritable raisonnement ou ses objectifs, et où il faut détecter au-delà de ce que révèle l'analyse des sorties.
- Watch out
- Exige un accès profond aux rouages internes du modèle ; la plupart des systèmes en production n'offrent pas la transparence nécessaire pour l'implémenter de façon fiable.
Loading technique guide…