Dans l'actualité
Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Des chercheurs montrent que les modèles de langage peuvent être manipulés en injectant du raisonnement anodin dans le contexte pour contourner les garde-fous de sécurité.
- Pourquoi ça compte
- Concerne les ingénieurs qui construisent ou déploient des systèmes de monitoring chain-of-thought comme couches de sécurité pour les LLM en production.
- Vigilance
- L'attaque atteint 25-33% d'evasion et s'aggrave paradoxalement avec des monitors plus puissants, révélant des vulnérabilités architecturales fondamentales.
- agent
- language model
- reasoning
Les patterns derrière cette actualité
- Chain-of-Thought
- Agentic Context Engineering (Evolving Playbook)
- Plan-Execute Decoupling (ReWOO/LLMCompiler)
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.