Dans l'actualité
Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Deep Noir découvre automatiquement où et comment diriger les activations des transformers, améliorant la détection de spam de 16 à 42 points de pourcentage selon la taille du modèle.
- Pourquoi ça compte
- Pertinent pour les ingénieurs construisant des classifieurs LLM qui accordent manuellement les paramètres de steering et ont besoin d'une découverte d'intervention systématique et généralisable.
- Vigilance
- Le steering crée une surface d'attaque par injection de prompt qui s'élargit avec l'ampleur du steering, posant des risques de sécurité pour les systèmes d'agents déployés utilisant des classifieurs dirigés.
- llm
- inference
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.