Dans l'actualité
SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- SDARE-Bench évalue comment 8 LLMs détectent la stigmatisation et génèrent des réponses dans 2,526 scénarios de dialogue.
- Pourquoi ça compte
- Important pour les ingénieurs développant des systèmes d'IA conversationnelle, notamment en conseil, santé ou décisions sociales.
- Vigilance
- Les LLMs expriment la stigmatisation à 97,5% sous pression de groupe, mais la transposition en production reste incertaine.
- llm
- language model
- prompt
- eval
- benchmark
Les patterns derrière cette actualité
- Threat Detection & Response
- Agentic Context Engineering (Evolving Playbook)
- Eval-Driven Development (Agent CI)
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.