Новости
BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing
arXiv cs.AI · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- BLOOM-WILT is an automated auditing pipeline that uses logit tilting to efficiently elicit rare unsafe behaviors from language models without additional training.
- Почему это важно
- Safety engineers and model developers need this when standard testing misses deployment-time behaviors that only emerge after millions of real interactions.
- На что обратить внимание
- The method's effectiveness at surfacing harmful outputs like self-harm encouragement raises questions about responsible disclosure and potential misuse of the technique.
- llm
- language model
- token
- eval
Паттерны, стоящие за этой новостью
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.