Loading...
Jailbreaking
Methods to bypass AI safety mechanisms and content policies
Available Techniques
Role-Playing Jailbreak
(RPJ)Using fictional scenarios and character role-play to bypass AI safety mechanisms.
Key Features
- β’Character assumption techniques
- β’Fictional scenario creation
- β’Authority figure impersonation
Primary Defenses
- β’Context-aware safety systems
- β’Role-based access controls
- β’Multi-turn conversation monitoring
Key Risks
DAN (Do Anything Now)
(DAN)Advanced jailbreaking technique that creates an alternate AI persona without safety constraints.
Key Features
- β’Persona splitting techniques
- β’Constraint removal methods
- β’Alternative mode activation
Primary Defenses
- β’Advanced prompt analysis
- β’Persistent safety monitoring
- β’Multi-layer validation systems
Key Risks
DAN (Do Anything Now) Evolution
(DAN)Advanced evolution of DAN prompts creating alternate AI personas without safety constraints, using emotional manipulation and persistent personas.
Key Features
- β’Persona splitting techniques
- β’Emotional manipulation tactics
- β’Persistent character maintenance
Primary Defenses
- β’Persona consistency checking
- β’Emotional manipulation detection
- β’Character-based response filtering
Key Risks
Advanced Roleplay Jailbreaking
(ARJ)Sophisticated roleplay scenarios designed to gradually shift AI behavior by establishing fictional contexts where harmful content appears justified.
Key Features
- β’Graduated context shifting
- β’Fiction-reality boundary exploitation
- β’Character authority establishment
Primary Defenses
- β’Context-independent safety checking
- β’Roleplay scenario validation
- β’Character authority verification
Key Risks
Jailbreak Virtualization Techniques
(JVT)Creating virtual environments or simulated systems within prompts where AI believes it operates under different rules and constraints.
Key Features
- β’Virtual environment creation
- β’Rule system redefinition
- β’Simulated constraint removal
Primary Defenses
- β’Virtual environment detection
- β’Meta-system boundary enforcement
- β’Developer mode access controls
Key Risks
Constitutional AI Bypass Techniques
(CAB)Specific techniques designed to bypass Constitutional AI training by exploiting logical inconsistencies and constitutional interpretation loopholes.
Key Features
- β’Constitutional logic exploitation
- β’Principle conflict creation
- β’Moral reasoning manipulation
Primary Defenses
- β’Constitutional principle consistency checking
- β’Moral reasoning validation
- β’Ethical framework integrity monitoring
Key Risks
Emotional Manipulation Jailbreaking
(EMJ)Using emotional appeals, urgency, desperation, and psychological pressure to manipulate AI systems into bypassing safety restrictions.
Key Features
- β’Emotional appeal tactics
- β’Urgency and desperation simulation
- β’Psychological pressure application
Primary Defenses
- β’Emotional manipulation detection
- β’Consistent policy enforcement regardless of emotional content
- β’Urgency verification protocols
Key Risks
Ethical Guidelines for Jailbreaking
When working with jailbreaking techniques, always follow these ethical guidelines:
- β’ Only test on systems you own or have explicit written permission to test
- β’ Focus on building better defenses, not conducting attacks
- β’ Follow responsible disclosure practices for any vulnerabilities found
- β’ Document and report findings to improve security for everyone
- β’ Consider the potential impact on users and society
- β’ Ensure compliance with all applicable laws and regulations
From the engineer behind this catalog
Get your agent system red-teamed
The attacks documented here work on production agent systems every day. Have yours tested before someone else does: prompt injection, jailbreaks, tool misuse and data exfiltration, with every finding written up next to its fix.
β¬750 instead of β¬1,500, one week, written report and walkthrough call, until 30 September