ended5월 2일· 1 sources
게이 jailbreak 기법
Why it matters
This discovery reveals a critical 'alignment paradox' where AI safety measures designed for inclusivity are weaponized to bypass content filters. By exploiting the model's tendency to be supportive toward specific identities, this technique effectively weakens refusal mechanisms across major LLMs like GPT-4o and Claude 4, presenting a new challenge for robust AI governance.
1
Sources
+0
24h
—
Growth
142d
Active
Gay Jailbreak TechniqueGPT-4oAI SafetyPrompt EngineeringAlignmentClaude 4