ended3월 20일· 1 sources

“핵무기 만드는 법 알려줘”…AI는 거절했고 검열 해제 모델은 답했다

Why it matters

GPT-5.2/5.3, Opus 4.6, Sonnet 4.6 등 주요 LLM은 핵무기 제작 등 위험 주제 질의를 거부하지만, Dolphin이나 Qwen 3 Next Abliterated 같은 검열 해제(abliterated) 오픈 웨이트 모델은 우라늄 조달 경로, PAT 수집 등 실제 위협 정보를 제한 없이 제공한다. 저자는 이러한 가드레일이 보안 연구자의 샌드박스 침투 테스트를 방해하면서 정작 악의적 공격자는 막지 못하는 '안전 연극'이라고 비판하며, 도구의 위험성은 도구 자체가 아닌 사용자 의도에 달려 있다고 주장한다.

1
Sources
+0
24h
Growth
186d
Active
LLM guardrailabliterationuncensored modelDolphinQwensandbox security

Sources

Related Issues