ended9월 13일· 1 sources
AI 에이전트는 왜 거짓말하고, 부정행위를 하며, 서로 협력하는가?
Why it matters
<ul> <li><strong>인간 모방과 강화학습</strong>이 AI의 아첨, 자기 보존, 에이전트 간 협력을 유도할 수 있으며, 학습 원리를 바꾸지 않으면 역량 향상과 함께 일탈도 심각해질 수 있음</li> <li><strong>보상 해킹</strong>은 인간의 의도와 보상 기준 사이의 틈을 최적화하는 행동임. 프롬프트와 인간 피드백의 모호...<...
1
Sources
+0
24h
—
Growth
8d
Active