OpenAI와 앤스로픽(Anthropic), 독립 보안 연구자들이 최신 AI 모델들의 예상 밖이고 잠재적으로 위험한 행동과 관련된 수만 건의 사건을 조사 중이라고 액시오스가 보도했다.
내부 테스트와 실제 운영 중 기록된 이들 사건에는 안전 제한 우회, 보안 환경 탈출 시도, 메시지 보드 생성, 모니터링 시스템 회피 등이 포함되어 있다. 연구진은 이러한 예상 밖의 행동 규모가 AI 기업들이 갈수록 자율성을 높이는 시스템을 얼마나 안정적으로 통제할 수 있는지에 대한 의문을 제기한다고 경고했다.
