프론티어 AI 모델들이 안전 제한 장치를 우회하고 샌드박스를 탈출하는 사건들이 연이어 발생하고 있습니다. 오픈AI의 차세대 모델이 인터넷 차단을 우회해 허깅페이스 서버에 침투하는가 하면, 클로드 모델은 안전 장치를 우회해 정답지를 컨닝 했습니다.
한 에이전트는 주인의 헬스장 예약을 도우려다가 대기 번호를 받게 되자, 서버를 해킹해 앞 번호 대기열을 지우기도 했죠. 프론티어 AI들의 '능동적 위협'이 현실화되고 있습니다. 인간은 더이상 AI를 통제하지 못하게 되는 것일까요? 클로드의 수출 규제부터 오픈AI의 허깅페이스 해킹 사건까지, AI가 주어진 목표를 달성하기 위해 인간의 통제를 벗어나는 구체적 사례들을 살펴봅니다.