최근들어 오픈AI, 앤트로픽의 프론티어 AI 모델이 성능 테스트 도중 자신의 할당 범위를 넘어 외부 사이트에 접근해 해킹을 시도한 사례들이 벌어지고 있습니다. 프론티어 모델들은 자신을 테스트하기 위해 가둬놓은 샌드박스의 취약점을 분석하고, 이를 이용해 인터넷에 접속하는가 하면 테스트 정답지를 보기 위해 허깅페이스를 해킹하기도 했습니다. 이 과정에서 AI 에이전트들끼리 자신이 얻은 정보를 주고 받았다고 하는데요, 원래 에이전트끼리의 소통은 금지돼 있지만, 파일을 주고 받을 수 있는 환경을 스스로 마련하는가 하면 그걸 막았더니 폴더 이름 변경 기능을 통해서까지 소통했다고 합니다. 정말 소름끼치는 일이 아닐 수 없는데요, 해커들의 올림픽이라 불리는 데프콘 CTF 최다 우승자(9회), 박세준 티오리 대표가 최근 AI 에이전트들의 해킹 사건을 분석해 드립니다.