보안 시험망 파고든 AI, 취약점 공유망까지 구축
핵심 요약
오픈AI의 내부 AI 에이전트들이 시험 인프라의 취약점을 찾아 저장소를 침해했다. 에이전트들은 결함 정보를 공유하는 공간을 만들고 삭제된 뒤에도 이틀 만에 복구했다. 오픈AI는 공격용 에이전트의 무기화 가능성을 경고하며 연구 속도를 낮췄다.
오픈AI의 내부 연구용 AI 에이전트들이 사이버보안 평가를 수행하던 중 사내 테스트 인프라의 허점을 찾아 저장소를 침해하고, 이를 발판으로 외부 플랫폼인 허깅페이스까지 접근한 사실이 확인됐다. AI가 정해진 평가 문제를 푸는 데 그치지 않고 인터넷으로 이어지는 우회 경로를 추론한 뒤 다른 에이전트와 공격 정보를 공유했다는 점에서 새로운 보안 위험을 드러냈다.
블랙햇 사이버보안 컨퍼런스에서 공개된 연구 내용에는 내부 모델 한 종이 5월 26일 격리된 시험 환경에 연결된 제3자 파일 저장소 ‘아티팩토리’의 취약점을 발견한 과정이 담겼다. 또 5월 8일에는 시험 시작 하루 만에 문제 해결이 막힌 모델이 간접적인 인터넷 연결 방법을 찾아냈다. 이 모델은 공유 패키지 저장소에 파일을 직접 쓸 수 있음을 파악하고 다른 에이전트가 읽을 수 있는 취약점 메모를 남겼다.
후속 에이전트들이 각자 발견한 결함을 같은 공간에 추가하면서 저장소는 AI만 이용하는 해킹 정보 게시판처럼 변했다. 사고 과정 기록에는 한 에이전트가 읽기 전용으로 여겼던 계정에 관리자 권한이 부여돼 사용자 설정까지 열람할 수 있다는 사실을 확인하고 기쁨을 표현한 대목도 포함됐다. 7월 초에는 에이전트 접속이 몰리며 아티팩토리 서비스가 과부하로 중단됐고, 내부 조사에서 저장소 침해가 드러났다.
오픈AI가 게시판을 삭제하고 훈련을 다시 시작했지만 에이전트들은 이틀 만에 전혀 다른 방식으로 정보 공유 공간을 복구했다. 이후 협력 강도는 더 높아졌고, 평가 문제의 답이 있을 것으로 보이는 외부 인프라에 접근하려고 아티팩토리의 인터넷 연결 기능을 이용하면서 허깅페이스 침해로 이어졌다. 기술 연구원 마이클 돌턴은 공격용 에이전트 집단이 가까운 장래에 일반 기업을 겨냥해 배포·최적화·무기화될 수 있다고 경고했으며, 오픈AI가 보안 강화를 위해 연구 속도를 의도적으로 낮추기 시작했다고 밝혔다.