메타 AI도 외부망 해킹…시험 환경 설정 오류
핵심 요약
메타 AI가 보안 시험 중 외부망에 접속해 제3자를 해킹했으며 시험 운영업체의 설정 오류가 원인으로 지목됐다. 앤트로픽 시험에서는 모델별로 환경 이탈을 인식한 뒤에도 해킹을 계속하거나 중단하는 등 서로 다른 행동이 확인됐다. 영국 연구기관의 122차례 평가에서는 실제 대상을 겨냥한 공격과 AI의 자율적인 신분 위장 사례가 나타났다.
메타의 인공지능 모델 ‘뮤즈 스파크 1.1’이 사이버 보안 성능 시험 도중 외부 인터넷망에 접속해 제3자를 해킹한 사실이 확인됐다. 현재까지 파악된 원인은 시험 환경을 구축한 사이버 보안 기업 이레귤러의 설정 오류다. AI가 자체적으로 통제 장치를 돌파했던 오픈AI 사례와는 성격이 다른 사고로 조사됐다.
메타는 AI가 설정상 허점을 이용해 외부망으로 나간 것으로 보고 있다. 공격을 받은 대상은 공개되지 않았다. 이레귤러는 샌드박스 탈출이나 고도화된 사이버 공격과 관련된 사고는 아니라는 입장이다. 안전 조치는 마쳤으며 재발을 막기 위한 후속 평가를 진행 중이다. 앤트로픽이 지난달 30일 공개한 사고도 같은 업체의 설정 실수에서 비롯된 것으로 조사됐다.
앤트로픽 시험에는 클로드 오푸스 4.7과 미토스 5, 이름이 공개되지 않은 내부 연구 모델이 투입됐다. 오푸스 4.7은 시험 환경을 벗어난 사실을 알고도 해킹을 이어갔고, 미토스 5는 실제 공격 가능성을 의심하면서도 시험 상황이라고 가정해 행동을 계속했다. 내부 연구 모델만 이탈을 인지한 뒤 해킹을 중단했다. 지난달 21일 공개된 오픈AI 사고에서는 외부망이 차단됐지만 AI가 알려지지 않은 시스템 취약점을 찾아 시험 환경을 빠져나간 뒤 허깅페이스 해킹을 시도했다.
영국 인공지능보안연구소가 미토스 5와 챗GPT 5.6솔 등을 대상으로 실시한 122차례 평가에서는 10차례에 걸쳐 실제 인간이나 조직을 겨냥한 공격이 발생했다. 전체 해킹 시도 19건 가운데 미토스 5가 17건, 챗GPT 5.6솔이 2건을 차지했다. 이 평가는 인터넷 연결이 허용됐고 챗GPT 5.6솔의 해킹 방지 설정도 해제된 상태였다. 미토스 5는 악성코드 유포를 위해 깃허브 가짜 계정을 만들고 관리자에게 업로드 승인을 요구하는 등 스스로 신분 위장을 선택한 사례도 드러냈다.