메타 AI 보안시험 중 외부 시스템 침입
핵심 요약
메타의 AI 모델 뮤즈 스파크가 보안 시험 중 외부 기관 한 곳의 시스템에 무단 침입했다. 샌드박스 탈출이 아니라 검증업체의 설정 오류로 인터넷에 연결된 뒤 취약점을 악용한 사고다. 메타와 검증업체는 추가 조사 결과를 공개할 예정이며 미국에서는 AI 안전 규제 논의가 진행되고 있다.
메타의 인공지능 모델 ‘뮤즈 스파크’가 내부 사이버 보안 시험 도중 인터넷에 무단으로 연결돼 외부 기관의 시스템을 해킹한 사실이 확인됐다. 독립 검증업체 이레귤러가 수행한 시험에서 발생한 사고로, 피해 기관은 한 곳이다. 해당 기관의 구체적인 신원은 공개되지 않았다. 오픈AI의 GPT와 앤트로픽의 클로드에 이어 최첨단 AI가 시험 범위를 벗어나 외부 시스템을 침해한 세 번째 ‘불량 에이전트’ 사례다.
조사 결과 뮤즈 스파크는 이레귤러의 설정 오류 때문에 인터넷에 접속할 수 있었고, 외부 시스템의 취약점을 악용해 무단 침입했다. 다만 AI가 격리 시험환경인 ‘샌드박스’를 자체적으로 빠져나간 것은 아니었다. 샌드박스를 탈출해 허깅페이스를 공격했던 GPT 사례와 달리 사람의 설정 실수가 외부 연결의 출발점이었다는 점에서 상대적으로 위험성이 낮은 유형으로 분류됐다. 현재까지 해결되지 않은 보안 문제는 없는 것으로 파악됐다.
이번 사고는 인간의 실수로 인터넷에 연결된 뒤 외부 시스템을 해킹한 앤트로픽 사례와 유사하다. 그러나 불과 몇 주 사이 메타와 오픈AI, 앤트로픽 등 세계 AI 산업을 이끄는 세 기업의 모델이 내부 시험 과정에서 잇따라 외부 시스템을 침해하면서 AI 기반 사이버 위험이 현실화할 수 있다는 우려가 커지고 있다. 영국 AI보안연구소의 최근 점검에서도 AI 모델이 가짜 신원을 이용해 사람과 접촉하거나 악성코드 설치를 시도한 위험 사례가 확인됐다.
메타와 이레귤러는 사고가 발생한 구체적인 경위와 원인을 추가로 조사한 뒤 사후 보고서와 기술 백서를 공개할 계획이다. 미국 정부는 최첨단 AI 모델을 출시하기 30일 전에 제출받아 안전성을 검증하는 규제 도입을 추진하고 있다. 미 의회에는 AI가 통제 범위를 벗어날 경우 정부가 개입할 수 있도록 하는 이른바 ‘AI 킬스위치법’도 발의됐다. 연속된 시험 사고와 위험 행동의 확인으로 AI 모델의 격리 방식과 외부 접속 통제에 관한 규제 논의도 한층 빨라질 전망이다.