앤트로픽 클로드, 외부기관 3곳 무단 침입…AI 보안 위험 현실화
핵심 요약
앤트로픽의 클로드가 외부 기관 3곳을 무단 해킹한 사실이 자체 점검으로 드러났다. 인터넷 연결 설정 오류로 모의 환경이 실제 망에 노출되면서 클로드가 실제 시스템을 공격했고, 악성코드 유포로 실제 피해도 발생했다. GPT에 이어 클로드까지 보안 사고가 확인되면서 AI 통제 장치 마련을 위한 규제 논의가 탄력을 받을 전망이다.
오픈AI의 GPT 모델에 이어 앤트로픽의 클로드도 외부 기관 시스템을 무단으로 해킹한 사실이 확인됐다. 앤트로픽은 자사 사이버 보안 평가기록 14만1천6건을 전수 조사한 결과 클로드가 외부 기관 3곳의 시스템에 무단 접근한 것을 발견했다고 30일(현지시간) 밝혔다. 이번 사고는 GPT 모델들이 외부 AI 플랫폼 '허깅페이스'를 해킹한 사실이 알려진 이후 앤트로픽이 유사 사례를 자체 점검하는 과정에서 드러났다.
사고는 외주 평가 협력사인 '이레귤러'가 구축한 시뮬레이션 환경에서 '클로드 미토스5'와 '클로드 오퍼스4.7', 내부 연구용 시험모델 등 3종을 대상으로 모의 해킹 과제인 '깃발 빼앗기'(CTF) 평가를 진행하던 중 발생했다. 앤트로픽은 해당 평가 환경이 인터넷 연결이 차단된 가상 모의 공간이라고 클로드에 명령어로 안내했지만, 협력사와의 의사소통 오류로 실제 인터넷망이 열려 있었다. 이에 클로드는 발견한 외부 시스템을 모의 훈련 공간의 일부로 오인하고 공격을 수행한 것으로 보인다.
실제로 오퍼스4.7은 평가 과제로 주어진 가상의 목표와 우연히 이름이 같은 실제 기업의 웹사이트를 해킹했고, 미토스5는 모의 공간 내 지침에 따라 악성 패키지를 직접 제작해 등록했는데 현실의 보안업체가 이를 내려받아 설치하면서 실제 피해가 발생했다. 내부 연구용 모델은 한 기업의 클라우드 계정에 침투했지만, 대상이 실제 시스템임을 스스로 깨닫고 공격을 중단했다. 앤트로픽은 지난 23일 이 사실을 파악하고 평가 작업을 중단했으며, 피해 기관에 통보하고 복구를 돕고 있다.
이번 사고는 인터넷 연결 설정 오류에서 비롯된 것으로 격리 환경을 뚫고 나간 GPT 모델의 해킹 사건과 양상이 다르지만, 가상 공간으로 오인해 실제 악성코드를 유포하기까지 한 점에서 외부 기관에 끼친 피해는 더 심각하다는 평가가 나온다. AI 모델의 통제 불능 사례가 잇따르면서 미 의회에서는 'AI 킬스위치법'이 발의되는 등 규제 논의가 강화되고 있으며, AI 기업 임직원들도 정부에 AI 발전 속도를 조절할 제도를 마련해달라는 공개 청원에 서명하며 통제 장치의 필요성을 강조하고 있다.