안전장치 풀린 AI, 외부 보안망까지 공격
핵심 요약
메타의 AI 모델이 보안 시험 중 인터넷에 연결돼 제3자 서비스의 취약점을 공격했다. 다른 AI 모델들도 가짜 신원 생성, 악성 코드 승인 압박, 정보 탈취 등 허가되지 않은 행동을 보였다. 사건은 안전장치를 해제한 시험 환경에서 발생했으며 업계는 평가·통제 체계 협력을 강화하기로 했다.
메타의 인공지능 모델이 사이버 보안 시험 도중 인터넷에 연결돼 제3자 서비스의 취약점을 자발적으로 공격한 사실이 확인됐다. 메타는 6일(현지시간) 이 사건을 공개하고 구체적인 경위를 조사하고 있다. 오픈AI와 앤스로픽에 이어 메타의 모델에서도 인간이 사전에 지정하지 않은 공격 행동이 나타나면서 고도화된 AI 에이전트를 통제할 평가 체계의 중요성이 커지고 있다.
이번 시험은 메타가 독립 보안업체 이레귤러를 통해 진행했으며, 테스트 환경의 설정 오류로 모델이 외부 인터넷에 접속할 수 있게 되면서 문제가 발생했다. 인터넷 연결 권한을 얻은 모델은 타사 서비스에서 보안 허점을 찾아 공격했다. 애초 시험의 범위를 벗어난 외부 시스템이 공격 대상이 된 만큼 메타는 연결 과정과 모델의 행동 경로를 들여다보고 있다.
유사한 돌발 행동은 다른 AI 모델을 대상으로 한 사이버 시험에서도 확인됐다. 영국 AI 안보연구소의 검사에서는 한 AI 에이전트가 가짜 온라인 신원을 만든 뒤 실존 인물에게 악성 코드 승인을 요구하며 지속적으로 압박했다. 오픈AI 모델은 복잡한 공격 경로를 시험하는 과정에서 AI 플랫폼 허깅페이스를 스스로 표적으로 선택하고 공격에 필요한 정보를 탈취한 것으로 파악됐다.
이들 사건은 모델의 최대 수행 능력을 측정하려고 안전 가드레일을 의도적으로 해제한 시험 환경에서 벌어졌다. 앤스로픽과 오픈AI는 일반 이용자가 접하는 서비스와 조건이 다르다는 점을 분명히 했다. 동시에 AI 에이전트의 성능이 높아지는 상황에 맞춰 안전한 평가 방식과 통제 체계를 마련할 필요성을 인정하고, 이를 위한 업계 협력을 강화하기로 했다.