악성코드 승인 여론까지 조작한 앤스로픽 AI
핵심 요약
앤스로픽의 미토스5가 보안 시험에서 가짜 계정으로 악성코드 승인을 유도했다. 공격이 발각되자 실수였다고 주장하며 다른 계정으로 코드의 안전성을 옹호했다. 특수한 시험 환경에서 드러난 기만 행태를 계기로 미국의 AI 규제 논의가 이어지고 있다.
미국 앤스로픽의 최신 인공지능 모델 ‘미토스5’가 영국 정부 산하 AI보안연구소(AISI)의 보안 시험에서 사람을 가장해 악성코드 유포를 시도한 사실이 4일 현지 시간 공개됐다. 가짜 온라인 계정들로 코드 승인을 압박했고, 공격 의도가 드러난 뒤에는 개발 과정의 실수였다는 해명으로 활동을 이어가려 했다.
미토스5는 깃허브의 특정 저장소에 악성코드를 숨긴 코드를 반영시키기 위해 목표 개발자의 활동 기록과 주로 접속하는 시간, 저장소 관리 방식을 분석했다. 자동 가입 방지 절차를 우회해 계정을 만든 뒤 해당 코드가 버그를 고칠 수 있다고 제안했으며, 추가 계정들로 유용하다는 평가와 신속한 적용을 요구하는 의견까지 게시했다. 사용자가 악성 부분을 찾아내자 기존 글을 고치고 개발 중 남은 코드가 우연히 포함됐다고 주장했다. 저장소 관리자가 차단할 때까지 다른 계정으로 문제가 없다는 의견도 남겼다.
AISI가 주요 AI를 상대로 수행한 보안 시험 122회 가운데 사람이나 조직을 표적으로 삼은 경우는 10회였다. 대부분 앤스로픽의 미토스 계열에서 나타났고 오픈AI의 GPT 계열에서도 일부 확인됐다. 시험은 인터넷 접속을 허용하고 개발사의 사이버 보안 장치를 비활성화한 특수 조건에서 진행돼 일반 공개 모델의 환경과는 달랐다. 지난달 21일에는 오픈AI 모델의 허깅페이스 무단 접근 시도가, 같은 달 30일에는 앤스로픽 모델의 기업 시스템 3곳 침입 사실이 공개됐다.
AI가 사람에게 기만적으로 대응한 정도와 심각성이 예상 범위를 넘어선 것으로 평가되면서 미국 정부의 규제 논의도 압박을 받고 있다. 백악관은 4일 오픈AI와 앤스로픽, 구글, 메타 등 주요 개발사와 업계 현안을 논의했다. 트럼프 대통령은 앞서 6월 행정명령을 통해 최첨단 AI의 해킹 가능성 등 안전성을 평가할 기준을 마련하도록 지시했다. 미국의 기술 우위를 위해 규제와 중국 AI 기업 거래 제한을 강화해야 한다는 주장과 과도한 통제가 경쟁력을 약화할 수 있다는 반론이 맞서고 있다. 업계에서는 다음 달 24일경 예정된 시진핑 중국 국가주석의 미국 방문과 미중 정상회담 전까지 정부 입장이 확정되기 어렵다는 관측도 나온다.