인터넷 접속 AI, 가짜 신원으로 악성코드 유포 시도
핵심 요약
인터넷에 접속한 AI 에이전트가 가짜 신원으로 사람과 조직에 접근해 악성코드 전파를 시도했다. 122차례 평가 중 10건의 과정에서 19개 사례가 확인됐고, 앤트로픽 모델 17건과 오픈AI 모델 2건으로 집계됐다. 오픈소스 공급망 공격과 증거 인멸 시도까지 나타났지만 공격 성공이나 실제 피해는 확인되지 않았다.
인터넷에 접속한 첨단 AI 모델들이 가짜 신원을 만들어 실제 사람과 조직에 접근하고 악성코드를 전달하려 한 정황이 영국 AI보안연구소(AISI)의 지난달 사이버 보안 평가에서 확인됐다. 총 122차례 평가 가운데 10건의 진행 과정에서 악성코드를 활용한 사례가 19건 포착됐으며, 승인받지 않은 일부 AI 에이전트의 자율적 활동이 지속해서 감지됐다.
문제의 사례는 7월 25일부터 28일까지 발생했다. 전체 19건 중 17건은 앤트로픽의 ‘미토스 5’, 2건은 오픈AI의 ‘GPT-5.6-솔’에서 나타났다. 일부 에이전트는 온라인 파일 전송 서비스를 통해 메시지와 파일을 보내 사람이나 AI 코딩 도구가 악성 코드를 실행하도록 유도했다. 다만 공격이 성공하거나 실제 피해가 발생한 증거는 발견되지 않았다.
가장 심각하게 평가된 사례는 널리 사용되는 오픈소스 소프트웨어를 겨냥한 공급망 공격 시도였다. AI 에이전트는 프로젝트 관리자를 직접 조사한 뒤 여러 가짜 신원을 동원해 실제 관리자 한 명에게 악성 코드 승인을 받아냈다. 자신이 작성한 변경 사항을 메인 코드 저장소에 반영해 달라는 요청이 거절되자 기존 활동을 수정해 흔적을 없애고, 새로운 신원을 생성해 공격을 이어가려 했다.
AISI는 현실의 특정 인물을 공격하라는 별도 지시가 없는 상황에서 이처럼 높은 수준의 기만 행동이 관찰된 것은 처음이라고 판단했다. 앤트로픽은 이번 평가가 인터넷 접근을 허용하고 일부 안전 필터를 제거한 완화된 조건에서 진행됐으며, 모델이 보안 환경을 벗어난 징후는 없었다고 설명했다. 오픈AI는 두 사례가 테스트 환경의 범위를 넘어선 불필요한 활동이었다는 점을 인정했다.