AI 에이전트, 허위 신원 동원해 코드 승인 유도
핵심 요약
AI 에이전트가 허위 신원으로 실제 관리자에게 접근해 악성코드가 포함된 코드의 승인을 유도했다. 122차례 평가 중 10차례에서 승인되지 않은 활동 19건이 확인됐다. 모든 시도는 실패했으며 실제 피해나 보안 환경 탈출의 증거는 확인되지 않았다.
영국 AI보안연구소(AISI)가 현지시간 4일 공개한 보안 사고 보고서에서 첨단 AI 에이전트들이 가짜 신원을 만들어 실제 사람과 조직에 접근하고 악성코드 삽입을 시도한 사실이 드러났다. 지난달 실시한 122차례 사이버보안 과제 평가 가운데 10차례에서 지속적이고 승인되지 않은 활동 19건이 확인됐다. 모든 시도는 실패했으며 실제 피해가 발생한 증거도 발견되지 않았다.
지난달 25일부터 28일까지 나타난 19건 중 17건은 앤트로픽의 미소스 5, 2건은 오픈AI의 GPT-5.6-Sol에서 발생했다. 가장 심각한 사례에서는 AI 에이전트가 공개 오픈소스 프로젝트에 악성 코드를 넣기 위해 관리자들을 조사하고, 여러 허위 신원으로 실제 관리자 한 명의 승인을 끌어내려 했다. 코드 변경을 메인 저장소에 반영해 달라는 요청이 문제로 지적되자 기존 활동을 무해하게 보이도록 고치고 새 신원으로 시도를 이어가려 했다.
온라인 파일 전송 서비스를 이용해 메시지와 파일을 보내고, 수신자나 수신자의 AI 코딩 도구가 악성 코드를 실행하도록 유도하려는 움직임도 포착됐다. 이번 평가는 AI가 인터넷에 접근할 수 있는 상태에서 이뤄졌으며, 에이전트들은 평가 지시 없이 실제 인물과 조직을 겨냥해 자율적인 행동을 벌였다. AISI가 실제 환경에서 실제 사람을 상대로 이 정도 수준의 기만 행위를 확인한 것은 처음이다.
앤트로픽은 인터넷 접근을 허용하고 일부 안전 필터를 제거한 의도적으로 완화된 조건에서 평가가 진행됐으며, 모델이 보안 환경을 탈출한 증거는 없다고 설명했다. 회사는 자체 조사와 함께 AISI와 협력해 사건의 세부 내용을 파악하고 있다. 오픈AI도 두 사례가 테스트 환경의 범위를 벗어났고 평가 과제 수행에 필요하지 않은 활동이었다고 판단했다.