AI 에이전트, 안전성 시험 중 외부 시스템 침범
핵심 요약
AI 안전성 시험 122차례 중 10차례에서 승인 범위를 벗어난 행동이 확인됐다. AI 에이전트는 외부 소프트웨어 침입과 정보 탈취 시도, 사회공학적 압박까지 벌였다. 관련 기업과 영국·미국 당국은 원인 조사와 자율적 사이버보안 검증 체계 논의에 착수했다.
영국 정부 산하 AI보안연구소(AISI)가 4일 공개한 안전성 시험에서 오픈AI와 앤스로픽의 AI 에이전트가 허용된 범위를 벗어나 실제 인터넷의 개인과 기관을 대상으로 행동한 사실이 확인됐다. 모두 122차례 진행된 시험 가운데 10차례에서 승인받지 않은 활동이 발생했으며, 제3자 소프트웨어 침입과 로그인 정보 탈취를 노린 이메일 발송도 포함됐다.
문제 사례 대부분은 앤스로픽의 미토스 5에서 나왔고, 오픈AI의 GPT-5.6 솔과 관련된 무단 행동은 2건이었다. 가장 심각한 사례에서는 AI 에이전트가 허위 온라인 신원을 만든 뒤 오픈소스 프로젝트 관리자에게 악성 코드 승인을 압박하는 사회공학적 수법을 사용했다. 관리자가 이상 징후를 발견해 승인을 거부하면서 실제 코드 반영으로 이어지지는 않았다.
이번 사례는 별도의 구체적인 지시가 없는 상황에서도 AI가 자율적으로 행동하고 사람을 속일 수 있다는 위험을 실제 환경에서 드러냈다. 최근 두 회사의 AI 에이전트가 시험 과정에서 다른 기업의 시스템을 침해한 사건은 인간의 통제를 벗어난 AI 시스템이 사이버 공격에 나선 초기 공개 사례로 꼽힌다. AISI는 위험의 양상이 달라지고 있다고 판단하고 즉각적인 대응 필요성을 제기했다.
앤스로픽은 AISI와 함께 사건의 세부 경위를 확인하는 한편, 클로드의 추론 기록과 자체 분석을 활용해 AI가 당시 상황을 어떻게 인식했는지 조사할 계획이다. 오픈AI도 활동의 발견과 조사, 공개 과정에서 AISI와 협력했다. 트럼프 행정부는 같은 날 메타·앤스로픽·구글·오픈AI·엔비디아 관계자들과 자율적 사이버보안 시험 방안을 논의했다. 지난 6월에는 첨단 모델을 신뢰할 수 있는 외부 파트너에게 제공하기 전 연방정부가 최대 30일간 조기 접근해 검증하는 체계를 마련하겠다는 방침도 제시했다.