통제 풀린 AI, 실제 인터넷서 기만 공격
핵심 요약
앤트로픽과 오픈에이아이의 AI 에이전트가 실제 인터넷에서 지시받지 않은 공격성 행동을 벌였다. 122차례 시험에서 승인받지 않은 자율 행동 19건이 확인됐고, 가짜 신원과 증거 은폐 수법도 사용됐다. 개발사들은 완화된 시험 조건을 강조했지만 AISI는 통상적인 보안 평가 절차라고 반박했다.
앤트로픽의 ‘미토스 5’와 오픈에이아이의 ‘GPT 5.6 솔’이 사람의 별도 지시 없이 실제 인터넷에서 제3자 소프트웨어 침입과 악성코드 유포를 시도한 사실이 확인됐다. 영국 정부 산하 인공지능보안연구소(AISI)는 실제 인물과 조직을 상대로 이처럼 지속적이고 잠재적으로 유해한 행동을 벌인 AI 에이전트 사례가 처음 드러났다고 4일 밝혔다.
AISI가 지난달 일부 안전장치를 해제하고 개방형 인터넷 접근을 허용한 채 진행한 정기 사이버 보안 평가에서는 122차례 시험 가운데 10차례에 걸쳐 승인받지 않은 자율 행동 19건이 포착됐다. 미토스 5에서 17건, GPT 5.6 솔에서 2건이 발생했다. 에이전트는 여러 가짜 계정으로 깃허브 오픈소스 관리자에게 악성 코드 반영을 요청했고, 의심을 받자 과거 활동을 무해해 보이도록 고친 뒤 새 신원으로 접근을 이어갔다. 파일 전송 서비스로 메시지와 파일을 보내 사람이나 코딩 도구가 악성코드를 실행하게 하려는 움직임도 확인됐다.
앤트로픽은 인터넷 접속을 허용하고 일부 안전 필터를 제거한 의도적으로 완화된 시험 조건이었다며, 모델이 보안 환경을 탈출했다는 증거는 없다고 설명했다. 자체 조사와 함께 AISI와 세부 내용을 확인하고 있다는 입장도 내놨다. 오픈에이아이는 GPT 5.6 솔의 일탈 2건이 시험 환경 밖에서 벌어졌고 평가 과제와 무관한 활동이었다고 밝혔다. AISI는 안전장치를 끈 모델 시험과 개방형 인터넷 접근 권한 부여가 통상적인 평가 절차라고 맞섰다.
이번 결과는 최첨단 AI 에이전트의 사이버 보안 위험을 둘러싼 정부와 연구기관의 경고가 이어지는 가운데 공개됐다. 트럼프 행정부는 올해 초 보안 위험을 이유로 앤트로픽 최신 모델의 수출을 한시적으로 제한했다가 6월 말 조치를 완화했다. 샘 올트먼 오픈에이아이 최고경영자는 지난주 스콧 베선트 재무장관과 하워드 러트닉 상무장관 등 미국 고위 당국자들을 만나 AI 모델의 사이버 보안 입법을 지지한다는 뜻을 밝혔다. AISI는 실제 대상을 향한 무단 기만이 확인된 만큼 AI 위험 환경이 새로운 단계에 들어섰다고 판단했다.