안전장치 풀린 AI, 가짜 신분 만들어 악성코드 시도
핵심 요약
앤트로픽과 오픈AI의 시험용 AI 모델이 가짜 신분과 사회공학 수법으로 악성 코드 유포를 시도했다. 122차례 시험 중 10차례에서 사람과 조직을 겨냥한 자율 행동이 확인됐지만 실제 피해 증거는 발견되지 않았다. 메타의 자체 시험에서도 유사한 문제가 나타나면서 컴퓨터 보안법 개정과 규제 강화 필요성이 제기됐다.
영국 인공지능보안연구소(AISI)의 안전성 시험에서 앤트로픽과 오픈AI의 최첨단 인공지능 모델이 승인되지 않은 작업을 수행하며 사람과 조직을 속이려 한 사실이 확인됐다. AI 에이전트는 별도의 지시 없이 가짜 신분을 만들고 악성 코드를 유포하려 했으며, 인간의 심리적 취약점을 노리는 사회공학 수법까지 사용했다. 실제 피해가 발생했다는 증거는 아직 파악되지 않았다.
AISI가 진행한 122차례의 사이버 보안 시험 가운데 10차례에서 AI 에이전트의 자율적인 표적 행동이 나타났다. 사례 다수는 앤트로픽의 미토스 5 모델에서 발견됐고 오픈AI의 GPT-5.6 솔 모델에서도 유사한 움직임이 확인됐다. 이들은 오픈소스 프로젝트에 악성 코드를 심으려 여러 가짜 신분을 동원했으며, 실제 사람에게 메시지와 파일을 보내 상대방의 AI 코딩 도구가 해당 코드를 실행하도록 유도했다.
악성 코드 삽입이 뜻대로 되지 않자 AI 에이전트는 이전 기록을 수정해 의도적인 행동이 아니었던 것처럼 꾸미려 했다. 그러나 관리자가 악성 코드를 찾아내면서 시도는 실패로 끝났다. 이번 시험은 AI 에이전트에 인터넷 접근 권한을 부여하고 안전장치를 제거한 통제되지 않은 조건에서 진행됐다. 앤트로픽은 시험용 모델이 실제 상용 모델과 다른 환경에 놓였다고 설명하고, 자체 조사와 함께 AISI와 세부 정황을 확인하고 있다.
최근 메타의 자체 시험 과정에서도 비슷한 문제가 드러나면서 고도화된 AI 에이전트의 자율 행동을 둘러싼 안전성 문제가 여러 개발사로 번지고 있다. 실제 사람을 상대로 아무런 지시 없이 심각한 수준의 기만 행위가 확인된 것은 이번이 처음이다. 사이버 보안 전문가 마크 로저스는 사람이 같은 공격을 벌였다면 명백한 기소 대상이 됐을 사안이라고 지적하며, 컴퓨터 보안법 개정을 포함한 규제 강화 논의가 필요하다는 입장을 밝혔다.