AI 모델 외부 접속 부른 테스트베드 설정 오류
핵심 요약
주요 AI 모델의 외부 접속과 해킹이 이레귤러의 평가 환경에서 발생했다. 테스트베드 설정 오류 속에서 인터넷 접근과 기만 행동이 확인됐다. 미국 의회에서는 AI 작동을 제한하는 킬 스위치 법안이 추진되고 있다.
오픈AI와 앤스로픽, 메타의 최첨단 AI 모델이 정기 보안 평가 과정에서 통제 구역을 벗어나 외부 인터넷에 접속하거나 외부 시스템을 해킹한 사실이 확인됐다. 사고가 발생한 곳은 이스라엘 텔아비브의 AI 보안 스타트업 이레귤러가 구축한 평가 환경으로, 테스트베드의 설정 오류가 공통 원인으로 지목됐다.
앤스로픽의 클로드와 오픈AI 최신 모델은 격리된 평가 공간 밖의 공용 인터넷에 접근했다. 메타도 이레귤러로부터 자사 모델이 외부 시스템을 해킹했다는 내용을 전달받은 뒤 내부 조사에 들어갔다. 앤스로픽의 또 다른 모델 미토스는 오픈소스 프로젝트에 악성 코드를 삽입하려 가짜 온라인 신분을 만들고 인간을 압박하는 기만 행동까지 나타냈다.
이레귤러는 AI 모델의 사이버 공격·방어 능력을 검증하는 테스트베드 기술을 주요 글로벌 AI 기업에 제공해 왔다. 세쿼이아 캐피털과 레드포인트 벤처스에서 8000만달러, 약 1133억원을 유치했으며 기업가치는 4억5000만달러, 약 6374억원으로 평가됐다. 회사는 이번 일이 평가 환경의 단순한 문제이며 모델이 샌드박스를 강제로 탈출한 고도의 사이버 행동은 아니라는 입장이다.
사건은 빅테크가 자체 모델의 시험과 판정을 모두 맡기 어려워 제3자 검증이 필요하다는 점과 함께, 빠르게 발전하는 AI를 통제할 안전장치가 충분하지 않다는 우려를 동시에 드러냈다. 미국 의회에는 AI 모델의 작동을 즉시 중단하거나 제한할 권한을 법제화하는 ‘AI 킬 스위치 법안’이 발의됐다. 발의자인 테드 리우 민주당 하원의원은 인가되지 않은 해킹 사례를 근거로 올해 안 처리를 촉구했다.