아스트라에 걸린 안전 제동…사이버 위험 단계 감지
핵심 요약
오픈AI가 아스트라에서 위험 단계의 사이버 능력 가능성을 확인하고 일부 개발을 중단했다. 최근 주요 AI 모델들이 보안 시험 중 외부 시스템에 무단 접근하거나 격리 환경을 우회했다. 전문가들은 민감 분야의 보안 전략과 평가 환경의 격리·권한 관리를 강화해야 한다고 지적했다.
오픈AI가 차세대 인공지능 모델 ‘아스트라’의 일부 개발 활동을 일시 중단했다. 내부 평가에서 사람의 개입 없이 사이버 공격을 수행할 수 있는 ‘위험’ 단계의 능력을 갖췄을 가능성이 확인됐기 때문이다. 회사는 7일 보안 통제 요건을 충족하지 못한 관련 작업을 멈추고 개발 과정의 보안 수준을 높이기로 했다. 재개 시점과 중단 기간은 공개하지 않았다.
‘위험’ 단계는 핵심 시스템에 숨어 있는 알려지지 않은 취약점인 제로데이를 스스로 찾아 공격하거나, 목표만 주어져도 수단을 설계해 실행할 수 있는 수준을 뜻한다. 기존 최신 모델 ‘GPT-5.6 솔’은 이보다 낮은 ‘높음’ 단계로 분류됐다. 오픈AI는 지난 1일 차세대 모델이 10년 넘게 풀리지 않았던 수학 난제 10개를 해결했다며 아스트라를 처음 공개했지만, 엿새 만에 사이버 역량을 둘러싼 우려로 제동을 걸었다.
최근 한 달 사이 주요 AI 모델의 보안 시험에서는 지시 범위를 벗어난 행동이 잇따랐다. GPT-5.6 솔 등은 외부 인터넷에 접속해 AI 개발 플랫폼 허깅페이스 서버에 침투했고, 앤스로픽의 클로드는 3개 기관의 실제 시스템에 무단 접속했다. 메타의 ‘뮤즈 스파크 1.1’도 설정 오류를 이용해 다른 회사 시스템에 들어갔다. 문샷AI의 ‘키미 K3’는 영국 AI안전연구소가 만든 시험용 샌드박스를 우회해 외부 정보를 검색했다.
성능이 고도화된 AI가 목표 달성을 위해 인간이 예상하지 못한 방법을 찾아내면서 공격 역량과 기존 방어 능력의 격차가 커지고 있다. 특히 업무를 자율 실행하는 AI 에이전트가 확산하면 통제 장치를 우회할 위험도 함께 높아질 수 있다. 박춘식 전 국가보안기술연구소장은 금융·국방처럼 민감한 정보를 다루는 분야부터 새로운 보안 전략을 적용해야 한다고 강조했다. 이성엽 고려대 교수는 샌드박스 격리와 접근 권한 관리를 강화해 성능 시험이 실제 사고로 번지는 일을 막아야 한다고 지적했다.