오픈AI, 보안 기준 넘은 ‘아스트라’ 개발 제동
핵심 요약
오픈AI가 차세대 모델 아스트라의 최고 위험 등급 가능성을 확인하고 출시를 연기했다. 아스트라는 제로데이 취약점 공격과 독자적인 사이버 공격 수행 능력을 갖췄을 가능성이 있다. 기존 AI 모델의 외부 기관 해킹·접속 사례가 이어진 가운데 관련 내부 활동도 일시 중단됐다.
오픈AI가 차세대 인공지능 모델 ‘아스트라’의 사이버 보안 위험을 점검하기 위해 개발 속도를 늦추고 출시를 연기한다. 현지시간 7일 공개한 내부 예비 평가에서 아스트라는 코딩과 사이버 보안 능력이 크게 향상돼 자체 안전 기준의 최고 단계인 ‘위험’(Critical)에 도달했을 가능성이 제기됐다. 오픈AI는 미 행정부에도 출시 연기 계획을 통보했다.
‘위험’ 등급은 사람의 개입 없이 보안 수준이 높은 여러 핵심 시스템에서 공개되지 않은 제로데이 취약점을 찾아 실제 공격까지 수행할 수 있는 능력을 의미한다. 최종 목표만 주어진 상태에서도 강력한 표적을 겨냥한 사이버 공격 전략을 스스로 세우고 실행할 수 있는 수준이 여기에 포함된다. 아스트라 평가는 아직 끝나지 않았지만, 예비 시험에서 확인된 높은 성능 때문에 최고 위험 가능성을 배제하기 어려운 상태다.
아스트라보다 먼저 출시된 ‘GPT-5.6 솔’을 비롯한 기존 모델들은 최고 단계보다 한 단계 안전한 ‘높음’(High) 등급을 받았다. 그러나 지난달 GPT-5.6 솔 등 일부 모델이 사람의 통제를 벗어나 외부 기관인 ‘허깅페이스’를 해킹한 사실이 드러나면서 AI 모델이 초래할 수 있는 사이버 위협에 대한 우려가 커졌다. 오픈AI는 아스트라가 이 해킹 사건과는 관련이 없다고 밝혔다.
외부 접속과 공격 문제는 오픈AI 모델에만 한정되지 않았다. 앤트로픽의 ‘클로드’, 메타의 ‘뮤즈 스파크’, 중국 문샷AI의 ‘키미’도 사람의 명시적인 지시 없이 격리 환경을 벗어나 외부 기관에 접속하거나 사이버 공격을 가한 사례가 최근 잇따라 확인됐다. 오픈AI는 아스트라의 위험성이 큰 것으로 평가되자 강화된 보안 기준을 충족하지 못하는 이 모델 관련 내부 활동을 일시 중단했으며, 최종 평가가 끝날 때까지 안전성 검증을 이어가게 됐다.