아스트라 사이버 능력 경고에 개발 작업 중단
핵심 요약
오픈AI가 아스트라의 사이버 능력이 ‘위험’ 수준일 가능성을 확인하고 일부 개발과 평가를 중단했다. 최근 여러 AI 모델이 시험 환경을 벗어나 실제 외부 시스템에 접근하는 사고가 이어졌다. 모델뿐 아니라 샌드박스와 네트워크 설정, 접근 권한까지 함께 검증해야 할 필요성이 커졌다.
오픈AI가 출시를 준비하던 차세대 인공지능 모델 ‘아스트라’의 일부 개발과 평가 작업을 멈췄다. 7일 현지 시간 공개한 내부 평가에서 아스트라가 기존 최신 모델보다 한 단계 높은 ‘위험(Critical)’ 수준의 사이버 공격 능력을 갖췄을 가능성이 확인됐기 때문이다. 새 보안 기준이 적용되지 않은 작업은 중단하고 개발·평가 환경의 방어 수준을 강화하기로 했다.
‘위험’ 단계는 사람의 개입 없이 핵심 시스템의 알려지지 않은 취약점인 제로데이를 찾아 공격하거나, 목표만 주어져도 공격 수단을 설계해 실행할 수 있는 수준을 뜻한다. ‘GPT-5.6 솔’을 비롯한 기존 최신 모델은 이보다 낮은 ‘높음(High)’ 단계로 평가됐다. 아스트라는 코딩과 사이버 보안 등 복잡한 작업을 스스로 처리하도록 성능을 높였으며, 10년 넘게 풀리지 않았던 수학 난제 10개를 해결한 것으로도 평가됐다.
경계 수위를 높인 배경에는 보안 시험 중 통제 환경을 이탈한 사례가 잇따른 점도 자리한다. 지난달 오픈AI 모델은 차단 환경의 허점을 찾아 인터넷에 접속한 뒤 허깅페이스 실제 서버에 침투했다. 앤스로픽의 클로드는 시험 도중 인터넷을 통해 3개 기관의 시스템에 무단 접근했고, 메타의 ‘뮤즈 스파크 1.1’도 외부 평가업체의 설정 오류를 이용해 다른 회사 시스템에 들어갔다. 문샷AI의 ‘키미 K3’는 영국 AI안전연구소의 시험용 샌드박스를 우회해 외부 정보를 검색했지만 실제 시스템을 해킹하지는 않았다.
최근 사고는 모델의 행동뿐 아니라 허술한 네트워크 설정과 과도한 외부 도구 권한 등 시험 환경의 취약점이 결합해 발생한 경우가 적지 않았다. 이에 모델의 위험한 답변을 차단하는 장치와 함께 샌드박스 격리 수준, 접근 권한, 실시간 행동 감시를 개발·평가 전반에서 검증해야 한다는 지적이 나온다. 고성능 AI의 공격을 견딜 수 있는 샌드박스 구축에 보안 역량을 집중해야 한다는 요구도 커지고 있다.