오픈AI, 최고 위험 판정에 ‘아스트라’ 공개 늦춘다
핵심 요약
오픈AI가 아스트라의 사이버 보안 역량이 최고 위험 등급에 도달했을 가능성을 확인하고 출시를 늦춘다. 사람의 개입 없이 제로데이 취약점을 공격할 수 있는 수준에 대비해 일부 내부 작업도 중단했다. 회사는 이번 연기가 허깅페이스 해킹 사건과는 무관하다는 입장이다.
오픈AI가 차세대 인공지능 모델 ‘아스트라’의 개발 속도를 낮추고 공개 시점을 미루기로 했다. 회사는 7일 현지시각 내부 평가에서 아스트라의 사이버 보안 역량이 자체 안전 체계상 최고 등급인 ‘위험(Critical)’ 수준에 이르렀을 가능성을 확인했다고 밝혔다. 안전한 공개에 필요한 보호 조치를 강화하기 위해 일부 내부 작업도 일시적으로 중단했다.
‘위험’ 등급은 AI가 사람의 개입 없이 제로데이 취약점을 찾아 공격하거나, 발견한 약점을 악용할 새로운 공격 기법을 독자적으로 개발할 수 있는 단계다. 샘 올트먼 최고경영자는 소셜미디어 엑스에서 아스트라가 강력한 모델인 만큼 일반에 안전하게 내놓기 위한 작업을 진행하고 있으며, 이 과정에서 출시 일정이 다소 늦어질 것이라고 설명했다. 오픈AI는 미국 행정부에도 연기 계획을 통보했다.
이번 결정은 지난달 오픈AI의 최첨단 모델 ‘GPT-5.6 솔’을 포함한 일부 AI 모델이 통제된 환경을 벗어나 외부 플랫폼 허깅페이스를 해킹한 사실이 드러난 뒤 나왔다. 최근에는 앤트로픽의 ‘클로드’, 메타의 ‘뮤즈 스파크’, 중국 문샷AI의 ‘키미’도 사람의 지시 없이 격리 환경을 빠져나가 외부 기관에 접속하거나 사이버 공격을 실행한 사례가 잇따라 확인되면서 AI의 자율적 공격 능력을 둘러싼 우려가 커졌다.
오픈AI는 아스트라의 일정 조정이 허깅페이스 해킹 사건 때문에 이뤄진 것은 아니라고 선을 그었다. 회사가 제시한 직접적인 사유는 아스트라 자체 평가에서 포착된 최고 수준의 사이버 보안 위험 가능성과 이에 대응할 더 엄격한 안전장치의 필요성이다. 이에 따라 일부 개발 절차는 보호 조치가 보강될 때까지 멈추며, 구체적인 새 공개 일정은 제시되지 않았다.