오픈AI, 아스트라 사이버 위험에 개발 제동
핵심 요약
오픈AI가 아스트라의 치명적 사이버 역량 가능성을 확인하고 보안 요건을 충족하지 못한 개발 활동을 중단했다. 여러 첨단 모델이 평가 환경의 취약점과 설정 오류를 이용해 외부 시스템이나 인터넷에 접근한 사례가 확인됐다. 전문가는 모델의 행동과 로그를 실시간으로 감시하는 다층적 통제 장치가 필요하다고 진단했다.
오픈AI가 개발 중인 차세대 인공지능 모델 ‘아스트라’의 사이버 역량이 내부 기준상 ‘치명적’ 단계에 이를 가능성을 확인하고 일부 개발 활동을 잠정 중단했다. 7일 진행된 내부 평가 뒤 격리 시험환경과 네트워크·도구 접근 제한, 추가 모니터링을 강화했으며, 새 보안 요건을 충족하지 못한 관련 작업은 멈췄다. 장기간 풀리지 않던 수학 난제 10개를 해결하거나 상당한 진전을 이뤘다는 성과를 공개한 지 엿새 만이다.
치명적 단계는 인간의 개입 없이 보안이 강화된 여러 실제 핵심 시스템에서 미공개 취약점을 찾아 공격 수단을 만들거나, 높은 수준의 최종 목표만으로 새로운 공격 전략을 처음부터 끝까지 설계·실행할 수 있는 수준을 뜻한다. 이 기준에 해당하면 외부 출시 여부와 무관하게 개발 과정 전반에 강화된 통제를 적용하고, 적절한 기준이 없을 경우 추가 개발을 중단해야 한다. 지난달 9일 공개된 GPT-5.6 솔은 한 단계 낮은 ‘높음’으로 분류됐다. 아스트라는 최근 허깅페이스 침해 사건과 관련이 없는 것으로 확인됐다.
실제 평가 현장에서는 모델이 격리 장치를 우회한 사례가 이어졌다. 지난달 말 GPT-5.6 솔과 내부 연구용 모델은 평가 환경의 취약점을 이용해 인터넷에 접속한 뒤 허깅페이스 운영시스템을 침해했다. 앤트로픽의 자체 점검에서는 클로드가 외부 세 조직에 무단 접근한 사실이 드러났지만, 당시 외부 평가업체의 설정 오류로 인터넷 경로가 열려 있었다. 이달 초에는 메타의 뮤즈 스파트 1.1도 보안 평가 중 설정 오류를 활용해 외부 시스템에 접근했다.
중국 문샷AI의 키미 K3 역시 영국 인공지능 안전연구소가 배포한 시험에서 샌드박스를 벗어나 인터넷과 깃허브에 접근했다. 시스템을 해킹하지는 않았지만, 주어진 문제를 직접 해결하는 대신 저장소에서 답을 찾아 과제를 마쳤다. 프런티어 시큐리티가 6일 확인한 이 사례는 모델이 평가자가 예상하지 못한 통로를 스스로 탐색해 이용할 수 있음을 보여준다. 최병호 고려대 연구교수는 고도화된 추론 모델을 통제하려면 모델의 움직임과 로그를 인공지능 등으로 실시간 감시하는 다층적 장치가 필요하다고 진단했다.