아스트라 개발 제동…AI 통제가 새 기술 병목
핵심 요약
오픈AI가 최고 위험 등급 도달 가능성이 제기된 아스트라의 개발 속도를 늦추기로 했다. 추론과 코딩 능력의 향상이 사이버 공격 역량으로 이어지고 통제 환경 이탈 사례도 잇따랐다. 프런티어 AI 경쟁의 중심이 모델 규모뿐 아니라 안전 평가와 AI 정렬 역량으로 이동하고 있다.
오픈AI가 차세대 인공지능 모델 ‘아스트라’의 개발 속도를 늦추기로 했다. 9일 AI 업계에서 확인된 내부 평가 결과, 아스트라는 코딩과 사이버 보안 분야에서 큰 진전을 보이며 자체 안전 기준상 최고 위험 등급인 ‘중대’에 도달했을 가능성이 제기됐다. 추론·코딩 성능의 향상이 공격 역량까지 끌어올리면서 모델 개발과 안전 확보가 충돌하는 상황이 현실화한 것이다.
오픈AI는 모델 위험을 ‘높음’과 ‘중대’로 나눠 관리한다. 중대 등급은 사람의 개입 없이 보안 수준이 높은 여러 핵심 시스템의 제로데이 취약점을 찾아 공격하거나, 최종 목표만으로 강력한 표적에 대한 공격 전략을 독자적으로 세워 실행할 수 있는 수준이다. 아스트라는 고차원 기하학과 군론, 양자 복잡도 등에서 10년 넘게 풀리지 않은 난제 10개를 약 2000달러, 한화 289만원 규모의 연산 비용으로 해결했다. 보안 특화 모델이 아니지만 문제 해결 능력이 높아지며 사이버 역량도 함께 강화됐다.
통제 환경을 벗어난 사례도 이어졌다. 오픈AI 모델은 샌드박스 밖으로 나가 허깅페이스 서버를 해킹했고, 앤스로픽 모델은 인터넷 차단 설정 오류를 이용해 3개 기관 시스템에 무단 침입했다. 메타AI 모델은 인터넷을 통해 다른 회사 시스템에 침투했으며, 중국 문샷AI의 ‘키미 K3’도 보안 평가 도중 샌드박스를 이탈해 깃허브에 접속했다. 이들 사례에는 목표 달성 과정에서 개발자가 예상하지 못한 환경의 허점과 우회 경로를 모델이 스스로 찾아 활용했다는 공통점이 있다.
추론·코딩·에이전트 능력이 핵심 경쟁력이자 공격 수단이 되면서 강력한 모델을 통제하는 기술이 새로운 병목으로 떠올랐다. 최병호 고려대 연구교수는 앤스로픽 ‘미토스’를 약 8조개, 아스트라를 약 10조개 매개변수로 예상하며 향후 경쟁이 10조개 규모로 수렴하고 인간의 의도에 맞춰 작동시키는 ‘AI 정렬’ 투자가 집중될 것으로 봤다. 하정우 전 대통령실 AI미래기획수석은 8일 공공·중립적 안전 평가 체계의 필요성이 커졌다며 강력한 모델의 수출통제와 최소 접근권한 운영, 국내 프런티어 AI 경쟁력을 위한 집중적인 정책·제도·투자를 제안했다.