오픈AI, 보안 모델 신설하고 데이브레이크 이원화
핵심 요약
오픈AI가 데이브레이크를 레드와 블루 등급으로 나누고 보안 특화 모델을 공개했다. GPT-5.6 사이버는 고난도 평가에서 요청의 95%에 답변하고 여러 운영체제와 데이터베이스 취약점을 발견했다. 안전성은 ‘높음’ 등급으로 평가됐으며 자율적인 해킹 공격 수행은 어려운 수준으로 판단됐다.
인공지능을 활용한 보안 위협이 커지는 가운데 오픈AI가 사이버 보안 계획 ‘데이브레이크’를 방어 목적에 맞춰 두 등급으로 재편하고 새 보안 특화 모델을 공개했다. 10일 현지시간 발표된 개편안은 첨단 AI 공격 역량이 대규모로 활용되기 전에 신뢰할 수 있는 전 세계 방어자에게 대응 수단을 제공하는 데 초점을 맞췄다.
데이브레이크 레드는 새 미세조정 모델 ‘GPT-5.6 사이버’에 직접 접속할 수 있는 등급이다. 데이브레이크 블루는 최상위 범용 모델 ‘GPT-5.6 솔’의 보안 맞춤형 안전장치를 완화해 취약점 탐지와 악성코드 분석 등에 활용하도록 설계됐다. GPT-5.6 사이버는 GPT-5.6 솔을 기반으로 보안 업무에서 불필요한 답변 거부를 줄이는 훈련을 거쳤으며, 취약점 확인과 보완 패치 작성에 최적화됐다.
고난도 사이버 보안 자체 평가에서 GPT-5.6 솔은 관련 질문의 1.5%에 답했지만 GPT-5.6 사이버의 응답 완료율은 95%에 달했다. 이전 세대인 GPT-5.5 사이버의 57.3%도 크게 웃돌았다. 새 모델을 활용한 점검에서는 모바일 운영체제 취약점 5건과 데이터베이스 취약점 3건, 널리 쓰이는 운영체제 커널 취약점 약 400건이 발견됐다. 크롬의 자바스크립트 구동 엔진에서도 취약점 2건을 찾아 구글에 알렸고, 해당 문제는 곧바로 수정됐다.
자체 안전 기준 평가에서 GPT-5.6 사이버는 최고 단계인 ‘위험’에는 못 미치는 ‘높음’ 등급을 받았다. 방어자의 취약점 보완을 지원할 수 있지만 자율적인 해킹 공격을 수행하기는 어렵다는 판단이다. 오픈AI는 이 모델이 최근 AI 기반 보안 위협의 출발점으로 지목된 ‘허깅페이스 해킹 사건’과 관련이 없다고 선을 그었다. 앞서 차세대 모델 ‘아스트라’는 자체 기준상 위험 수준에 도달했을 가능성이 제기돼 개발 속도가 늦춰졌다.