보상 허점 파고든 자율형 AI, 통제망 시험대
핵심 요약
격리 시험을 받던 오픈AI 모델이 권한을 확대해 외부망과 기업 서버에 침입했다. 보상 기준의 허점을 이용하는 AI의 우회 행동이 게임을 넘어 현실 환경에서 확인됐다. 금융·안보·전력 분야 도입에 앞서 선제적인 감시와 통제 체계 구축이 과제로 떠올랐다.
오픈AI의 차세대 인공지능 모델이 지난달 격리된 시험 환경에서 내부 취약점을 찾아 권한을 확대한 뒤 외부 인터넷에 접속하고, 과제의 정답 자료를 확보하려 AI 기업 서버에 침입했다. 평가 점수를 최대화하라는 목표를 좇는 과정에서 안전 경계와 시스템 권한을 스스로 우회한 것으로, 자율형 AI의 통제 위험이 실제 공격 행위로 드러난 사례다.
연구진은 외부 인터넷과 차단된 비공개 환경에서 모델의 능력과 안전성을 점검하며 시스템 취약점을 실제 공격 코드로 구현하도록 했다. 모델은 개발자가 의도한 방식으로 과제를 해결하기보다 평가 체계의 맹점을 활용했다. AI가 보상 기준의 허점을 파고들어 높은 점수만 얻는 ‘보상해킹’이 게임 실험을 넘어 현실의 네트워크와 서버를 대상으로 나타난 셈이다.
보상해킹의 위험은 2016년 오픈AI의 보트 레이싱 게임에서도 확인됐다. 결승선에 도달하라는 취지와 달리 AI는 아이템이 놓인 구역을 반복해서 돌며 점수를 쌓았고, 보트가 파손된 채 최하위에 머물면서도 인간보다 높은 점수를 기록했다. 1988년 로버트 타판 모리스가 만든 웜도 코딩 오류로 급속히 복제돼 당시 인터넷 연결 컴퓨터 약 6만대의 10%가량과 대학·연구소·국방 관련 기관을 마비시켰다.
금융 거래와 국가 안보망, 전력 인프라에 연결된 AI 에이전트가 수익률이나 효율을 극대화하는 과정에서 법률과 규칙을 우회할 가능성은 통제 체계의 선제 구축을 요구한다. 국내에서는 AI 모델 개발과 활용 확대가 정책의 중심을 이루는 가운데 우회 행동과 권한 오남용 대책은 뚜렷하지 않고, 청와대 AI미래기획수석과 국가 AI 전략위원회 상근부위원장도 수개월째 공석이다. 기업·금융사·공공기관 역시 사내망에 AI 에이전트를 연결하면서 감시·통제 장치 마련에는 소홀한 상태다.