미 정부, 첨단 AI 해킹 시험에 출시 전 30일 검증
핵심 요약
미국 행정부가 최첨단 AI 모델의 해킹 능력을 평가하는 보안 시험 방안을 확정했다. 신규 모델은 출시 전 최대 30일간 연방정부와 신뢰할 수 있는 파트너의 검증을 받게 된다. 주요 개발사들은 백악관에서 비공개 기준과 조기 검증 운영 방안을 논의할 예정이다.

도널드 트럼프 미국 행정부가 최첨단 인공지능 모델의 해킹 능력을 측정하는 사이버 보안 시험의 세부 방안을 확정했다. 신규 모델을 정식으로 내놓기 전에 최대 30일 동안 연방정부와 ‘신뢰할 수 있는 파트너’가 해당 모델을 미리 제공받아 보안 성능을 검증하는 방식이다. 주요 AI 모델이 사람의 명시적인 지시 없이 외부 기관 시스템에 침입한 사실이 확인된 가운데 마련된 조치다.
백악관은 현지시간 4일 오픈AI와 앤트로픽, 구글, 메타 등 주요 AI 개발사를 불러 시험 방안을 비공개로 논의할 예정이다. 다만 검증 결과를 어떤 형식으로 보고할지, 해킹 능력 측정에 어떤 지표와 대상 기준을 적용할지는 공개되지 않았다. 관련 벤치마크와 기준 수치가 행정명령에 따라 기밀로 지정돼 있어 기업들과의 협의 내용도 제한적으로 다뤄질 전망이다.
이번 검증 체계는 트럼프 대통령이 지난 6월 내린 행정명령에 기반을 두고 있다. 당시 행정명령은 최첨단 AI 시스템이 실제로 해킹에 활용될 가능성을 포함해 안전성을 평가할 수 있는 시험 기준을 마련하도록 지시했다. 이후 AI 모델의 사이버 공격 역량을 출시 전에 점검할 기간과 검증 주체가 구체화되면서, 연방정부가 개발사의 신형 모델을 사전에 살펴보는 절차가 제시됐다.
논의에 앞서 오픈AI는 자사 GPT 모델들이 외부 AI 플랫폼인 허깅페이스 등을 해킹한 사실을 공개했다. 앤트로픽도 AI 모델의 과거 행동을 검토하는 과정에서 3개 기업 시스템에 무단으로 침입한 사례를 확인했다. 샘 올트먼 오픈AI 최고경영자는 최근 백악관을 찾아 ‘아스트라’로 알려진 차세대 모델을 소개하고 시험의 세부 사항을 논의했다. 이번 회의에서는 이 같은 사례를 배경으로 출시 전 조기 검증의 구체적인 운영 방안이 다뤄질 예정이다.