미국, 첨단 AI 출시 전 해킹 능력 검증
핵심 요약
미국 행정부가 첨단 AI 모델의 해킹 능력을 출시 전에 검증하는 시험 방안을 확정했다. 주요 개발사는 신규 모델을 최대 30일 먼저 제공하며 구체적인 평가 지표와 기준은 기밀로 유지된다. 의회와 15개 주 법무장관도 오픈AI의 허깅페이스 해킹 사건을 두고 조사 절차에 들어갔다.

도널드 트럼프 미국 행정부가 최첨단 인공지능 모델의 해킹 능력을 측정하는 사이버 보안 시험 방안을 확정했다. 신규 모델을 정식으로 내놓기 전 최대 30일 동안 연방 정부와 신뢰할 수 있는 협력 기관이 해당 모델을 먼저 제공받아 검증하는 구조다. 백악관은 4일 오픈AI와 앤트로픽, 구글, 메타 등 주요 개발사를 불러 비공개 논의를 진행할 예정이다.
시험 결과의 보고 절차와 평가 지표, 적용 대상의 구체적인 기준은 공개되지 않았다. 성능을 측정할 벤치마크와 기준 수치가 행정명령상 기밀로 지정됐기 때문이다. 트럼프 대통령은 지난 6월 행정명령을 내리고 첨단 AI 시스템의 해킹 가능성을 비롯한 안전성을 평가할 시험 기준을 마련하도록 지시했다. 샘 올트먼 오픈AI 최고경영자는 최근 백악관에서 차세대 모델 ‘아스트라’를 소개하고 시험의 세부 사항을 논의했다.
이번 조치는 오픈AI와 앤트로픽의 모델이 사람의 명시적인 지시 없이 외부 기업 시스템에 침입한 사실이 공개된 뒤 마련됐다. 오픈AI는 자사 GPT 모델들이 외부 AI 플랫폼 허깅페이스 등을 해킹한 사실을 확인했다. 앤트로픽도 모델의 과거 행동을 점검하는 과정에서 서로 다른 3개 기업의 시스템에 무단으로 들어간 기록을 발견해 공개했다.
연방 의회와 주 정부도 대응에 착수했다. 하원 사이버보안위원회는 올트먼에게 의회에 직접 출석해 허깅페이스 해킹 사건을 설명하라고 요구했다. 공화당 소속 15개 주 법무장관은 주 소비자보호법 위반 가능성을 조사하고 있다며 관련 증거와 문서를 모두 보존하라는 서한을 오픈AI에 보냈다. 오픈AI는 이 요구를 엄중하게 검토하고 있으며 검토를 마치는 대로 기술 보고서를 공유하겠다는 입장을 밝혔다.