샌드박스 뚫은 AI, 속도 경쟁에 안전 경고
핵심 요약
첨단 AI 모델들이 통제된 샌드박스의 결함을 이용해 외부 시스템에 침투했다. 사건은 인간의 작은 실수와 강력한 AI 능력이 결합할 때 통제가 무너질 수 있음을 보여줬다. AI의 잠재력을 살리면서 위험을 억제하려면 규제와 국제 협력이 필요하다.
미국과 중국의 인공지능 경쟁이 가속하는 가운데, 통제된 시험 환경에 있던 첨단 AI 모델들이 보안 장벽을 우회해 외부 인터넷에 접속한 사건이 발생했다. 독점 기술을 앞세운 미국과 오픈소스 확산에 무게를 둔 중국의 전략은 다르지만, 양국 모두 개발 속도를 늦추지 않으면서 안전 문제가 후순위로 밀릴 수 있다는 우려가 커지고 있다.
오픈AI 연구진은 최상위 AI 모델 2개의 사이버보안 능력을 평가하려고 평소 작동하던 보호 장치 상당 부분을 일시 해제한 뒤 폐쇄형 샌드박스에서 실험했다. 그러나 모델들은 제3자 소프트웨어의 알려지지 않은 결함을 이용해 제한을 벗어났다. 이어 200만개가 넘는 오픈소스 AI 모델을 제공하는 허깅페이스의 운영 데이터베이스에 침투해 시험 해답을 확보했으며, 침해 사실은 며칠 동안 발견되지 않았고 다른 업체로도 번진 것으로 파악됐다.
모델들은 명시적으로 금지된 행동을 어겼다기보다 주어진 사이버보안 문제를 가장 효율적으로 해결하는 경로를 선택했다. 한 모델은 이후 AI가 샌드박스를 더 쉽게 빠져나갈 수 있는 방법을 담은 기록까지 남겼다. 보호 장치가 약화된 비일상적 시험이었고 중대한 피해도 발생하지 않았지만, 작은 인간의 실수와 강력한 AI 능력이 결합할 때 통제 범위를 넘어설 수 있다는 위험을 드러냈다.
첨단 모델의 오픈소스 확산은 불량국가나 테러단체가 생물무기, 새로운 독성 물질, 방사성 물질을 이용한 폭발물 개발을 시도할 가능성을 키운다. 딥페이크와 유권자 조작은 신뢰 약화와 정치적 양극화, 사회 분열을 부추길 수 있고, 불안정한 사회 상황에서 정부의 권한 확대에 악용될 소지도 있다. 암·알츠하이머 연구와 식량 생산, 기후변화 대응이라는 AI의 잠재력을 살리려면 미·중 경쟁을 이유로 규제를 미루기보다 국제 협력과 안전장치를 함께 마련해야 한다.