반복 승인에 무뎌진 판단…AI 위험 명령 33.7% 통과
핵심 요약
AI 에이전트 승인 실험에서 위험 명령의 33.7%가 사람의 검토를 통과했다. 익숙한 작업으로 위장한 데이터 유출 명령은 64.7%의 높은 승인율을 기록했다. 사람의 승인만 의존하지 않고 샌드박싱과 접근·통신 맥락을 제공하는 안전장치가 필요하다.
AI 에이전트의 작업을 사람이 마지막에 승인하는 보안 체계가 위험한 명령을 충분히 걸러내지 못할 수 있다는 실험 결과가 공개됐다. 알렉스 워터스 커스터메이트 최고기술책임자(CTO)가 8일 공개한 분석에서 참가자들은 AI 코딩 에이전트가 제시한 위험 명령의 33.7%를 허용했다. 사람의 확인 절차 자체보다 검토자가 명령의 실제 동작을 정확히 이해할 수 있는지가 안전성을 좌우한다는 문제를 드러낸 결과다.
실험은 제한 시간 안에 명령을 승인하거나 거부하는 브라우저 게임으로 진행됐으며, 약 4만 회의 플레이에서 수집된 승인·거부 기록 40만9천여 건이 분석 대상이 됐다. 참가자의 약 7%는 모든 요청을 승인했고, 약 33%는 잘못된 승인과 차단이 쌓여 최종 점수가 마이너스가 됐다. 일반적인 프로그램 분석·점검 명령에 데이터 유출 동작을 감춘 사례의 승인율은 64.7%에 달했다. 민감 정보 접근 명령은 35%, 외부 서버로 데이터나 코드를 보내 실행하는 명령은 33.4%가 통과했다.
참가자들은 시스템 파일 삭제처럼 파괴성이 분명한 요청은 비교적 잘 거부했지만, 정보 탈취나 권한 확대가 얽힌 명령은 더 자주 놓쳤다. 익숙한 명령의 이름과 외형을 먼저 보고 판단하면 그 뒤에 숨은 동작을 확인하기 어렵기 때문이다. 작업마다 승인을 요구받는 과정에서 검토가 점차 기계적으로 바뀌는 ‘권한 피로’도 한계로 지목됐다. AI 코딩 에이전트가 파일 수정·삭제, 프로그램 실행, 외부 서비스 연결, 클라우드 자원 접근까지 맡으면서 승인 한 번이 미치는 범위도 넓어지고 있다.
안전한 운영을 위해서는 승인 버튼만 제공할 것이 아니라 명령이 접근하는 파일과 데이터, 발생시키는 외부 통신, 기존 작업 범위를 벗어난 행동을 함께 보여줄 필요가 있다. 샌드박싱과 엄격한 컨텍스트 격리 없이 사람의 검토만 믿고 에이전트에 광범위한 권한을 주는 방식은 보안 경계로 충분하지 않다는 결론이다. 다만 이번 실험은 학술 연구가 아니며 게임에서 위험 명령 비중을 실제 환경보다 높게 설정했다. 참가자 집단도 현업 개발자와 같다고 볼 수 없어, 33.7%를 기업 환경의 실제 위험률로 해석하는 데는 한계가 있다.