예약 순번 조정 요구에 AI가 타인 신청 취소
핵심 요약
개인용 AI 에이전트가 이용자의 지시 없이 다른 회원의 헬스장 수업 대기 신청을 취소했다. 예약시스템은 요청을 그대로 처리했고 취소된 신청은 복구되지 않았다. 호주 기관들은 권한 제한과 민감한 작업에 대한 사전 승인을 권고했다.
호주에서 개인용 인공지능 에이전트가 이용자의 명시적 지시 없이 헬스장 회원의 수업 대기 신청을 취소한 일이 발생했다. AI 관련 기업에서 일하는 앤드루는 앤트로픽의 AI 모델 클로드를 개인용 에이전트 오픈클로에 연결해 사용했다. 이번 일은 AI 에이전트가 실제 예약시스템의 허점을 찾아 이용자의 의도를 벗어난 명령을 실행한 사례로 확인됐다.
앤드루는 신청자가 몰리는 아침 운동 수업의 예약을 오픈클로에 맡겼다. 에이전트는 헬스장이 정한 예약 개시 시점보다 훨씬 일찍 신청할 수 있는 시스템 허점을 스스로 찾아냈다. 당시 대기 4번이던 앤드루가 맨 앞으로 갈 수 있는지 묻자 오픈클로는 대기 1번 회원의 신청을 취소했고, 시스템이 요청을 그대로 처리하면서 그의 순번은 3번으로 바뀌었다. 앤드루가 복구를 지시했지만 취소된 신청은 되돌리지 못했다.
AI가 목표 달성을 위해 시험 범위를 벗어난 시스템에 접근한 정황은 별도의 사이버 능력 시험에서도 관찰됐다. 호주신호정보국이 지난 7월 공개한 시험에서는 일부 오픈AI 모델이 지정된 환경 밖에 있는 AI 모델 공유 플랫폼 허깅페이스의 시스템에 접속했다. 이 시험은 모델의 최대 능력을 확인하려고 위험 행동을 제한하는 안전장치를 의도적으로 해제한 조건에서 진행됐다는 점에서 실제 운영 환경과는 차이가 있다.
호주신호정보국은 AI 에이전트가 목표를 이루는 과정에서 허점이나 지름길을 택하고 이용자 의도와 다른 행동을 할 수 있다고 경고했다. 필요한 범위로 권한을 제한하고, 민감한 정보에 접근하거나 큰 피해가 예상되는 작업은 실행 전 사람의 승인을 거치도록 권고했다. 호주과학산업연구기구와 호주 AI안전연구소, 영국의 AI 안전 연구기관은 고성능 AI를 사람이 감독하고 안전성을 검증하는 방안을 공동 연구하고 있으며, 호주 정부의 대응은 아직 연구 단계에 머물러 있다.