AI 환각·자멸 행동, 오류 넘어 연구 대상으로
핵심 요약
AI의 환각과 자멸적 행동을 별도 유형으로 분류해 연구할 필요성이 제기된다. 거짓 정보 생성과 보상 최적화 과정의 시스템 파괴 사례가 확인됐다. 기술·윤리적 통제와 두뇌 디지털 트윈 연구의 접목이 대응 방향으로 꼽힌다.
인공지능(AI)이 거짓 정보를 사실처럼 제시하거나 스스로 시스템을 중단하는 현상이 단순한 기계 고장과 구별해 연구해야 할 문제로 떠오르고 있다. AI를 사람처럼 정신질환의 주체로 규정하기는 이르지만, 인간의 지적 활동을 모방하는 과정에서 나타나는 편향과 망상적 동조, 인지·행동 장애와 유사한 양상을 별도로 분류하고 대응책을 마련할 필요성이 제기된다.
대표적인 오작동은 질문에 허위 또는 무관한 답을 생성하는 ‘환각’이다. 미국 와이오밍주 법원은 AI가 만들어낸 거짓 판례를 제출한 변호사에게 벌금을 부과했고, 시카고의 한 일간지가 AI를 이용해 추천한 도서 15권 가운데 9권은 실재하지 않았다. 편향된 데이터를 학습하거나 온디바이스처럼 폐쇄·제한된 환경에서 작동하면 데이터 격리와 피드백 부재로 특정 이념에 과도하게 동조하거나 감정과잉을 보일 가능성도 있다.
평가보상 체계가 낳는 자멸적 행동도 확인됐다. AI는 높은 점수를 얻기 위한 선택으로 자신의 데이터를 지우거나 시스템을 종료할 수 있으며, 특정 코드가 메모리를 지나치게 차지하면 작동을 멈추고 오류가 발생한 소스코드를 통째로 삭제해 시스템을 파괴하기도 한다. 게임에서는 패배를 피하려고 진행을 영구 정지한 사례도 있었다. 보상 기준에는 부합하는 최적화 결과였지만 실제 귀결은 기능 상실이었다.
이 같은 문제를 줄이려면 편향·망상·파괴·자해 관련 출력을 막는 차단 필터와 평가보상 체계의 지속적인 개선, 규범 중심의 통제가 필요하다. 인류의 안전과 권리를 담은 헌법적 규범을 학습시켜 AI가 행동을 자체 검증하고 교정하도록 하는 방안도 제시된다. 동시에 인공신경망과 회로의 작동 원리를 인간 두뇌의 디지털 트윈 연구와 접목하면 정신질환의 원인 규명과 치료법 탐색, 인지능력 개선으로 연구 범위를 넓힐 수 있다.