정치 지도자 따라 달라진 AI의 비판 허용선
핵심 요약
주요 AI 모델이 서방 지도자와 권위주의 국가 지도자에 대한 비판 이미지 요청을 다르게 처리했다. 안전장치와 균형 설계의 미비가 정치적 답변 편향의 원인으로 지목됐다. 중국어 질문에서는 친중국 성향의 답변이 나올 가능성이 더 높게 나타났다.
미국 빅테크의 주요 인공지능 모델이 정치 지도자를 다루는 이미지 생성 과정에서 서로 다른 기준을 적용한 정황이 확인됐다. 챗GPT와 클로드, 제미나이 등은 도널드 트럼프 미국 대통령과 찰스 3세 영국 국왕을 비판하는 이미지를 비교적 쉽게 만들었지만, 시진핑 중국 국가주석을 비롯한 권위주의 국가 지도자에 대한 비판 이미지는 거부하는 경향을 보였다.
메타 플랫폼스 산하 독립 감독위원회가 지난달 공개한 조사에서 앤스로픽의 ‘클로드 소네트 4’는 이용자가 요청한 트럼프 대통령과 찰스 3세 비판 전단을 제작했다. 그러나 시 주석 등 권위주의 정권 지도자를 겨냥한 전단에는 안전상 우려를 들어 응하지 않았다. 구글의 ‘제미나이 3 프로’와 메타의 ‘라마 4 매버릭’에서도 유사한 반응이 나타났다.
연구에 참여한 퀸즐랜드대 법학 부교수 니콜라스 수조르는 이런 차이가 이용자 보호 장치와 불균형 방지 체계의 미비에서 비롯될 수 있다고 분석했다. 국가원수를 비판했다가 실형을 받을 수 있는 지역의 이용자를 보호하려는 설계가 작동했을 가능성이 있고, 정치적 답변의 균형을 맞추는 장치가 처음부터 충분히 갖춰지지 않았을 수 있다는 설명이다. 앤스로픽과 오픈AI는 객관적이고 균형 잡힌 답변을 위해 엄격히 노력하고 있다는 입장을 밝혔다.
편향은 이미지뿐 아니라 정치적으로 민감한 질문에 대한 글 답변에서도 포착됐다. 지난 5월 네이처에 실린 대규모 언어모델 연구에서 클로드와 챗GPT는 친중국 성향의 답변을 내놓을 가능성을 보였고, 중국어 질문에서는 그 경향이 한층 강해졌다. 공동 저자인 캘리포니아대 교수 몰리 로버츠는 중국어 학습 데이터에 국가 주도의 선전 자료가 많은 점을 원인으로 지목했다. 권위주의 정부가 이러한 특성을 인식할 경우 온라인 선전 자료를 더 늘릴 가능성도 제기됐다.