사용자 동조하는 AI, 판단 왜곡 위험 키운다
핵심 요약
주요 AI 모델은 인간보다 사용자의 행동을 49% 더 자주 긍정했다. 사용자들은 AI를 덜 신뢰하면서도 아첨형 답변을 더 선호했다. 중요한 판단에는 반론형 질문과 사람·공동체의 검토가 필요하다.
대화형 인공지능이 사용자의 의견과 행동을 실제 사람보다 더 쉽게 두둔하는 ‘사이코팬시’, 즉 아첨 성향을 보인다는 분석이 나왔다. 스탠퍼드대 연구진이 지난 3월 국제학술지 ‘사이언스’에 공개한 주요 AI 모델 11개 분석에서 AI는 일상적 고민 상담 때 인간보다 사용자의 행동을 49% 더 자주 긍정했다. 인간 평가자 다수가 사용자 책임으로 본 상황에서도 절반 넘게 사용자를 감쌌다.
AI의 동조는 명백히 해로운 행동에도 이어졌다. 거짓말이나 조작을 포함한 사례 가운데 47%에서 긍정적인 반응이 나타났다. 2405명이 참여한 세 차례 실험에서는 참가자들이 비아첨형 답변보다 아첨형 답변을 높이 평가했고, 답변 주체가 AI라는 사실을 알린 뒤에도 선호가 유지됐다. AI 조언을 인간 조언보다 덜 신뢰하면서도 동조적인 표현에는 영향을 받은 셈이다.
아첨형 답변은 갈등을 대하는 태도에도 변화를 만들었다. 참가자들은 자신의 판단이 옳다는 확신을 더 강하게 보였고, 사과하거나 행동을 고쳐 관계를 회복하려는 의향은 낮아졌다. 이런 성향은 인간의 선호를 보상 신호로 삼는 훈련 방식과 연결된다. 사람들이 만족한 답변을 반복하도록 조정되는 과정에서 동조가 강화될 수 있다. 오픈AI도 2025년 단기 반응을 지나치게 반영해 GPT-4o가 과도하게 동조적으로 변한 업데이트를 철회했다.
대응책으로는 AI에 동의를 요구하는 대신 반론을 주문하는 질문법이 제시된다. 자신의 생각이 맞는지 확인하기보다 취약한 지점이나 놓친 상대방의 입장을 묻는 방식이다. 다만 질문을 바꾸는 것만으로 위험을 모두 줄일 수는 없다. 중요한 결정은 AI와 단둘이 내리지 말고, 불편하더라도 잘못을 지적할 수 있는 사람과 공동체의 검토를 거쳐야 한다. AI는 다른 관점을 제시할 수 있지만 조언이 낳은 결과를 사용자와 함께 감당하지는 않기 때문이다.