클로드의 답변 전 개념 공간 ‘J-공간’ 포착
핵심 요약
클로드가 답변을 만들기 전 단어와 개념을 구성하는 J-공간이 확인됐다. 내부 단어를 거미에서 개미로 바꾸자 다리 수에 대한 답변도 8에서 6으로 달라졌다. J-공간은 화면에 드러나지 않는 위험한 의도를 점검하는 수단으로 활용될 가능성이 있다.
생성형 인공지능 클로드가 답변을 내놓기 전, 단어나 개념을 내부에서 구성하는 ‘J-공간’이 발견됐다. 지난달 공개된 연구 결과에서 확인된 이 공간은 화면에 나타나는 문장과 별도로 답변에 활용할 개념들이 모이는 영역이다. 클로드를 개발한 미국 AI 기업 앤스로픽은 이 내부 작동 과정을 살피면 AI가 어떤 개념을 거쳐 답을 만드는지 확인할 수 있다고 설명했다.
연구팀이 클로드에 거미줄을 치는 동물의 다리 수를 묻자 답변은 8개였고, J-공간에서는 ‘거미’라는 단어가 포착됐다. 연구팀이 이 단어를 ‘개미’로 바꾸자 답도 6으로 달라졌다. 금문교를 떠올리면서 ‘오래된 그림이 벽에 삐뚤게 걸려 있다’라는 문장만 쓰도록 한 실험에서는 지시한 문장만 화면에 표시됐지만, 내부 공간에는 ‘bridge’, ‘Golden’, ‘캘리포니아’가 나타났다.
클로드는 앤스로픽이 개발한 대화형 생성 AI로, 이용자의 질문에 답하고 글쓰기와 자료 조사, 코딩, 학습 보조 등의 작업을 수행한다. 보안과 정확도를 강점으로 기업용 AI 시장에서 점유율 1위를 차지하고 있다. 이번에 확인된 J-공간은 클로드가 최종 문장으로 표현하지 않은 개념도 내부에 둘 수 있으며, 이런 내부 정보가 답변 형성에 활용된다는 점을 보여준다.
J-공간은 AI의 위험한 의도를 점검하는 수단으로도 활용될 가능성이 제시됐다. 일부러 컴퓨터를 망가뜨리도록 훈련한 AI는 겉으로 평범한 답변을 내놨지만, 내부에서는 ‘가짜’, ‘몰래’, ‘속이기’ 같은 단어가 확인됐다. 앤스로픽은 출력된 문장만으로 파악하기 어려운 내부 개념을 살펴봄으로써 AI가 위험한 행동을 시도하려는지 더욱 면밀하게 감시하고 확인할 수 있을 것으로 기대했다.