앤스로픽, 클로드 생성문 전반에 식별 표식 적용
핵심 요약
앤스로픽이 전 세계 클로드 생성문에 보이지 않는 워터마크를 순차 적용한다. 복사와 부분 편집 뒤에도 흔적이 남지만 대규모 수정이나 번역을 거치면 탐지가 어려울 수 있다. 교정이나 번역만 맡겨도 표식이 생길 수 있어 탐지 결과가 AI 대필의 확정적 증거는 아니다.
앤스로픽이 AI 챗봇 클로드가 생성한 모든 글에 이용자가 육안으로 알아보기 어려운 텍스트 워터마크를 넣는다. 새로 출시되는 클로드 모델부터 적용하고 기존 모델로 범위를 순차 확대할 방침이다. 유럽연합 AI법의 투명성 의무에 대응한 조치로, 유럽뿐 아니라 전 세계 이용자에게 같은 기준이 적용된다.
워터마크는 글의 의미와 가독성을 바꾸지 않는 방식으로 문장 안에 직접 삽입된다. 텍스트를 복사해 붙여넣거나 일부 문구를 편집한 뒤에도 표식의 일부가 남도록 설계됐다. 적용 대상은 8월 2일 이후 출시된 모든 모델이며, 앤스로픽은 외부에서도 해당 표식을 확인할 수 있는 탐지 도구를 제공할 계획이다. 기존 모델의 적용 시점과 도구 공개 일정은 추후 발표된다.
이번 조치로 교육계와 출판업계는 과제물이나 출판 원고에 클로드의 개입 흔적이 있는지 살필 수단을 갖게 될 수 있다. 지난달 범죄소설 ‘전화해, 내가 시체는 내가 치울게’는 14개 출판사가 입찰 경쟁을 벌여 계약했으나 저자 제리 팔라데의 AI 집필 의혹이 제기된 뒤 계약이 철회됐다. 미국 출판사 아셰트도 미아 밸러드의 공포소설 ‘수줍은 소녀’ 출간을 중단했다. 밸러드는 프리랜서 편집자가 자신이 모르는 사이 AI 생성 내용을 원고에 넣었다고 해명했다.
앤스로픽은 주요 AI 기업 가운데 두 번째로 텍스트 워터마크를 도입한다. 구글 딥마인드는 2024년부터 신스ID로 제미나이 생성 텍스트와 영상에 표식을 넣었고, 이미지에는 2023년부터 관련 기술을 적용했다. 다만 대폭적인 편집이나 의역·번역을 거치거나 다른 글과 섞이면 탐지가 어려울 수 있다. 반대로 사람이 쓴 글도 클로드로 교정하거나 번역하면 표식이 남을 수 있어, 탐지 결과만으로 전체 글을 AI가 작성했다고 단정할 수 없다. 오픈AI도 낮은 정확도를 이유로 2023년 자체 AI 텍스트 판별기 서비스를 중단한 바 있다.