클로드 생성물에 숨은 표식…탐지 한계도 뚜렷
핵심 요약
앤트로픽이 클로드 생성 글과 파일에 보이지 않는 표시를 적용한다. 텍스트에는 워터마크를, 이미지 등 파일에는 C2PA 표준을 활용한다. 교정·번역에도 표시될 수 있고 재작성하면 사라지는 등 탐지 한계가 남아 있다.
앤트로픽이 인공지능 모델 클로드가 생성한 글과 파일에 사람 눈으로 확인할 수 없는 표시를 기본 적용한다. 지난 2일 발효된 유럽연합 AI법의 ‘AI 생성 콘텐츠 투명성 실천규약’을 이행하기 위한 조치다. 8월 2일 이후 출시되는 모든 클로드 모델부터 적용하며 기존 모델도 순차 지원한다. 구글·메타·마이크로소프트·오픈AI도 이 규약을 준수하기로 했다.
텍스트에는 복사해 붙여넣거나 일부 문장을 고친 뒤에도 남을 수 있는 워터마크가 모델 단계에서 삽입된다. 클로드 API와 클로드, 클로드 코드, 클로드 코워크, 클로드 태그 등 이용 제품과 관계없이 같은 방식이 적용된다. 이미지 같은 파일에는 제작 도구 등의 정보를 암호화해 붙이는 개방형 표준 C2PA가 사용되며, 서명 이후 발생한 파일 조작도 감지할 수 있다.
텍스트 워터마크의 구체적인 작동 원리와 탐지 정확도는 공개되지 않았다. 일반적으로는 거대언어모델이 다음 토큰을 고르는 확률을 비밀 규칙으로 미세 조정해 특정 단어군이 더 자주 등장하도록 하고, 탐지기가 이 통계적 편향을 읽는 방식이 활용된다. 구글 딥마인드의 신스ID가 상용 서비스에 통합된 대표 사례이며, C2PA는 어도비·구글·오픈AI 등이 이미 채택했다.
표시가 도입되면 학교 과제나 기업 보고서, 언론 기사에 클로드가 만든 문장이 포함됐는지 확인할 통로가 생긴다. 다만 교정·번역·요약만 맡겨도 표시될 수 있고, 대폭 수정하거나 다른 언어로 번역·재작성하면 흔적이 사라질 수 있다. 짧은 문장에서는 신호 탐지가 어렵고 파일도 형식 변경이나 화면 캡처 과정에서 꼬리표가 없어질 수 있다. 다른 회사 AI의 글은 식별하지 못하며 오탐·미탐 비율과 탐지 도구도 아직 공개되지 않았다. 수노와 서브스택도 AI 콘텐츠 표시·탐지 기능을 도입하고 있다.