AI 워터마크 도입 확대에도 탐지 신뢰성은 과제
핵심 요약
앤스로픽이 EU AI법의 투명성 의무에 대응해 클로드에 기계 판독형 워터마크를 도입했다. AI 업계의 적용 범위가 넓어지고 있지만 재작성과 번역, 단어 교체로 탐지 성능이 낮아질 수 있다. 저비용 위조 공격과 공개 제거 도구까지 등장해 워터마크의 신뢰성 확보가 과제로 남았다.
생성형 인공지능이 만든 콘텐츠에 식별 흔적을 심는 워터마크가 AI 업계 전반으로 확산하고 있다. 앤스로픽은 이달 2일 발효된 유럽연합 AI법의 투명성 의무에 맞춰 클로드에 기계 판독형 워터마크를 도입했다. 다만 단어나 문장 구조를 바꾸면 흔적이 약해지고 별도의 제거 기술까지 등장해, AI 생성물을 완벽하게 가려내는 수단으로 쓰기에는 한계가 확인되고 있다.
앤스로픽의 방식은 사람이 읽을 때 드러나지 않는 통계적 패턴을 텍스트에 남긴다. AI가 문장을 만들며 특정 단어를 선택할 확률을 미세하게 높이고, 탐지기가 해당 단어의 출현 빈도를 분석해 워터마크를 판정하는 구조다. 앤스로픽은 적용 대상을 모든 AI 모델로 순차 확대하고 제3자가 확인할 수 있는 탐지 도구와 기술 문서도 공개할 계획이다. 구글은 신스ID로 제미나이의 텍스트와 이미지에 흔적을 넣고 있으며, 오픈AI는 이미지에 출처 정보를 담는 C2PA 메타데이터를 적용하고 있다. 수노와 서브스택도 AI 제작 콘텐츠를 식별하고 있다.
탐지 성능은 콘텐츠가 가공될수록 떨어질 수 있다. 단어와 문장 구조를 함께 고치는 강도 높은 바꿔쓰기는 텍스트에 남은 통계적 규칙을 훼손할 수 있다. 신스ID 역시 짧은 글이나 재작성·번역된 문장, 사실 질문에 대한 응답에서는 성능이 낮아질 가능성이 있다. 워터마크를 만들기 위해 AI가 원래 선택하려던 단어의 확률을 인위적으로 조정하면 표현 선택이 제한돼 결과물의 품질이 저하될 수 있다는 우려도 제기된다.
워터마크 규칙을 역으로 추정해 흔적을 지우거나 위조하는 기술도 시험 단계를 넘어 구체화하고 있다. 스위스 취리히연방공대 연구진은 워터마크가 적용된 AI에 반복적으로 질문해 생성 규칙을 알아내는 ‘워터마크 스틸링’ 공격을 실험했다. 50달러 미만의 비용으로 기존 표시를 없애거나 사람이 작성한 글에 가짜 흔적을 심는 공격에서 평균 80%의 성공률을 기록했다. 깃허브에는 지난 6월 신스ID 같은 비가시 표시와 C2PA 메타데이터, 워터마크 로고를 AI 생성 이미지에서 제거할 수 있는 오픈소스 도구도 공개됐다.