AI 3사 추론 블록, 약한 모델로 평문 복원
핵심 요약
암호화된 AI 추론 블록을 약한 모델에 주입해 평문으로 복원하는 공격이 확인됐다. 공개 저장소의 블록 31만5,320개에서 개인정보 367건과 자격증명 182건이 복구됐다. 세 업체가 기존 공격 경로를 완화했지만 완전한 차단에는 API 구조 변경이 필요하다.
프론티어 인공지능 모델의 내부 추론을 담은 암호화 블록을 다른 모델에 주입해 평문으로 복원하는 공격 기법이 공개됐다. 8월 10일 arXiv에 게재된 116쪽 논문에는 튀빙겐 ELLIS 연구소와 막스플랑크 지능시스템 연구소, MATS 리서치, 스니크 소속 연구자 8명이 참여했다. 앤트로픽과 오픈AI, 구글의 API에서 모두 취약점이 확인됐다.
세 업체는 단계별 사고 과정을 서버에 저장하는 대신 암호화한 블록을 사용자에게 반환하고, 후속 요청에서 이를 다시 받는 구조를 운용했다. 이 블록은 같은 업체의 다른 사용자와 세션, 모델 사이에서도 호환됐다. 강한 모델의 블록을 안전장치가 느슨한 약한 모델에 넣자 내용이 평문으로 출력됐다. 클로드 오퍼스 4.8은 하이쿠 4.5로, GPT-5.6 솔은 GPT-5.6 루나로 복원됐으며 제미나이 계열에서도 같은 방식이 작동했다.
공개된 깃허브와 허깅페이스 저장소에서 수집한 추론 블록 31만5,320개를 분석한 결과, 개인정보 367건과 자격증명 182건이 복구됐다. 개발자가 올린 로그에 암호화 블록이 남아 있던 사례들이다. 공격 방식에는 모델 증류 방지 우회, 공개 로그를 이용한 대규모 정보 추출, 최종 답변에서 거절됐지만 추론에 남은 위험 정보의 노출, 악성 지시를 블록에 숨겨 다른 에이전트를 오염시키는 보이지 않는 프롬프트 주입이 포함됐다.
세 업체는 책임 공개 이후 서버 측 완화 조치를 배포해 기존 재현 시나리오를 차단했다. 다만 완전한 방어에는 API 구조를 근본적으로 바꿔야 한다는 지적이 남았다. 중국 오픈가중치 모델 키미 K3가 클로드 오퍼스 4.8과 GPT-5.6 솔의 추론과 매우 유사한 출력을 낸 사례도 제시됐지만, 해당 추론이 실제 학습에 사용됐다는 인과관계는 입증되지 않았다. 취약점은 존스홉킨스대 연구자 매튜 그린이 5월 29일 처음 발견했으며 이후 공격 기법이 체계화됐다.