데이터 비공개 환경서 AI 라벨 오류 선별
핵심 요약
포스텍 연구팀이 원본 데이터를 공유하지 않고 AI 학습 데이터의 라벨 오류를 선별하는 기술을 개발했다. GPAEC 알고리즘은 가중치 기울기와 가우시안 프로세스를 활용하며 오류 확률과 0.86의 상관관계를 보였다. 의료·금융·개인 기기처럼 개인정보 보호가 필요한 분산 AI 환경에서 활용 가능성이 제시됐다.
김광인 포스텍 인공지능대학원·전자전기공학과 교수 연구팀이 원본 데이터를 공유하지 않고도 잘못된 라벨이 붙은 데이터를 선별하는 분산 인공지능 기술을 개발했다. 재검수 효과가 큰 데이터를 우선 찾아 적은 비용으로 AI 성능을 높이는 방식이다. 연구 성과는 국제학회 ‘AAAI 2026’ 메인 테크니컬 트랙 논문으로 게재됐다.
연구팀은 각 데이터가 AI를 어느 방향으로 변화시키는지 나타내는 ‘가중치 기울기’를 원본 대신 활용했다. 서버가 기관별 기울기를 비교해 학습 패턴을 파악한 뒤, 가우시안 프로세스 통계 기법을 결합한 ‘가우시안 프로세스 능동 오류 정정(GPAEC)’ 알고리즘으로 다른 데이터와 유독 동떨어진 항목을 추려낸다. 실험에서 데이터가 튀는 정도와 라벨 오류 확률 사이의 상관관계는 0.86으로 나타났다.
AI 학습 데이터에는 고양이나 강아지처럼 정답을 알려주는 라벨이 필요하지만, 잘못된 라벨은 모델이 엉뚱한 규칙을 익히게 해 성능을 떨어뜨린다. 모든 라벨을 사람이 확인하려면 시간과 비용이 커 수정 효과가 높은 항목부터 점검하는 능동 오류 정정이 활용되고 있다. 다만 병원·기업·개인 기기가 개인정보 때문에 데이터를 외부로 내보낼 수 없는 분산 환경에서는 기존 접근에 제약이 있었다.
GPAEC는 유사한 오류가 중복 선택되지 않도록 서로 다른 유형을 고르게 골라내며, 기관이 보고한 성적과 실제 기울기가 어긋날 경우 신뢰하기 어려운 보고로 판단해 제외한다. 환자 정보를 공유하지 않는 병원 간 진단 AI 학습이나 개인정보 유출을 막아야 하는 스마트폰 기반 학습에 적용할 수 있다. 김 교수는 의료·금융 등 개인정보 보호가 중요한 분야의 신뢰할 수 있는 AI 개발에 기여하기를 기대했다. 연구는 과학기술정보통신부 재원의 한국연구재단 사업과 정보통신기획평가원의 지원으로 수행됐다.