KAIST, AI 감각 혼선 줄이는 기술 개발…재학습 없이 환각 감소
핵심 요약
KAIST 연구팀이 멀티모달 AI의 감각 혼선을 줄이는 DNA와 MAD 기술을 개발했다. 두 기술은 대규모 재학습 없이 센서 이해와 감각 선택을 개선해 환각을 줄인다. 자율주행, 구조 로봇, 의료영상 분석 등 다양한 분야에 적용이 기대된다.
한국과학기술원(KAIST) 연구팀이 멀티모달 대형 언어모델(MLLM)이 시각·청각 등 여러 감각 정보를 혼동하며 발생하는 '환각'을 줄이는 두 가지 핵심 기술을 개발했다. 전기및전자공학부 노용만 교수 연구팀은 카메라와 각종 센서의 물리적 특성을 정확히 이해하도록 하는 '센서 이해 AI' 기술(DNA)과 시각·청각 정보가 뒤섞일 때 생기는 오류를 방지하는 '감각 혼선 방지' 기술(MAD)을 마련했다고 31일 밝혔다. 이번 성과는 별도의 대규모 재학습 없이도 AI 신뢰성을 크게 높일 수 있는 것으로 평가된다.
연구팀이 공개한 DNA 기술은 열화상, 깊이 영상, 엑스레이(X-ray) 등 다양한 센서가 담은 물리적 의미를 AI가 이해하도록 돕는 최적화 기법이다. 기존 AI는 열화상에서 밝게 보이는 부분을 단순한 빛으로 오인하는 경우가 있었지만, 새로운 학습 기술을 적용해 열과 거리 같은 물리 정보를 파악함으로써 어둠이나 연기 속에서도 사물 인식 정확도를 높였다. MAD 기술은 AI가 질문에 답할 때 영상과 소리 중 어느 감각에 집중해야 하는지 스스로 판단하도록 설계해, 예컨대 자동차 영상만 있고 소리가 없을 때 '엔진 소리가 들린다'고 답하는 식의 감각 혼선을 효과적으로 차단한다.
이번 연구는 AI를 처음부터 다시 학습시키는 대신 적은 데이터와 간단한 적용 방식으로 성능을 개선한 점에서 주목된다. DNA 기술은 소량의 데이터만으로 다양한 센서를 이해하도록 했고, MAD 기술은 기존 AI에 프로그램을 추가하듯 바로 적용할 수 있어 시간과 비용을 크게 절감하면서 산업 현장에 빠르게 도입할 수 있다. 연구팀은 AI가 스스로 신뢰할 감각을 선택할 때 환각이 크게 줄어든다는 점과, 정답만 알려주는 학습보다 오답 원인을 함께 가르칠 때 감각 오류 감소에 더 효과적이라는 사실도 확인했다.
이번 기술은 자율주행차가 밤이나 안개 속에서 보행자와 차량을 정확히 인식하는 데 활용될 수 있고, 연기로 시야가 가려진 화재 현장에서 생존자를 찾는 구조 로봇이나 열화상 카메라를 장착한 드론에도 적용이 기대된다. 공항 보안검색의 엑스레이 영상 분석과 병원에서 CT·MRI·엑스레이 등 여러 의료영상을 함께 판독하는 AI의 정확성과 신뢰성 향상에도 기여할 전망이다. 노용만 교수는 멀티모달 AI가 실제 환경에서 쓰이려면 다양한 센서 특성을 정확히 이해하고 감각 정보를 혼동하지 않아야 한다며, 이번 연구가 대규모 재학습 없이도 감각 편향과 환각을 줄여 실생활과 산업 현장에서 믿고 사용할 수 있는 기반을 마련했다고 강조했다.