글과 영상 함께 읽는 AI 추론 체계 ‘CRIT’ 개발
핵심 요약
텍스트와 이미지의 단서를 단계적으로 연결하는 AI 학습·평가 체계 CRIT가 개발됐다. CRIT로 학습한 모델은 영상과 과학논문 등에서 추론 성능이 기존보다 최대 두 배 향상됐다. 연구 성과는 CVPR 2026에서 발표됐으며 과학 문헌 분석과 AI 비서 등에 활용될 수 있다.
글과 사진에 흩어진 단서를 잇고 여러 단계의 판단을 거쳐 답을 찾는 인공지능 학습·평가 체계가 개발됐다. 서홍석 고려대 컴퓨터학과 교수 연구팀이 만든 ‘CRIT’는 텍스트와 이미지를 함께 처리하는 교차모달 연쇄 추론을 겨냥한다. CRIT로 학습한 모델은 일상 영상과 이미지 분석부터 과학 논문과 도표 해석까지 다양한 과제에서 기존 대비 최대 두 배 높은 추론 성능을 기록했다.
CRIT는 자연 이미지와 영상, 과학논문 등에서 글과 시각 정보를 동시에 분석해야 풀 수 있는 문제를 자동으로 생성한다. 자료에 등장하는 개체와 속성, 개체 사이의 관계를 그래프로 구조화하고, 이를 토대로 질문과 정답을 만드는 방식이다. 특정 단서 하나만 보고 답을 맞히기 어렵게 설계해 AI가 서로 다른 형태의 정보를 실제로 결합하는지 정밀하게 확인하고, 생성 문제의 일관성과 신뢰성도 높였다.
기존 AI는 문장이나 이미지를 개별적으로 이해하는 작업에서는 높은 성능을 보였지만, 서로 다른 정보 형식을 오가며 단서를 연속해서 연결하는 문제에서는 한계가 있었다. 기존 평가 과제 가운데 일부는 전체 추론 과정을 거치지 않고 특정 정보만 활용해도 정답을 낼 수 있어 복합 추론 능력을 정확히 가려내기 어려웠다. 최신 AI 모델 역시 텍스트와 이미지를 함께 다루는 복합 추론 과제에서는 전반적으로 낮은 성능을 보였다.
CRIT 학습 효과는 하나의 데이터셋에 국한되지 않고 여러 환경에서 복합 정보 이해와 추론 능력을 전반적으로 끌어올리는 형태로 나타났다. 활용 분야로는 과학 문헌 분석, 교육 콘텐츠 이해, 복합 문서 검색, 시각·언어 기반 AI 비서가 제시됐다. 이번 연구는 국제학술대회 ‘CVPR 2026’에서 발표됐으며, 성준영 학부생이 제1저자로 참여했다. 김민준·유승우 학부생과 안수민 석박통합과정 연구자도 공저자로 이름을 올렸고, 서 교수는 교신저자를 맡았다.