이미지·텍스트 잇는 AI 추론 체계 ‘CRIT’ 개발
핵심 요약
고려대 연구팀이 이미지와 텍스트의 단서를 단계적으로 연결하는 AI 체계 CRIT를 개발했다. CRIT 학습 후 영상·이미지와 논문·도표 해석 분야의 추론 성능이 최대 두 배 이상 향상됐다. 연구 결과는 CVPR 2026에서 발표됐으며 과학 문헌과 교육·검색·AI 비서 분야 활용이 기대된다.
고려대학교 서홍석 컴퓨터학과 교수 연구팀이 텍스트와 이미지를 함께 분석해 여러 단계로 결론을 도출하는 인공지능 학습·평가 체계 ‘CRIT’를 개발했다고 6일 밝혔다. 서로 다른 형식의 단서를 연결하는 교차 모달·멀티홉 추론 능력을 높이고, 모델이 실제로 복합적인 사고 과정을 수행하는지 정밀하게 측정하도록 설계됐다.
CRIT는 자연 이미지와 영상, 과학논문 등에서 문자와 시각 정보를 모두 활용해야 풀 수 있는 문제를 자동 생성한다. 연구팀은 자료에 등장하는 개체와 속성, 개체 사이의 관계를 그래프로 구조화한 뒤 질문과 정답을 만드는 방식을 적용했다. 이를 통해 생성된 문제의 일관성과 근거를 확보하고, 여러 정보가 서로 보완되도록 문제 구조를 구성했다.
기존 AI는 글이나 그림에 담긴 개별 정보를 파악하는 데 강점을 보였지만, 흩어진 단서를 순차적으로 연결하는 과제에서는 한계를 드러냈다. 평가 문제 가운데 일부는 특정 정보만 확인해도 정답을 고를 수 있어 실질적인 복합 추론 능력을 가려내기 어려웠다. CRIT 데이터로 학습한 AI는 일상 영상·이미지 분석과 논문·도표 해석 등 여러 영역에서 기존보다 최대 두 배 이상 높은 추론 성능을 기록했다.
연구팀은 이번 체계가 과학 문헌 분석과 교육 콘텐츠 이해, 복합 문서 검색, 시각·언어 기반 AI 비서 등 근거 중심의 추론이 필요한 환경에 활용될 수 있을 것으로 내다봤다. 연구 결과는 6월 3일부터 7일까지 미국 콜로라도 덴버에서 열린 국제 학술대회 ‘CVPR 2026’에서 발표됐다. 학부생들이 제1저자와 공저자로 참여했으며, 연구는 ICT명품인재양성사업과 AI스타펠로우십지원, 대학ICT연구센터의 지원을 받았다.