AI가 글과 이미지 단서 잇는 ‘CRIT’ 구축
핵심 요약
고려대 연구팀이 글과 이미지에 흩어진 단서를 연결하는 AI 학습·평가 체계 CRIT를 개발했다. 약 27만1000건의 데이터로 학습한 70억개 매개변수 모델은 자연 이미지·과학논문·영상 평가에서 모두 성능이 향상됐다. 연구 성과는 CVPR 2026에 채택됐으며 문헌·도표 분석과 교육, 정보 검색, AI 비서 등에 활용될 수 있다.
고려대 컴퓨터학과 서홍석 교수 연구팀이 텍스트와 이미지 곳곳에 분산된 단서를 단계적으로 연결해 결론을 도출하는 인공지능 학습·평가 체계 ‘CRIT’를 개발했다고 6일 밝혔다. CRIT는 두 종류의 자료를 함께 분석하는 교차 모달 다단계 추론 능력을 높이는 동시에 해당 능력을 실제로 갖췄는지 검증하도록 설계된 데이터셋이다.
연구팀은 이미지와 글에 나오는 인물·사물과 각각의 속성, 개체 사이 관계를 그래프로 구조화한 뒤 두 자료를 모두 확인해야 풀 수 있는 질문과 정답을 자동 생성했다. 어느 한쪽 자료만으로 답을 맞히거나 실제 자료에 없는 내용을 근거로 결론을 내릴 수 없도록 문제를 구성했다. 자연 이미지와 영상 장면, 과학논문 및 도표를 아우르는 데이터는 약 27만1000건이며 평가용 문제는 사람이 다시 검증했다.
사진 속 사물을 식별하고 문장 내용을 파악하는 시각·언어 AI의 능력은 빠르게 향상됐지만, 여러 이미지와 문장에 흩어진 정보를 찾아 연계하는 과제에서는 상대적으로 성능이 낮았다. 기존 평가 문항 중에는 이미지나 텍스트 한쪽만 살펴도 정답을 구할 수 있는 경우가 있어 두 정보를 함께 활용했는지 판별하기 어려웠다. CRIT는 이런 한계를 줄이고 평가의 일관성을 높이는 데 초점을 맞췄다.
CRIT로 학습한 매개변수 70억개 규모 AI 모델의 자연 이미지 ‘정확 일치’ 점수는 28.3점에서 58.6점으로 올랐다. 과학논문 종합 답변 점수는 9.6점에서 22.5점으로 두 배 이상 상승했고 영상 분야도 27.8점에서 42.2점으로 개선됐다. 성준영 제1저자를 비롯해 류승우·김민준·안수민 연구원과 구글 딥마인드의 아르샤 나그라니 연구원이 논문에 참여했으며, 학부생들이 주요 저자로 이름을 올렸다. 성과는 6월 3∼7일 미국 덴버에서 열린 CVPR 2026에 채택돼 발표됐다. 연구팀은 과학 문헌·도표 분석과 교육 콘텐츠 이해, 복수 문서 정보 검색, 이미지와 글을 처리하는 AI 비서 등에 활용할 수 있을 것으로 기대했다.