AI 성능지수서 스타트업 약진…최종 순위는 미정
핵심 요약
모티프테크놀로지스와 업스테이지가 글로벌 AI 성능 지수에서 각각 1위와 2위를 기록했다. 해당 지수는 전체 평가의 일부이며 한국어 성능과 실제 활용 능력을 온전히 반영하지 않는다. 국민 평가가 마감된 가운데 최종 평가를 통과한 3개 팀이 다음 단계로 진출한다.
국가대표 인공지능을 가리는 독자 AI 파운데이션 모델 프로젝트 2차 평가 과정에서 스타트업 모델들이 글로벌 성능 지표 상위권을 차지했다. 13일 확인된 아티피셜 애널리시스 인텔리전스 지수 최신 점수는 모티프테크놀로지스의 ‘모티프 3’가 47점으로 가장 높았고, 업스테이지의 ‘솔라 오픈2’가 37점으로 뒤를 이었다.
SK텔레콤의 ‘에이닷엑스(A.X)-K2’는 35점, LG AI연구원의 ‘K-엑사원(EXAONE) 2.0’은 31점을 기록했다. 지난해 12월 1차 평가에서 벤치마크 종합 33.6점으로 선두였던 LG AI연구원이 이번 지표에서는 최하위에 놓였다. 다만 이 순위는 2차 평가의 일부 항목만 보여주는 수치여서 실제 경쟁력이나 최종 결과로 단정할 수 없다.
2차 평가에서 벤치마크 배점은 총점 100점 가운데 40점이며, 글로벌 지수 25점과 한국지능정보사회진흥원 벤치마크 15점으로 나뉜다. 전문가 평가 35점과 사용자 평가 25점도 별도로 반영된다. 글로벌 지수는 지식·추론·코딩 등 여러 시험을 하나의 수치로 환산하지만, 구성 항목에 따라 결과가 크게 달라진다. 특정 분야가 빠지거나 주요 항목이 교체되면 10~20점가량 변동할 수 있고 한국어 성능도 반영하지 않는다.
다국어 이해력과 산업별 과업 수행 능력, 운영 효율은 이 지수만으로 판단하기 어렵다. 취약 항목을 집중 공략해 실제 활용 성능과 무관하게 점수를 높이는 ‘벤치맥싱’ 논란도 이어지고 있다. 안드레이 카파시는 지난해 연간 보고서에서 벤치마크에 대한 신뢰를 잃었다고 밝혔고, 국내 업계에서도 점수가 실제 성능을 보장하지 않는다는 견해가 제기됐다. 정부는 전문가·이용자 평가로 과적합 문제를 보완할 수 있다고 보고 있으며, 12일 국민 평가를 마감한 뒤 결과를 조만간 발표한다. 참여사 4곳 중 3팀이 다음 단계에 진출한다.