글로벌 AI 지표서 모티프 47점 선두
핵심 요약
Motif 3가 AAII v4.1.1에서 47점으로 국내 참여 모델 중 최고점을 기록했다. 업스테이지는 37점, SK텔레콤은 35점, LG AI연구원은 31점을 받았다. 정부는 국내외 벤치마크와 전문가·사용자 평가를 종합해 네 팀 중 한 팀을 탈락시킬 예정이다.
국내 ‘AI 국가대표’ 선발을 위한 독자 AI 파운데이션 모델 사업에 참여한 네 개 모델을 글로벌 성능 지표로 비교한 결과, 모티프테크놀로지스의 ‘Motif 3’가 가장 높은 점수를 기록했다. 13일 공개된 ‘Artificial Analysis Intelligence Index(AAII) v4.1.1’ 평가에서 Motif 3는 47점을 받아 나머지 세 모델을 앞섰다.
두 번째로 높은 점수는 37점을 얻은 업스테이지의 ‘Solar Open2 250B’였다. SK텔레콤의 ‘A.X-K2’는 35점으로 그 뒤를 이었고, LG AI연구원의 ‘K-EXAONE 2.0 0803’은 31점을 기록했다. 1위와 2위의 격차는 10점이며, 참여 모델 네 개가 동일한 평가 체계에서 각각 47점, 37점, 35점, 31점으로 나뉘었다.
AAII는 인공지능 모델의 추론 능력과 지식 수준, 코딩 역량 등 전반적인 성능을 종합해 산출하는 지표다. 이번 최신 버전에는 ‘GDPval-AA v2’, ‘Terminal-Bench v2.1’, ‘SciCode’, ‘Humanity's Last Exam’, ‘GPQA Diamond’를 포함해 모두 9개 평가가 반영됐다. 국내 사업에 참여한 모델들을 같은 글로벌 기준으로 비교했다는 점이 이번 결과의 핵심이다.
현재 독파모 사업에서는 모티프테크놀로지스와 업스테이지, SK텔레콤, LG AI연구원 등 네 팀이 경쟁하고 있다. 다만 이번 AAII 성적만으로 사업의 최종 순위가 정해지는 것은 아니다. 독파모 평가는 글로벌 벤치마크뿐 아니라 국내 벤치마크, 전문가 평가, 사용자 평가를 함께 종합하는 방식으로 진행된다. 정부는 이 평가 절차를 거쳐 네 팀 가운데 한 팀을 탈락시킬 예정이다.