모티프3, 독파모 4개 모델 중 글로벌 지수 선두
핵심 요약
모티프3가 글로벌 인텔리전스 지수에서 47점으로 독파모 참여 모델 중 선두에 올랐다. 이번 지표는 2차 평가 총점의 25%만 차지하며 한국어 성능은 측정하지 않는다. 정부는 4개 팀 가운데 1곳을 탈락시키는 2차 평가 결과를 조만간 발표한다.
정부의 독자 인공지능 파운데이션 모델 사업에 후발주자로 합류한 모티프테크놀로지가 글로벌 성능 지표에서 참여 모델 중 가장 높은 점수를 기록했다. 13일 공개된 최신 인텔리전스 지수(AAII) v4.1.1에서 모티프의 ‘모티프3’는 47점을 받아 SK텔레콤과 LG AI연구원, 업스테이지의 모델을 모두 앞섰다.
업스테이지의 ‘솔라 오픈2’는 37점, SK텔레콤의 ‘A.X-K2’는 35점, LG AI연구원의 ‘K-엑사원 2.0’은 31점으로 집계됐다. 지난해 12월 독파모 1차 평가의 벤치마크 종합 1위였던 LG AI연구원은 이번 지표에서 4개 모델 중 최하위로 내려갔다. 모티프3의 47점은 제미나이 3.6 플래시와 GPT-5.6 루나 맥스의 52점에는 못 미치지만 미니맥스 M3의 45점보다는 높다.
모티프3는 총 3140억개의 매개변수를 갖춘 전문가혼합(MoE) 모델이며, 추론 과정에서는 이 가운데 132억개만 활성화한다. 같은 규모로 분류된 오픈웨이트 모델 104개와 비교한 지능 성능 순위에서는 6위에 올랐다. 다만 이번 지표는 에이전트와 코딩, 과학적 추론 등을 측정하는 영어 텍스트 중심 평가로 구성돼 한국어 처리 성능은 반영하지 않는다.
이번 성적만으로 독파모 2차 평가의 최종 순위가 결정되지는 않는다. 총점 100점 가운데 AAII 반영분은 25점이며, 정부 자체 벤치마크 15점과 전문가 평가 35점, 사용자 평가 25점을 합산한다. 공개 시험문제나 유사 데이터에 모델을 맞추는 ‘벤치마크 게이밍’ 가능성 때문에 단일 점수가 실제 서비스 역량 전반을 보여주기 어렵다는 지적도 있다. 정부는 4개 팀 중 1곳을 탈락시키는 2차 평가 결과를 조만간 발표할 예정이다.