모티프3, 독파모 글로벌 성능평가 47점으로 1위
핵심 요약
모티프3가 독파모 2차 평가에 반영되는 글로벌 AI 성능 시험에서 47점으로 1위를 차지했다. 전체 평가는 벤치마크와 전문가·사용자 평가로 구성돼 글로벌 지표만으로 최종 순위가 정해지지 않는다. 정부는 네 참여팀의 종합 성적을 검토해 다음 주 한 팀의 탈락을 포함한 결과를 발표한다.
국내 독자 AI 파운데이션 모델 프로젝트의 2차 평가에 포함되는 글로벌 성능 시험에서 모티프테크놀로지스의 ‘모티프3’가 47점으로 가장 높은 성적을 거뒀다. 가장 늦게 경쟁에 합류한 모티프가 선두에 오른 가운데 업스테이지 ‘솔라 오픈2’는 37점, SK텔레콤 ‘A.X-K2’는 35점, LG AI연구원 ‘K-엑사원 2.0’은 31점으로 뒤를 이었다.
이번 결과는 1차 평가 때와 순서가 달라졌다. 당시 LG AI연구원은 벤치마크 부문 40점 만점에 33.6점을 받아 가장 앞섰지만, 최신 아티피셜 애널리시스 인텔리전스 인덱스에서는 네 모델 중 가장 낮은 점수를 기록했다. 모티프와 업스테이지가 각각 1위와 2위에 자리하면서 글로벌 벤치마크 점수에서는 두 스타트업이 대기업 참여팀을 앞질렀다.
최신 인덱스 v4.1.1은 지식과 추론, 코딩 역량을 아우르는 9개 시험 결과를 단일 점수로 합산한다. 실제 직업·업무 수행, 은행 업무 도구 활용, 코딩·터미널 운용, 과학 분야 코딩, 고난도 지식·과학·물리학 추론, 지식 정확도와 환각 여부, 장문맥 이해 능력이 평가 대상이다. 과학기술정보통신부는 국내 모델의 성능 시험을 의뢰했으며, 산출된 점수를 독파모 배점 체계에 맞춰 환산할 계획이다.
글로벌 인덱스 성적이 2차 평가의 최종 순위를 확정하는 것은 아니다. 전체 평가는 벤치마크 40점, 전문가 35점, 사용자 25점으로 구성되며, 벤치마크 중 글로벌 인덱스는 25점이고 한국지능정보사회진흥원 자체 시험은 15점이다. 특정 시험에 최적화된 성능과 실제 사용 환경의 차이도 함께 점검 대상에 포함된다. 정부는 모든 항목을 종합해 다음 주 결과를 발표하며, LG AI연구원·SK텔레콤·업스테이지·모티프테크놀로지스 가운데 한 팀이 탈락한다.