모티프3, 독파모 후보 중 글로벌 지표 1위
핵심 요약
모티프3가 글로벌 AI 종합 성능 지표에서 47점으로 독파모 참여 모델 중 1위를 기록했다. 최종 평가는 글로벌·국내 벤치마크와 전문가·사용자 평가를 합산해 결정된다. 국민 평가가 12일 종료됐으며 4개 팀 가운데 3개 팀이 다음 단계에 진출한다.
국가대표 인공지능을 선발하는 ‘독자 AI 파운데이션 모델’ 2차 평가를 앞두고 모티프테크놀로지스의 ‘모티프3’가 글로벌 종합 성능 지표에서 참여 모델 중 가장 높은 점수를 받았다. 13일 공개된 아티피셜 애널리시스의 AI 모델 종합 성능 지표에서 모티프3는 47점을 기록해 업스테이지와 SK텔레콤, LG AI연구원의 모델을 모두 앞섰다.
업스테이지의 ‘솔라 오픈2’는 37점으로 2위에 올랐고, SK텔레콤의 ‘A.X K2’는 35점, LG AI연구원의 ‘K-엑사원’은 31점을 받았다. 모티프3는 2위와 10점, 4위와 16점 차이를 냈으며, 비교 가능한 전체 모델의 중간값인 16점도 크게 웃돌았다. 최신 지표는 지식뿐 아니라 코딩, 과학 문제 해결, 에이전트 기반 업무 수행 능력 등을 함께 측정한다.
이번 성적이 독파모 2차 평가의 최종 순위를 확정하는 것은 아니다. 총점 100점 가운데 벤치마크 평가는 40점으로, 글로벌 종합 성능 지표가 25점이고 한국지능정보사회진흥원 벤치마크가 15점이다. 여기에 전문가 평가 35점과 사용자 평가 25점이 반영된다. 단일 지표에서 벌어진 격차가 나머지 평가 결과에 따라 달라질 수 있는 구조다.
해당 종합 지표는 여러 벤치마크를 하나의 점수로 묶어 비교하기 쉽지만, 평가 항목의 구성이나 개편에 따라 점수가 크게 움직일 수 있고 한국어 성능을 별도로 측정하지 않는 한계가 있다. 특정 시험에 모델을 최적화하는 ‘벤치맥싱’ 문제도 제기돼 정부는 국내 벤치마크와 전문가·사용자 평가를 병행했다. 12일 국민 평가가 끝나면서 절차는 마무리됐으며, 정부는 결과를 조만간 발표한다. 참여한 4개 팀 중 3개 팀만 다음 단계에 진출한다.