모티프 3, 독파모 후보 중 글로벌 지표 최고점
핵심 요약
모티프 3가 글로벌 AI 성능 지표에서 독파모 참여 모델 중 최고인 47점을 기록했다. 해당 지표는 독파모 2차 평가 100점 가운데 25점에 반영된다. 한국어 미반영과 벤치맥싱 논란 속에 4개 팀 중 3개 팀이 다음 단계로 진출한다.
정부의 독자 인공지능 파운데이션 모델 프로젝트 2차 평가 결과 발표를 앞두고 스타트업 모티프테크놀로지스가 글로벌 성능 지표에서 참여사 중 가장 높은 점수를 받았다. 13일 공개된 최신 아티피셜 애널리시스 인텔리전스 지수에서 ‘모티프 3’는 47점을 기록하며 대기업과 다른 스타트업의 모델을 앞섰다. 다만 이 지표는 전체 심사 항목의 일부여서 최종 순위를 뜻하지는 않는다.
독파모 참여 모델별 점수는 업스테이지의 ‘솔라 오픈2’가 37점, SK텔레콤의 ‘에이닷엑스-K2’가 35점, LG AI연구원의 ‘K-엑사원 2.0’이 31점이었다. 아티피셜 어낼러시스는 수학과 과학, 코딩, 추론 등 여러 능력을 종합해 AI 모델의 성능을 분석한다. 모티프 3는 총 3140억 개 파라미터를 갖춘 거대언어모델로, 약 5개월 동안 사전학습부터 후처리까지 모든 개발 과정을 처음부터 진행해 완성됐다.
모티프테크놀로지스는 이번 결과를 토대로 미국과 중국의 프론티어 모델과 대등하게 경쟁할 수 있는 모델을 완성하겠다는 목표를 제시했다. 그러나 독파모 2차 심사는 단일 해외 지표만으로 결정되지 않는다. 총점 100점 가운데 벤치마크 평가가 40점이며, 세부적으로 해당 글로벌 지표 25점과 한국지능정보사회진흥원 벤치마크 15점이 반영된다. 여기에 전문가 평가 35점과 사용자 평가 25점이 더해진다.
평가 지표의 한계도 최종 결과를 가를 변수로 남아 있다. 이번 글로벌 지수에는 한국어 성능이 반영되지 않아 국내 독자 모델의 역량을 온전히 보여주기 어렵다는 지적이 제기된다. 특정 벤치마크에 맞춘 데이터와 사후학습으로 점수를 집중적으로 높이는 ‘벤치맥싱’이 확산하면서 수치의 신뢰성을 둘러싼 논란도 이어지고 있다. 정부는 2차 평가 결과를 조만간 발표하며, 현재 참여한 4개 팀 가운데 3개 팀이 다음 단계로 진출한다.