독파모 후보 모델 평가서 스타트업 약진
핵심 요약
모티프3가 AAII 47점으로 독파모 2차 평가 참여 모델 중 선두에 올랐다. 솔라 오픈2, 에이닷엑스-K2, K-엑사원 2.0이 차례로 뒤를 이었다. AAII는 전체 평가의 일부이며 전문가·사용자 평가를 합친 최종 결과는 조만간 발표된다.
정부의 독자 인공지능 파운데이션 모델 프로젝트 2차 평가에 참여한 스타트업들이 글로벌 성능 벤치마크에서 대기업을 앞섰다. 13일 공개된 아티피셜 애널리시스 인텔리전스 지수에서 모티프테크놀로지스의 거대언어모델 ‘모티프3’가 47점으로 참여사 모델 가운데 가장 높은 점수를 기록했다.
업스테이지가 2차 평가용으로 개발한 ‘솔라 오픈2’는 37점으로 뒤를 이었다. SK텔레콤의 ‘에이닷엑스-K2’는 35점, LG AI연구원의 ‘K-엑사원 2.0’은 31점을 받았다. LG AI연구원은 1차 평가 당시 벤치마크 종합 점수 33.6점으로 선두였지만, 이번 글로벌 지수에서는 국내 참여 모델 중 가장 낮은 점수에 머물렀다.
다만 이 순위가 독파모 2차 평가의 최종 결과를 의미하지는 않는다. AAII는 지식과 추론, 코딩 등 여러 영역의 개별 벤치마크를 하나의 점수로 환산해 평가 항목 구성에 따라 결과가 크게 달라질 수 있다. 실제 성능 개선보다 벤치마크 점수 상승에 집중하는 ‘벤치맥싱’ 논란도 있으며, 한국어를 포함한 다국어 이해 능력과 산업별 과업 성능, 운영 효율을 이 지수만으로 판단하기 어렵다는 한계도 있다.
독파모 2차 평가에서 벤치마크가 차지하는 배점은 전체 100점 중 40점이다. AAII에 25점, 한국지능정보사회진흥원 벤치마크에 15점이 배정됐고 전문가 평가 35점과 사용자 평가 25점이 나머지를 구성한다. 정부는 12일 마감한 국민 평가를 끝으로 전체 절차를 정리해 결과를 조만간 발표할 예정이다. 참여사 네 곳 가운데 한 팀이 탈락하고 세 팀이 다음 단계로 진출한다.