독파모 성능지표서 스타트업 두 곳 선두권
핵심 요약
독파모 참여 모델의 글로벌 성능 지표에서 모티프와 업스테이지가 1·2위를 기록했다. 해당 지표는 최종 평가 100점 가운데 25점만 반영된다. 정부는 국민 평가를 마치고 다음 단계에 진출할 3개 팀을 조만간 발표한다.
국가대표 인공지능 모델을 가리는 독자 AI 파운데이션 모델 프로젝트 2차 평가를 앞두고, 글로벌 성능 지표에서 스타트업 두 곳이 대기업 참여사보다 높은 점수를 받았다. 13일 공개된 아티피셜 애널리시스 인텔리전스 지수에서 모티프테크놀로지스의 ‘모티프 3’가 47점으로 4개 모델 중 1위에 올랐다.
업스테이지의 ‘솔라 오픈2’는 37점으로 뒤를 이었고 SK텔레콤의 ‘에이닷엑스(A.X)-K2’는 35점을 기록했다. 지난해 12월 1차 평가 당시 벤치마크 종합 33.6점으로 선두였던 LG AI연구원의 ‘K-엑사원(EXAONE) 2.0’은 이번 지수에서 31점으로 가장 낮았다. 모티프는 2차 평가부터 새로 참여한 팀으로, 제한된 기간에 3140억개 규모 모델을 처음부터 개발하면서 3개 모달리티 모듈 개발도 병행했다.
이번 지수 순위가 독파모 2차 평가의 최종 순위로 그대로 이어지는 것은 아니다. 전체 100점 가운데 벤치마크 평가는 40점이며, 아티피셜 애널리시스 지수가 25점, 한국지능정보사회진흥원 벤치마크가 15점을 차지한다. 나머지는 전문가 평가 35점과 사용자 평가 25점으로 구성돼 모델 성능 외의 평가 결과도 최종 선발에 영향을 미친다.
이 지수는 지식·추론·코딩 분야의 여러 벤치마크를 하나의 점수로 환산하지만, 평가 항목 구성과 버전 변경에 따라 10~20점가량 움직일 수 있고 수학 등 특정 분야가 제외되기도 한다. 한국어와 다국어 이해력, 산업별 과업 성능, 운영 효율도 충분히 반영하지 못한다. 취약 항목을 집중 공략해 점수를 높이는 ‘벤치맥싱’ 논란 역시 남아 있다. 정부는 12일 국민 평가를 마감했으며, 조만간 최종 결과를 발표해 4개 참여사 가운데 다음 단계에 진출할 3개 팀을 결정할 예정이다.