독파모 성능지수서 스타트업 약진…최종 순위는 미정
핵심 요약
글로벌 AI 성능 지수에서 모티프테크놀로지스와 업스테이지가 각각 1위와 2위를 기록했다. 해당 지수는 전체 평가의 일부이며 한국어 성능과 실제 운영 역량을 충분히 반영하지 않는다. 국민 평가를 마친 정부는 조만간 3개 생존 팀을 발표한다.
국가대표 인공지능 모델을 가리는 독자 AI 파운데이션 모델 프로젝트 2차 평가 과정에서 스타트업 모델들이 글로벌 성능 지표 상위권을 차지했다. 13일 공개된 아티피셜 애널리시스 인텔리전스 지수 최신 점수는 모티프테크놀로지스의 ‘모티프 3’가 47점으로 가장 높았고, 업스테이지의 ‘솔라 오픈2’가 37점으로 뒤를 이었다.
SK텔레콤의 ‘에이닷엑스-K2’는 35점, LG AI연구원의 ‘K-엑사원 2.0’은 31점을 기록했다. 지난해 12월 1차 평가에서 벤치마크 종합 33.6점으로 선두에 올랐던 LG AI연구원이 이번 지표에서는 4개 참여사 가운데 가장 낮은 점수를 받았다. 그러나 이 순위는 2차 평가의 일부 항목만 반영한 결과여서 최종 경쟁력이나 생존 팀을 확정하는 기준은 아니다.
2차 평가는 100점 만점으로, 벤치마크 평가가 40점을 차지한다. 이 가운데 글로벌 지수는 25점, 한국지능정보사회진흥원 벤치마크는 15점이며 전문가 평가 35점과 사용자 평가 25점이 별도로 반영된다. 글로벌 지수는 지식·추론·코딩 등 여러 벤치마크를 하나의 수치로 합산하지만 한국어 능력과 산업별 과업 성능, 운영 효율은 담지 않는다. 구성 항목이나 버전이 바뀌면 수학 분야 등이 빠질 수 있고 주요 벤치마크 교체 때 10∼20점 수준의 변동도 생긴다.
평가 항목에 맞춰 점수 상승을 집중적으로 유도하는 ‘벤치맥싱’ 논란도 최종 판단의 변수다. 벤치마크에서 높은 점수를 얻은 모델이 실제 환경에서도 같은 성능을 보장하는 것은 아니어서 전문가와 이용자 검증의 비중이 중요해졌다. 정부는 벤치마크 과적합 가능성을 전문가 평가와 사용자 평가로 보완한다는 방침이다. 국민 평가는 12일 마감됐으며, 2차 평가 결과는 조만간 발표된다. 참여한 4개 팀 가운데 3개 팀이 다음 단계에 진출한다.