AI 대표 선발전, 스타트업 두 곳이 대기업 추월
핵심 요약
글로벌 벤치마크에서 모티프3가 47점으로 국내 AI 모델 1위를 차지했다. 솔라 오픈2도 SK텔레콤과 LG AI연구원 모델을 앞섰다. AAII 비중은 40%여서 전문가·사용자 평가 후 최종 순위가 달라질 수 있다.
국가대표 인공지능 모델을 가리는 ‘독자 AI 파운데이션 모델’ 프로젝트의 글로벌 벤치마크에서 스타트업 두 곳이 대기업을 앞섰다. 2026년 8월 13일 공개된 아티피셜 애널리시스 인텔리전스지수(AAII) 평가에서 모티프테크놀로지스의 ‘모티프3’가 47점으로 국내 모델 가운데 가장 높은 성적을 거뒀다. 업스테이지의 ‘솔라 오픈2’는 37점으로 뒤를 이었다.
SK텔레콤의 ‘에이닷엑스-K2’는 35점, LG AI연구원의 ‘K-엑사원 2.0’은 31점을 기록해 각각 3위와 4위에 자리했다. 지난해 12월 독파모 프로젝트 1차 평가에서 선두였던 LG AI연구원이 이번에는 네 후보 중 가장 낮은 점수를 받으면서 순위가 크게 바뀌었다. 스타트업 모델과 대기업 모델의 격차는 모티프3를 기준으로 각각 12점과 16점이었다.
AAII는 과학 코딩과 장문 추론, 지식 정확성 등 9개 항목에 에이전트 업무 수행 능력과 직무 활용 편의성을 더해 모델 성능을 단일 점수로 환산한다. 여러 영역을 합산하는 구조여서 평가 항목의 구성에 따라 점수가 달라질 수 있다. 국내 모델이 글로벌 오픈웨이트 모델과 경쟁할 수준으로 성장했다는 가능성을 드러냈지만, 한국어 능력이 충분히 반영되지 않았다는 문제와 평가 문제에 맞춘 훈련을 뜻하는 ‘벤치맥싱’ 논란도 남았다.
이번 점수만으로 국가대표 AI의 최종 승자를 확정할 수는 없다. AAII 결과가 2차 평가에서 차지하는 비중은 40%이며, 나머지는 한국지능정보사회진흥원 벤치마크 15점, 전문가 평가 35점, 국민 평가단 200명이 모델을 직접 사용하는 사용자 평가 25점으로 구성된다. 전문가와 사용자 평가의 비중이 더 큰 만큼 현재 순위가 뒤집힐 여지가 있으며, 각 모델의 한국어 성능과 실제 활용성에 대한 검증이 최종 선발의 핵심 변수로 남게 됐다.