AI 국가대표 2차전, 스타트업 모델이 선두
핵심 요약
스타트업의 모티프3와 솔라 오픈2가 최신 AAII에서 대기업 모델보다 높은 점수를 기록했다. 파라미터 7500억개의 K-엑사원 2.0은 참여 모델 중 규모가 가장 컸지만 31점으로 최하위에 머물렀다. AAII는 2차 평가에 25점이 반영되며 4개 기업 중 1곳의 탈락 결과가 이르면 이번 주 발표된다.
정부의 독자 AI 파운데이션 모델 2차 선발 결과 발표를 앞두고 글로벌 종합 지능 지수에서 스타트업 모델들이 대기업 모델을 앞섰다. 최신 AAII v4.1.1 평가에서 모티프테크놀로지스의 ‘모티프3’가 47점으로 1위를 차지했고, 업스테이지의 ‘솔라 오픈2’가 37점으로 뒤를 이었다. SK텔레콤의 ‘A.X K2’는 35점, LG AI연구원의 ‘K-엑사원 2.0’은 31점을 기록했다.
모델 규모와 평가 점수는 반대 흐름을 보였다. K-엑사원 2.0은 파라미터 7500억개로 참여 모델 중 가장 컸지만 점수는 가장 낮았다. 1위 모티프3의 파라미터는 3140억개로 LG 모델의 절반에 못 미친다. 정부가 글로벌 AI 평가 기관에 직접 평가를 의뢰하면서 참여 기업 4곳의 모델은 같은 기준으로 비교됐다. AAII는 추론·코딩·과학·에이전트 업무 수행 능력 등 9개 항목을 종합한다.
지난 1월 공개된 1차 모델 평가에서는 대기업이 앞서 있었다. 당시 파라미터 2360억개의 LG ‘K-엑사원’이 32점으로 국내 모델 가운데 최고점을 받았고, 모티프테크놀로지스의 소형 모델 ‘모티프-2’는 24점, 업스테이지의 ‘솔라 오픈 100B’는 21점이었다. 약 7개월 만에 순위 구도가 뒤집혔지만, 그사이 AAII 항목과 버전이 개편돼 당시 점수와 최신 점수를 단순 비교하기는 어렵다.
업계에서는 제한된 기간과 자원 안에서 모델 규모를 크게 확대한 팀이 에이전트·코딩 성능을 다듬는 후속 최적화에 충분한 여력을 투입하지 못했을 가능성을 제기한다. AAII는 이 두 영역에 절반이 넘는 가중치를 두는 반면, LG가 강점으로 제시한 한국어 장문 이해와 안전성은 평가하지 않는다. 2차 평가는 벤치마크 40점, 전문가 평가 35점, 국민 평가 25점으로 구성되며 AAII가 벤치마크 점수 중 25점, NIA 자체 평가가 15점을 차지한다. 정부는 지난 11일 200명 규모의 국민평가까지 마쳤으며, 4개 기업 중 1곳의 탈락 결과가 이르면 이번 주 공개될 전망이다.