독자 AI 평가서 모티프 47점…해외 최상위권과 격차
핵심 요약
모티프 3가 AAII 평가에서 47점으로 국내 참여 모델 가운데 선두에 올랐다. 국산 모델 일부는 해외 모델과 경쟁권에 진입했지만 미국·중국 최상위 모델과는 격차를 보였다. 정부는 AAII와 전문가·사용자 평가를 합산해 이달 중 3개 진출팀을 선정한다.
정부의 독자 AI 파운데이션 모델 프로젝트에 참여한 4개 모델 가운데 모티프테크놀로지스의 ‘모티프 3’가 글로벌 인텔리전스 인덱스 평가에서 47점으로 가장 높은 성적을 냈다. 업스테이지의 ‘솔라 오픈 2 250B’는 37점, SK텔레콤의 ‘A.X K2’는 35점, LG AI연구원의 ‘K-엑사원 2.0’은 31점을 기록했다. 국내 1위와 2위의 격차는 10점, 전체 점수 범위는 16점이었다.
모델 규모가 평가 순위와 그대로 맞물리지는 않았다. K-엑사원 2.0은 전체 7500억개 파라미터 중 추론 과정에서 370억개를 활성화하며, A.X K2는 전체 6880억개 가운데 330억개를 가동한다. 모티프 3는 전체 3140억개·활성 130억개, 솔라 오픈 2는 전체 2500억개·활성 150억개 규모다. 네 모델은 모두 필요한 일부 전문가만 선택해 작동시키는 전문가혼합 구조를 채택했다.
이번에 적용된 AAII v4.1.1은 실제 직무 수행을 다루는 GDPval-AA v2와 은행 업무형 에이전트 평가인 τ³-뱅킹을 비롯해 터미널 작업, 과학 코딩, 장문 추론, 지식 정확성 등 9개 항목을 종합한다. 지식과 추론 문제뿐 아니라 도구 활용 및 에이전트 업무 수행 능력도 함께 측정한다. 미국 모델은 클로드 63점과 GPT 61점을 기록했고, 중국 문샷AI의 키미 K3는 60점으로 GPT와 1점 차이를 보였다.
중국 모델은 큐원3.8 맥스 58점, GLM-5.2 53점, 딥시크 V4 플래시 최신 모델 52점으로 50점대에 자리했다. 모티프 3는 키미 K3보다 13점 낮았지만 미니맥스 M3의 45점을 넘어섰고, 솔라 오픈 2는 제미나이 3.5 플래시-라이트와 같은 37점을 받았다. AAII는 2차 평가의 일부이며 정부는 전문가 평가와 사용자 평가를 합산해 이달 중 LG AI연구원, SK텔레콤, 업스테이지, 모티프테크놀로지스 등 4개 정예팀에서 다음 단계에 진출할 3개팀을 선정한다.