모티프 3, 국내 독파모 후보 중 글로벌 평가 선두
핵심 요약
모티프 3가 AAII 47점으로 독파모 2차 평가 참여 모델 중 가장 높은 점수를 받았다. 미국과 중국의 최상위 모델은 52~63점대를 기록해 국내 후보보다 앞섰다. 독파모 평가는 글로벌 지수 외에 NIA 벤치마크와 전문가·사용자 평가를 합산해 1팀을 탈락시킨다.
국가대표 인공지능 모델을 가리는 ‘독자 AI 파운데이션 모델’ 프로젝트의 2차 평가를 앞두고 참여 기업들의 글로벌 성능 지표가 공개됐다. 모티프테크놀로지스의 ‘모티프 3’는 최신 아티피셜 애널리시스 인텔리전스 지수에서 47점을 받아 국내 후보 4개 모델 가운데 가장 높은 성적을 기록했다. 다만 미국과 중국의 최상위 모델과 비교하면 국내 모델의 종합 순위는 아직 낮은 수준이다.
국내 후보별 점수는 업스테이지의 ‘솔라 오픈2 250B’가 37점, SK텔레콤의 ‘에이닷엑스(A.X)-K2’가 35점, LG AI연구원의 ‘K-엑사원(EXAONE) 2.0’이 31점이었다. 임정환 모티프테크놀로지스 대표는 국경과 관계없이 세계 최고 수준의 성능을 확보하는 것이 독자 파운데이션 모델의 의미라는 입장을 내놓고, 미국과 중국의 프런티어 모델과 대등하게 경쟁할 모델을 완성하겠다는 목표를 밝혔다.
아티피셜 애널리시스는 수학·과학·코딩·추론 능력을 종합해 AI 모델을 평가한다. 전체 선두는 최고 추론 설정에서 63점을 받은 앤트로픽의 ‘클로드 오푸스 5’다. 오픈AI의 ‘GPT-5.6 솔’과 스페이스XAI의 ‘그록 4.6’은 각각 61점을 기록했다. 중국 모델 중에는 문샷AI의 ‘키미 K3’가 60점, 알리바바의 ‘큐원3.8 맥스’가 58점으로 전체 6위에 올랐다. Z.ai의 ‘GLM-5.2’는 53점, 딥시크 ‘V4 플래시’ 최신 모델은 52점을 받았다.
이번 글로벌 지수의 순위가 독파모 2차 평가 결과로 그대로 이어지는 것은 아니다. 해당 지수에는 한국어 성능이 반영되지 않으며, 독파모 평가에서 벤치마크가 차지하는 비중도 총 100점 중 40점이다. 세부 배점은 AAII 25점과 한국지능정보사회진흥원 벤치마크 15점, 전문가 평가 35점, 사용자 평가 25점이다. 지난 8일부터 11일까지 일반 국민 200명이 4개 모델을 직접 사용해 평가했다. 1차에서 네이버클라우드와 NC AI가 탈락한 데 이어 이번에는 LG AI연구원·업스테이지·SK텔레콤·모티프테크놀로지스 가운데 1팀이 제외되며, 정부는 결과를 곧 발표한다.