국산 AI 2차전, 점수 넘어 실사용 검증대로
핵심 요약
국민평가단 200명이 국산 AI 모델 네 개를 직접 사용해 2차 평가에 참여한다. 국내 모델은 세계 오픈웨이트 상위권에 접근했지만 최선두 모델과의 격차와 비교 조건의 차이가 확인됐다. 향후 평가는 벤치마크 점수뿐 아니라 실제 서비스 운영과 파생 모델, 도입 비용까지 다뤄야 한다.
독자 파운데이션 모델 프로젝트 2차 평가가 오는 8일부터 11일까지 진행된다. 성별과 연령별 인구 비율을 반영해 선발한 10대부터 60대까지 국민평가단 200명이 국산 AI 모델 네 개를 직접 사용한다. 일반 이용자의 체감 평가가 공식 배점에 포함되는 첫 사례다. 결과는 이르면 12일 공개되며 네 팀 가운데 한 팀이 탈락한다.
기술 지표에서는 뚜렷한 진전이 확인됐다. 모티프테크놀로지스의 ‘모티프 3 프리뷰’는 인공지능 모델 평가기관 아티피셜 애널리시스의 지능지수에서 44점을 받아 미니맥스 M3, 딥시크 V4 프로 맥스, 키미 K2.6과 비슷한 구간에 진입했다. 30명 규모 조직이 GPU 약 700장으로 5개월 만에 거둔 성과다. 다만 GLM-5.2는 51.1점, 클로드 오퍼스 5는 60.7점으로 선두권과의 격차도 분명하다.
네 모델의 기술 자료는 비교 조건을 함께 살펴야 정확히 읽힌다. 국내 업체들이 주로 견준 대상은 중국계 오픈웨이트 모델과 폐쇄형 AI의 저가·고속 제품군이었다. 동일 모델을 각 기업이 재측정한 HLE, KMMLU-Pro, CLIcK 결과는 대부분 1점 이내로 모였지만, 개발사 공식 수치와 재측정값 사이에는 3점 차이가 난 사례도 있었다. 문항 범위와 출력 토큰 상한까지 달라 점수만 떼어낸 비교에는 한계가 있다.
평가의 초점은 실제 업무 수행과 확산으로 옮겨갈 필요가 있다. K-엑사원 2.0과 솔라 오픈 2는 금융·터미널·직업 과업에서 가능성과 과제를 함께 드러냈고, 솔라 오픈 2는 한국어 사무 과업 Ko-GDPval에서 86.8점을 기록했다. A.X K1의 최근 한 달 다운로드는 3만938회였지만 서비스 채택과는 별개의 지표다. 향후 평가는 파생 모델 수, 추론 제공 업체, 실제 서비스 운영 실적과 비용까지 확인해야 한다. 솔라 오픈 2를 다음 포털의 대화형 에이전트에 적용하려는 계획은 이런 실사용 검증의 시험대가 될 전망이다.