독파모 2차전, 4개 모델의 에이전트·멀티모달 경쟁
핵심 요약
독파모 2차 평가에서 업스테이지·SK텔레콤·LG AI연구원·모티프테크놀로지가 경쟁한다. 에이전트와 멀티모달 성능뿐 아니라 산업 적용성·개방성·생태계 확장성도 심사한다. 국민평가단 평가를 포함한 결과로 한 팀이 탈락하고 연말에는 최종 두 팀이 선정된다.
2025년 8월 출범한 독자 AI 파운데이션 사업이 두 번째 평가에 들어간다. 1차 평가에서 NC AI와 네이버클라우드가 탈락한 뒤 기술 독자성을 인정받은 모티프테크놀로지가 합류하면서 업스테이지, SK텔레콤, LG AI연구원과 4파전을 벌인다. 8일부터 11일까지 국민평가단 200명이 각 모델을 직접 사용하며, 평가 결과는 벤치마크와 전문가 점수를 합산해 12일 이후 구체화될 예정이다.
업스테이지의 솔라 오픈 2는 2500억 매개변수와 100만 토큰 처리 능력을 갖추고 SWE-벤치 성적을 15.4%에서 70.4%로 높였다. SK텔레콤의 A.X K2는 6880억 매개변수에 이미지·음향·음성 모델을 결합했으며, 희소 게이티드 어텐션으로 26만 토큰 문맥을 지원한다. 두 모델의 KMMLU-프로 점수는 각각 78.4점과 80.5점이다.
LG AI연구원의 K-EXAONE 2.0은 매개변수를 7490억 개로 확대하고 DSpark를 적용해 토큰 생성 속도를 높였다. 일반 지능 지표의 상승 폭은 제한적이었지만, 긴 문맥에서 분산된 정보를 연결하는 오픈AI-MRCR 점수는 52.3점에서 94.4점으로 뛰었다. 모티프 3는 3140억 매개변수와 자체 설계한 GLDA 구조를 채택했으며, 30여 명과 GPU 700장으로 학습한 베타 모델이 GPQA-다이아몬드 87%, 터미널 벤치 71%를 기록했다.
이번 평가는 언어모델 성능에 초점을 맞춘 1차와 달리 텍스트·이미지·비디오를 함께 처리하는 멀티모달 역량, 에이전트의 업무 수행 능력, 산업 적용성, 개방성과 생태계 확장성을 함께 살핀다. 모델마다 요구 장비와 라이선스도 다르다. 솔라 오픈 2는 양자화로 구동 부담을 낮췄고, 아파치 2.0을 적용한 A.X K2는 상업적 활용이 가능하다. K-EXAONE 2.0과 모티프 3는 대형 구조와 효율화 기술로 맞선다. 평가 뒤 4개 팀 중 1개 팀이 탈락하며, 연말 최종 평가에서는 2개 팀만 남는다.