독파모 2차 관문, 규모와 효율 전략 맞대결
핵심 요약
독파모 2차 평가에서 LG·SKT·업스테이지·모티프 중 한 팀이 탈락한다. LG와 SKT는 모델 규모를, 업스테이지와 모티프는 연산 효율을 앞세웠다. 모델별 강점이 엇갈리는 가운데 벤치마크의 공정한 검증이 핵심 쟁점으로 떠올랐다.
독자 AI 파운데이션 모델 프로젝트의 국민 평가가 11일 끝나면서 2차 평가도 최종 단계에 접어들었다. 일반 국민 200명의 평가 점수를 반영한 결과는 이달 중 공개된다. 1차에서 네이버클라우드와 NC AI가 탈락한 데 이어 이번에는 LG AI연구원, SK텔레콤, 업스테이지, 모티프테크놀로지스 가운데 한 팀이 제외된다. 경쟁 모델은 K-엑사원 2.0, A.X K2, 솔라 오픈 2, Motif-3다.
모델 규모에서는 LG가 1차 모델보다 세 배 이상 늘린 국내 최대 7500억개 매개변수로 앞섰고, SKT는 5190억개에서 6880억개로 확대했다. 모티프와 업스테이지는 각각 3140억개, 2500억개다. 네 모델 모두 질문에 필요한 일부만 작동시키는 전문가 혼합 구조를 적용했다. 활성 매개변수는 LG 370억개, SKT 330억개, 업스테이지 150억개, 모티프 132억개로 집계됐다. LG 모델은 H200 GPU 16장, 업스테이지 모델은 양자화 시 2장으로 구동된다.
성능의 초점도 달랐다. LG는 장문 이해 평가에서 94.4점과 89.6점을 기록하고 교사 46명 자문단을 통해 한국적 특수성과 세계시민교육 요소를 반영했지만, 이전 모델보다 종합 지식은 83.8점에서 83.5점, 수학은 80.7점에서 78.4점으로 낮아졌다. SKT는 IMO 2026 문제 평가에서 42점 중 금메달 기준선인 29점을 얻고 한국어 지식·문화 이해에서 강점을 보였으나, 인터넷 탐색 평가는 비교 모델 가운데 최하위였다.
업스테이지는 자체 한국어 사무 과업 평가에서 86.8점으로 매개변수가 여섯 배 이상 많은 딥시크 V4 프로의 86.9점에 근접했지만, 한국어 지식 평가는 딥시크 V4 플래시에 뒤졌다. 모티프는 은행 업무 처리와 IT 장애 진단에서 비교 모델 최고점을 기록한 반면 한국어 성능 지표는 제시하지 않았다. 네 모델은 모두 에포크AI의 주목할 만한 모델에 선정됐다. 다만 측정 환경과 출처가 서로 달라 단순 순위화가 어렵고, 특정 벤치마크에 맞춘 학습 가능성도 있어 공정한 검증이 최종 판정을 좌우할 쟁점으로 남았다.