국가 AI 2차 평가, 대형·효율 모델 맞붙는다
핵심 요약
독자 AI 파운데이션 모델 프로젝트 2차 평가를 앞두고 4개 팀이 최종 모델을 제출했다. LG AI연구원과 SK텔레콤은 초거대 모델을, 업스테이지와 모티프테크놀로지스는 경량·고효율 모델을 내세웠다. 국민평가와 산업 활용성, 실증 기술 등을 종합해 참여팀 한 곳이 탈락한다.
독자 AI 파운데이션 모델 프로젝트의 2차 평가가 오는 8일 시작된다. LG AI연구원과 SK텔레콤, 업스테이지, 추가 합류한 모티프테크놀로지스 등 4개 팀은 최종 모델 제출을 마쳤다. 성별·연령별 기준으로 선발된 일반 국민 200명 규모의 평가단은 8일부터 11일까지 모델을 살펴본다. 이번 평가를 거쳐 참여팀 한 곳이 탈락한다.
평가 항목은 벤치마크 성적에 머물지 않는다. 국민평가단의 판단과 산업 현장·서비스 활용 가능성, 실증 기술을 함께 반영한다. LG AI연구원은 참가 모델 중 최대인 매개변수 7500억개의 ‘K-엑사원 2.0’을 제출했다. 24개 벤치마크 평균은 70.1점으로 1차 평가의 63.3점보다 10% 이상 높아졌고, 코딩과 에이전틱 코딩 주요 지표는 30% 향상됐다.
SK텔레콤 정예팀의 ‘A.X K2’는 매개변수 6880억개 규모다. 긴 문맥에서 관련성이 높은 정보만 골라 참조하는 자체 SGA 구조를 적용해 정확성과 운영 효율을 강화했다. 철강·자동차 부품 제조 현장 실증을 비롯해 국방부와 양자화 모델 협업을 진행했고, SK바이오팜과는 신약 개발 기간을 줄이기 위한 프로젝트를 구축했다. LG와 SK텔레콤은 이처럼 초거대 모델의 규모와 현장 적용 경험을 전면에 세웠다.
업스테이지와 모티프테크놀로지스는 경량화와 연산 효율을 승부처로 삼았다. 참가작 중 가장 작은 업스테이지의 ‘솔라 오픈 2’는 단순 질의응답보다 에이전트 환경의 복합 업무 수행에 초점을 맞춰 최적화됐다. 매개변수 3140억개의 ‘모티프3’는 아키텍처 설계부터 구현까지 독자 개발됐으며, 동급 중국 오픈소스 모델보다 전체·활성 파라미터를 줄이면서 동등한 성능을 구현했다. 설립 1년 반, 인력 30명인 모티프테크놀로지스는 선정 후 5개월 동안 정부가 제공한 GPU 700여장으로 모델을 완성했다. 이번 2차 평가는 초거대 모델의 성능과 경량 모델의 실제 업무 효율을 종합 기준 아래 비교하는 무대가 된다.