독자 AI 2차 평가 돌입…4개 팀 중 3곳 생존
핵심 요약
독자 AI 파운데이션 모델 2차 평가에서 4개 팀 가운데 3개 팀이 다음 단계에 진출한다. 각 팀은 초거대 모델 성능, 산업 적용성, 운영 효율, 독자 설계를 앞세워 경쟁한다. 국민 평가단 200명의 사용성 평가를 포함한 세부 기준과 결과는 8월 중 공개된다.
국가대표 인공지능을 선발하는 ‘독자 AI 파운데이션 모델’ 프로젝트의 2차 단계평가가 시작됐다. LG AI연구원과 SK텔레콤, 업스테이지, 모티프테크놀로지스 등 4개 팀이 경쟁해 3개 팀만 다음 단계에 오른다. 5개 팀 중 4개 팀을 추린 1차 평가와 달리, 이번에는 기술 완성도뿐 아니라 AI 에이전트의 업무 수행력과 산업 적용성, 개방성 및 생태계 확장성을 함께 가린다.
LG AI연구원의 ‘K-엑사원 2.0’은 매개변수를 236B에서 국내 최대 규모인 750B로 키웠다. 24개 지표 평균은 63.3점에서 70.1점으로 상승했고 코딩·에이전틱 코딩 성능도 30% 높아졌다. SK텔레콤의 688B 모델 ‘A.X K2’는 긴 문맥에서 필요한 정보를 선별하는 자체 SGA 구조를 적용했으며 철강·자동차 부품·국방·신약 개발 분야에서 실증을 확대하고 있다. 후속 모델은 조 단위 규모로 확장할 계획이다.
업스테이지의 ‘솔라 오픈 2’는 총 250B 가운데 구동 시 150억개만 활성화하는 전문가 혼합 구조를 채택했다. 최대 100만 토큰을 처리하면서 엔비디아 H200 GPU 2장으로 운용할 수 있도록 비용 효율과 에이전트 사용성을 강조했다. 한 달 늦게 출발한 모티프테크놀로지스는 설계부터 구현까지 독자 개발한 314B 모델 ‘모티프 3’를 내놓았다. 전체·활성 매개변수가 더 적은 구조로 동급 중국 오픈소스 모델과 비슷한 성능을 구현했다는 입장이다.
평가 과정에서는 특정 시험에 맞춘 과도한 성능 최적화 가능성도 쟁점으로 떠올랐다. 취약 작업 분석과 사후학습 데이터 제공, 검증 가능한 보상을 활용한 강화학습은 추론·코딩 성능을 빠르게 높일 수 있지만 벤치마크 점수의 공정성 논란을 낳을 수 있다. 성별·연령별 인구 비율을 반영해 선정한 국민 평가단 200명은 8일부터 11일까지 네 모델을 직접 사용해 절대평가한다. 이 결과는 벤치마크 및 전문가 평가와 함께 반영되며, 정부는 세부 기준과 최종 결과를 8월 중 공개한다.