독자 AI 2차 평가 돌입…4개 팀 중 3곳 생존
핵심 요약
독자 AI 파운데이션 모델 2차 평가에서 4개 팀 가운데 3개 팀이 다음 단계에 진출한다. 각 팀은 대규모 성능, 산업 적용성, 비용 효율, 독자 기술을 앞세워 경쟁한다. 국민 평가단의 사용성 평가와 전문가·벤치마크 결과가 함께 반영된다.
국가대표 인공지능을 뽑는 ‘독자 AI 파운데이션 모델’ 프로젝트가 2차 단계평가에 들어간다. LG AI연구원과 SK텔레콤, 업스테이지, 모티프테크놀로지스 등 4개 팀이 경쟁해 3개 팀만 다음 단계로 향한다. 기술적 완성도와 독자 개발 여부를 중점적으로 살핀 1차 평가와 달리 이번에는 AI 에이전트의 업무 수행 능력, 산업 적용성, 개방성과 생태계 확장성이 주요 잣대가 된다.
LG AI연구원의 ‘K-엑사원 2.0’은 국내 최대인 750B 규모로, 1차 모델 236B보다 매개변수가 3배 이상 늘었다. 24개 벤치마크 평균은 63.3점에서 70.1점으로 올랐고 코딩·에이전틱 코딩 성능도 평균 30% 향상됐다. SK텔레콤의 688B 모델 ‘A.X K2’는 긴 문맥에서 관련 정보만 선별하는 자체 SGA 구조를 적용했으며 철강·자동차 부품, 국방, 신약 개발 분야에서 실증을 확대하고 있다. 후속 모델은 조 단위로 키울 계획이다.
업스테이지의 ‘솔라 오픈 2’는 전체 250B 중 작동 시 150억 개만 활성화하는 전문가 혼합 구조를 택했다. 최대 100만 토큰을 처리하면서 엔비디아 H200 GPU 2장으로 구동할 수 있어 기업의 비용 부담을 낮추는 데 초점을 맞췄다. 지난 2월 추가 선정돼 한 달 늦게 출발한 모티프테크놀로지스는 설계부터 구현까지 자체 개발한 314B 모델 ‘모티프 3’를 내놨다. 동급 중국 오픈소스 모델보다 전체·활성 매개변수가 적으면서 비슷한 성능을 구현했다는 설명이다.
벤치마크 취약점을 분석해 사후학습 데이터와 검증 가능한 보상 기반 강화학습용 데이터를 공급하는 해외 전문업체의 국내 진출은 점수 해석과 공정성 문제를 부각했다. 정답이 명확한 문제를 반복 학습하는 RLVR은 추론·코딩 성능을 빠르게 높일 수 있지만 특정 지표에 과도하게 맞출 가능성도 있다. 정부는 이를 보완해 산업 적용성과 실제 업무 능력을 함께 평가하고, 성별·연령별 인구 비율을 반영한 국민 평가단 200명도 운영한다. 평가단은 8일부터 11일까지 모델을 사용해 절대평가하며, 결과는 벤치마크·전문가 평가와 함께 반영된다. 세부 기준과 최종 결과는 이달 중 공개될 예정이다.