국가 AI 선발, 벤치마크와 실사용 평가 병행
핵심 요약
독자 AI 파운데이션 모델 2차 평가는 AAII와 NIA 벤치마크를 활용한다. 특정 평가에 맞춘 사후학습인 벤치맥싱 확산으로 점수 해석의 중요성이 커졌다. 일반 국민 200명의 사용 평가를 병행해 실제 성능과 편의성을 함께 검증한다.
독자 AI 파운데이션 모델 프로젝트의 2차 평가 결과 발표를 앞두고 벤치마크 점수의 해석이 핵심 쟁점으로 떠올랐다. 특정 시험에 맞춘 데이터와 사후학습으로 점수를 집중적으로 높이는 ‘벤치맥싱’이 확산하면서, 높은 수치가 모델의 범용 성능과 실제 활용성을 어느 정도 반영하는지 함께 검증해야 할 필요성이 커졌다.
2차 평가에는 아티피셜 애널리시스의 종합 성능지표 ‘인텔리전스 인덱스(AAII)’와 한국지능정보사회진흥원(NIA) 벤치마크가 활용된다. AAII에는 전문 업무 수행 능력을 측정하는 GDPval의 변형 지표인 ‘GDPval-AA’도 포함된다. 1차 평가에서는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점을 배정했고, 벤치마크 항목은 NIA 10점과 글로벌 공통 20점, 글로벌 개별 10점으로 구성했다.
벤치맥싱의 기반에는 정답 판별이 가능한 수학·코딩 문제를 반복해서 풀게 하고 보상을 주는 ‘검증 가능한 보상을 통한 강화학습(RLVR)’이 있다. 추론 능력을 높이는 일반적인 기법이지만 특정 평가와 비슷한 문제 및 합성데이터를 집중 투입하면 해당 점수를 빠르게 올리는 데 쓰일 수 있다. 안드레이 카파시는 2025년 LLM 결산에서 이런 최적화에 대한 벤치마크의 취약성을 지적했다. 애프터쿼리 같은 전문업체도 맞춤형 데이터와 사후학습을 지원하고 있다.
애프터쿼리의 데이터가 활용된 엔비디아 오픈소스 모델 ‘네모트론3 울트라’는 GDPval 점수가 35.3점에서 46.7점으로 상승했다. 이번 평가에서는 성별·연령별 인구 비율 등을 고려해 선정한 일반 국민 200명이 정예팀 모델을 직접 사용한다. 1차 때 AI 스타트업 대표 등 전문 사용자 49명이 참여했던 방식보다 평가 대상을 넓힌 것이다. 정형화된 시험 점수와 전문가 판단, 국민이 체감한 성능·편의성이 얼마나 일관된 결과를 보이는지가 최종 경쟁력 판단의 관건이 될 전망이다.