국가대표 AI 2차 평가 앞두고 체감 성능 도마
핵심 요약
국가대표 AI 2차 평가를 앞두고 참여 모델들의 간단한 추론 문제 오답이 논란이 됐다. 일반 국민 200명이 참여하는 사용자 평가는 전체 100점 가운데 25점을 차지한다. 벤치마크 취약 항목을 겨냥한 집중 학습이 실제 추론 역량을 제대로 보여주는지에도 의문이 제기됐다.
독자 AI 파운데이션 모델 프로젝트의 2차 평가를 앞두고 참여 모델들이 간단한 추론 문제에서 잇따라 오답을 내면서 성능 논란이 커지고 있다. 이번 평가는 벤치마크 40점, 전문가 심사 35점, 사용자 평가 25점으로 구성된다. 1차 때 AI 전문가 49명이 맡았던 사용자 평가에는 일반 국민 200명이 참여해 실제 이용자가 체감하는 답변 품질이 주요 변수로 떠올랐다.
11일 참여 기업의 공개 챗봇에 세차장이 50m 앞에 있을 때 차를 세차하려면 걸어갈지 차로 갈지를 묻자 A사와 B사 모델은 가까우니 걷는 편이 합리적이라는 취지로 답했다. C사 모델은 차를 가져가야 한다고 판단했지만, 이용자 커뮤니티에는 전날 같은 모델이 오답을 냈다는 화면이 게시됐다. D사는 평가용 챗봇을 일반에 공개하지 않았다. 구글 제미나이는 차를 타고 가라고 답했다.
2차 평가에는 지난 1월 1차 관문을 통과한 LG AI연구원·SK텔레콤·업스테이지와 추가 공모에서 뽑힌 모티프테크놀로지스가 참여한다. 지난해 8월 선정됐던 네이버클라우드와 NC AI는 독자성과 성능 부족으로 탈락했고, 과학기술정보통신부는 4팀 평가 방식을 유지하기 위해 지난 2월 모티프를 선발했다. 평가는 12일까지 이어지며 이용자들은 수학, 애국가 가사, 상식 문제 등으로 각 모델을 시험하고 있다.
일부 이용자는 기업들이 자주 출제되는 질문의 답을 모델에 미리 학습시켰다는 이른바 ‘족보’ 의혹도 제기했다. 벤치마크의 취약 항목을 분석하는 미국 AI 학습 전문 업체가 일부 참여 기업과 협력해, 실패 작업을 찾아내고 강화학습인 RLVR용 최적화 데이터를 공급한 사례도 확인됐다. 특정 항목을 겨냥한 사후 학습이 전체 추론 능력보다 시험 점수만 끌어올릴 수 있다는 지적이 나오는 만큼, 프런티어급 AI 개발이라는 사업 목표와 평가 통과 중심의 경쟁 사이에서 모델의 실질적 역량을 가려낼 수 있을지가 쟁점이다.