독자 AI 2차 심사, 효율·한국어 역량까지 가린다
핵심 요약
정부가 독자 AI 파운데이션 모델 사업의 2차 단계평가에 착수했다. 성능 점수와 함께 추론 자원, 독자성, 한국어 데이터 활용 및 산업 적용 역량이 핵심 기준으로 부상했다. 국민평가는 동일한 조건에서 체감 품질을 살피고 안전성과 기술 완성도는 전문가 심사로 보완해야 한다.
정부가 독자 인공지능 파운데이션 모델 프로젝트의 2차 단계평가에 착수했다. 7일 확인된 평가 방향은 기존의 벤치마크·전문가·사용자 평가 체계를 유지하면서 세부 기준을 정교하게 다듬는 데 맞춰졌다. 단순 성능 점수를 넘어 답변 생성에 쓰인 토큰 수와 추론 시간·비용, 한국어 데이터 활용 능력, 공공·산업 현장 적용 가능성까지 함께 검증해야 한다는 요구가 커지고 있다.
벤치마크에는 글로벌 주요 리더보드에서 쓰이는 지표가 검토되고, 전문가 심사에서는 모델 독자성을 세분화해 확인하는 방안이 논의되고 있다. 초기 데이터와 학습 로그 보유 여부, 개발 중 발생한 문제를 외부 기술에 기대지 않고 해결할 수 있는지가 핵심 판단 요소로 꼽힌다. 같은 문제를 풀더라도 투입 토큰과 연산 자원이 수십 배 차이 나면 서비스 속도와 운영비가 달라지는 만큼 추론 자원을 성능과 분리해 살펴야 한다는 지적도 제기됐다. 장시간·고비용 추론에서 나타날 수 있는 도구 오용이나 공격적 행동은 안전성 심사 항목과도 연결된다.
국내 데이터 확보와 활용 역량도 주요 평가 과제로 부상했다. 참여 기업들은 국가AI전략위원회 간담회에서 국립중앙도서관 도서 데이터화, 학습 목적 저작물 활용을 위한 텍스트·데이터 마이닝 면책 규정, 정부 데이터 정제 체계 고도화, 한국어 평가 데이터셋 확대를 요청했다. 국가 차원의 대규모 한국어 사전학습 데이터 구축과 정제·분류·후처리 지원 필요성도 제시됐다. 한국어 맥락과 국내 제도·문화를 이해하고 제조·금융·공공·의료 현장의 실제 서비스로 확장할 수 있는지가 사업 목표를 가르는 기준으로 거론된다.
국민이 직접 모델을 써보는 사용자 평가는 편의성, 자연스러운 대화 능력, 한국어 표현력 등 체감 품질을 확인하는 데 초점이 맞춰질 전망이다. 다만 연령과 직업, AI 이용 경험이 고르게 반영되지 않거나 질문·응답 시간·사용 환경이 모델마다 다르면 브랜드 인지도와 화면 구성에 결과가 좌우될 수 있다. 국민평가가 인기투표로 흐르지 않도록 조건을 통제하고, 사실 정확성·환각·유해 답변 차단·보안성처럼 일반 이용자가 판별하기 어려운 항목은 전문가 검증으로 보완하는 설계가 요구된다.