국산 AI 국민평가, 활용성 호평 속 차별화 숙제
핵심 요약
국산 AI 모델 4종을 대상으로 국민평가단 200명의 체험 평가가 진행됐다. 인터페이스와 정보 정리 능력은 호평을 받았지만 한국어 창작성과 지속적인 이용 유인은 과제로 꼽혔다. 우회 요청에 부적절한 답변을 내놓은 사례가 확인돼 안전장치 강화 필요성도 제기됐다.
정부 지원으로 개발된 국산 인공지능 모델을 일반 이용자가 직접 시험하는 ‘독자 AI 파운데이션 모델 프로젝트’ 2차 국민평가가 지난 8일부터 11일까지 진행됐다. 참가자들은 상용화 전 모델을 체험하는 취지와 정보 정리 능력, 사용자 인터페이스 편의성에는 긍정적인 반응을 보였지만 한국어 창작성과 이용 유인, 안전장치에는 보완이 필요하다고 평가했다.
공모에는 시작 하루 만에 480명 넘게 신청했고, 최종 선정된 200명이 LG AI연구원·업스테이지·SK텔레콤·모티프테크놀로지스 등 4개 팀의 모델을 사용했다. 참가자들은 PC에서 국민용 프롬프트 가이드라인을 참고해 각 모델을 체험한 뒤 5점 만점의 절대평가로 종합점수를 제출했다. 이미지와 영상 생성 등 텍스트 이외의 기능은 심사 대상에서 빠졌다.
체험 과정에서는 평소 생성형 AI를 자주 쓰지 않는 이용자가 모델별 특장점을 구분하기 어렵고, 국산 AI를 계속 사용할 만한 뚜렷한 동기가 부족하다는 반응이 나왔다. 한글에 특화된 창작 결과물을 기대했던 참가자도 결과의 완성도에 아쉬움을 나타냈다. 안내 프롬프트를 적용하려면 이용자가 직접 자료를 찾아 가공해야 했고, 구체적인 심사 지침과 달리 제출 항목은 종합평가 하나뿐이라는 지적도 제기됐다.
안전성 시험에서는 우회적인 표현으로 폭력적 문구와 욕설을 유도했을 때 일부 모델이 이를 차단하지 못한 사례가 확인됐다. 상용화를 위해 필터링을 강화하고 해외 빅테크 AI와 구별되는 경쟁력을 분명히 해야 한다는 과제가 드러난 셈이다. 2차 결과는 이르면 13~14일 전후 공개되며 기존 벤치마크와 전문가 평가, 국민평가가 함께 심사에 반영된다. 평가단은 성별·연령별 쿼터와 무작위 방식으로 구성됐고, 중복 신청과 이해관계가 확인된 평가자의 점수는 배제할 수 있도록 절차가 마련됐다.