공공문서로 크메르어 민원 AI 정확도 높였다
핵심 요약
에이아이웍스가 공공문서 기반 크메르어 민원 AI 챗봇의 기술실증을 완료했다. 크메르어 말뭉치 약 20만 문장을 추가 학습하고 다국어 임베딩 모델 9종을 비교했다. 출처 표시와 감사 로그 등 책임 있는 AI 장치를 적용했으며 실제 서비스는 올해부터 단계적으로 구축한다.
AI 데이터·솔루션 기업 에이아이웍스가 캄보디아 국민이 크메르어로 민원 절차와 필요 서류를 확인할 수 있는 AI 챗봇의 기술실증을 마쳤다. 현지 공공문서를 지식베이스로 구축하고 거대언어모델과 검색증강생성을 결합한 연구 성과는 유엔대학교 주관 국제학술대회 ‘ICEGOV 2026’에서 공개된다. 실제 서비스 구축은 올해부터 단계적으로 추진된다.
연구진은 라마 3.1 8B 오픈 웨이트 모델에 한국지능정보사회진흥원의 크메르어 말뭉치 약 20만 문장을 추가 학습시키고 지시문 튜닝을 진행했다. 검색 과정에서는 다국어 임베딩 모델 9종의 성능을 비교해 정확도가 가장 높은 모델을 선택했다. 이어 현지 공공문서를 수집·정제·표준화한 뒤 실제 민원과 유사한 수백 개 질문으로 답변 품질을 검증했다.
크메르어는 AI 학습에 필요한 말뭉치와 디지털 문서가 부족한 저자원 언어다. 띄어쓰기 없이 문자가 이어지고 표기 규칙도 복잡해 기존 다국어 AI 모델이 처리하기 어려운 언어로 분류된다. 국제 학계에 보고된 크메르어 생성형 언어모델 학습 자료는 총 7만~57만9000문장으로, 약 15조 토큰을 사전학습한 라마 3.1의 다국어 혼합 데이터와 비교하면 100만분의 1에도 미치지 못한다.
챗봇에는 답변의 원문 출처와 참조 링크를 표시하고 역할 기반 접근제어, 감사 로그, 지식 색인 버전 관리를 적용했다. 근거가 부족할 때 단정하지 않는 보수적 응답 방식도 도입해 사실과 다른 답변이나 근거 없는 추정을 줄이도록 설계했다. 예비 평가에서는 추가 학습 모델의 크메르어 MMLU 형식 성능이 개선됐으며, LLM 평가자를 활용한 민원 시나리오 평가에서도 제안 시스템이 비교 대상 중 가장 높은 성능을 보였다. 연구 결과는 다음 달 28일부터 10월 1일까지 사우디아라비아 리야드에서 발표된다.