신경망 전문가 공유로 AI 매개변수 63% 절감
핵심 요약
UNIST 연구팀이 신경망 층끼리 전문가 모듈을 공유하는 GMoE 구조를 개발했다. 중간 크기 모델의 매개변수를 약 63% 줄이고도 기존과 비슷한 평균 정답률을 유지했다. 전문가 경로는 3배 이상 다양해졌으며 특정 경로로 입력이 몰리는 비율도 낮아졌다.
울산과학기술원(UNIST) 인공지능대학원 김태환 교수팀이 여러 신경망 층에서 전문가 모듈을 공동 활용하는 ‘GMoE(Global Mixture of Experts)’ 구조를 개발했다. 언어 이해 성능을 기존 수준으로 유지하면서 모델의 매개변수와 파일 크기, 필요한 메모리를 줄이는 방식이다. 홍건우 석사과정생이 제1저자로 참여한 연구는 자연어 처리 국제학회 ACL 2026에 채택됐으며, 연구 코드는 프로젝트 페이지에 공개됐다.
GMoE는 모든 신경망 층이 함께 쓰는 공용 전문가와 각 층에 하나씩 두는 전용 전문가를 결합한다. 신경망 층 100개에 층마다 전문가 1천 명을 배치하는 기존 구조에는 전문가 10만 명이 필요하지만, 새 구조는 공용 전문가 1천 명과 전용 전문가 100명 등 모두 1천100명으로 구성할 수 있다. 여러 층에서 유사한 기능의 모듈과 매개변수를 반복해 저장하는 문제를 줄인 설계다.
기존 전문가 혼합 모델은 입력 토큰에 따라 일부 전문가만 골라 사용하지만, 각 신경망 층이 별도의 전문가 집단을 보유하고 라우터도 앞선 층의 선택 결과 없이 매번 새로 판단한다. 이 과정에서 비슷한 기능이 층마다 중복되고 특정 전문가 조합으로 입력이 몰릴 수 있다. 연구팀은 앞선 층에서 계산한 전문가별 선택 점수를 다음 층에 전달해 이전 정보를 참고하도록 라우팅 방식도 바꿨다.
연구팀은 소형·중형·대형 언어모델을 대상으로 독해와 문법 판단, 상식 추론을 포함한 7개 시험을 진행했다. 중간 크기 모델은 매개변수가 5억4천900만 개에서 2억400만 개로 약 63% 감소했지만 평균 정답률은 39.51%로, 기존 모델의 39.55%와 거의 같았다. 서로 다른 전문가 경로는 8만1천561개로 기존보다 3배 이상 늘었고, 최다 사용 경로에 입력이 집중된 비율은 기존 25.65~45.55%에서 11.15%로 낮아졌다.