층별 전문가 공유로 LLM 매개변수 63% 절감
핵심 요약
UNIST 연구팀이 신경망 층끼리 전문가 모듈을 공유하는 GMoE 구조를 개발했다. 매개변수를 약 63% 줄이면서 기존 모델과 비슷한 평균 정답률을 유지했다. 전문가 선택 쏠림을 낮추고 활용 경로를 8만1561개로 확대했다.
울산과학기술원 인공지능대학원 김태환 교수팀이 여러 신경망 층에서 인공지능 모듈을 함께 사용하는 전문가 혼합 구조 ‘GMoE’를 개발했다. 이 구조는 대형언어모델의 중복 매개변수와 연산 비효율을 줄이면서 기존 모델과 유사한 성능을 유지하도록 설계됐다. 온디바이스 인공지능처럼 메모리 제약이 큰 환경에서의 활용도 기대된다.
GMoE는 모든 층이 함께 사용하는 ‘공용 전문가’와 층마다 하나씩 배치하는 ‘전용 전문가’를 결합한다. 100개 층에 전문가 1000명씩을 별도로 두는 기존 구조에는 총 10만 명이 필요하지만, GMoE는 층별 전용 전문가 100명과 공용 전문가 1000명 등 1100명으로 구성할 수 있다. 각 층에서 비슷한 기능을 반복해 학습하며 생기는 매개변수 중복을 공유 구조로 줄인 것이다.
독해와 문법, 상식 추론 등 7개 분야 평가에서 중간 크기 모델의 매개변수는 5억4900만 개에서 2억400만 개로 약 63% 감소했다. 평균 정답률은 39.51%로, 매개변수가 약 2.5배 많은 기존 모델의 39.55%와 비슷했다. 기존 전문가 혼합 모델은 각 신경망 층에 별도의 전문가 집단을 배치해 층이 깊어질수록 모델 규모가 커지고 유사 기능이 중복되는 한계가 있었다.
특정 전문가와 경로에 입력이 몰리는 문제도 완화됐다. GMoE는 앞선 층의 라우터 계산 점수를 다음 층에 전달해 이전 선택을 반영하고 전문가 활용을 분산한다. 실험에서는 기존 방식보다 3배 이상 많은 8만1561개 경로가 사용됐으며, 최다 이용 단일 경로의 비중은 기존 25.65~45.55%에서 11.15%로 낮아졌다. 홍건우 석사과정생이 제1저자로 참여한 연구는 ‘ACL 2026’에 게재됐고 관련 코드는 깃허브 프로젝트 페이지에 공개됐다.