노타, 키미 K3 연산 부담 절반으로 낮춰
핵심 요약
노타가 키미 K3를 50% 경량화해 필요한 B300 GPU를 8장에서 4장으로 줄였다. 층별 제거 비율을 달리하는 비균일 전문가 프루닝으로 성능 손실을 억제했다. 자체 평가에서 기존 REAP 방식보다 대다수 벤치마크의 성능 보존율이 높았다.
AI 최적화 기업 노타가 중국 문샷AI의 초거대 인공지능 모델 ‘키미 K3’를 경량화해 구동에 필요한 그래픽처리장치 수를 B300 기준 8장에서 4장으로 줄였다. 노타는 자체 개발한 비균일 전문가 프루닝 기술을 적용해 모델 규모를 50% 축소하면서 성능 손실을 억제했다고 5일 밝혔다.
비균일 전문가 프루닝은 모델의 층별 특성과 각 모듈의 중요도를 분석한 뒤 핵심 전문가는 남기고 기여도가 낮은 모듈을 골라 제거하는 기술이다. 모든 층의 전문가를 같은 비율로 줄이는 기존 REAP 방식과 달리 층마다 제거 비율을 다르게 설정한 점이 특징이다. 노타의 자체 평가에서는 50% 경량화 모델이 대다수 벤치마크에서 REAP보다 높은 성능 보존율을 기록했다.
평가 항목별로는 고난도 과학·추론 능력을 측정하는 GPQA-Diamond 점수가 기존 방식보다 2.52점 높았고, 지시 수행 능력을 살피는 IFEval 점수도 2.22점 앞섰다. 키미 K3는 입력에 맞춰 필요한 모듈만 선택적으로 활성화하는 전문가 혼합 구조의 프론티어급 오픈웨이트 모델로, 매개변수 규모는 2조8천억 개에 이른다.
키미 K3는 학습 단계에서 가중치와 활성값을 각각 4비트와 8비트로 낮춰 설계됐다. 이 때문에 정밀도를 낮추는 일반적인 양자화 기법만으로는 추가 압축 여지가 제한적이었다. 노타는 모듈별 기여도에 따라 제거 대상을 선별하는 방식으로 이 제약을 보완했으며, 앞으로 한정된 연산 자원에서 활용할 수 있는 프론티어급 AI 모델로 기술 적용 범위를 넓힐 계획이다.