노타, 키미 K3 구동 GPU 8장서 4장으로
핵심 요약
노타가 키미 K3의 전문가 모듈을 줄인 경량화 모델 2종을 공개했다. 구동에 필요한 B300 GPU 수는 기존 8장에서 각각 6장과 4장으로 감소했다. 50% 경량화 모델은 자체 평가의 대다수 벤치마크에서 기존 제거 방식보다 높은 성능 보존율을 기록했다.
노타가 중국 문샷AI의 초거대 인공지능 모델 ‘키미 K3’를 경량화해 구동에 필요한 그래픽처리장치(GPU)를 기존 8장에서 최대 4장으로 줄였다. 노타는 전문가 모듈을 각각 25%와 50% 축소한 경량화 모델 2종을 6일 공개했다. 두 모델에 필요한 GPU는 각각 6장과 4장이다.
경량화에는 노타가 자체 개발한 ‘비균일 전문가 프루닝’ 기술이 적용됐다. 모델의 층별 특성과 각 모듈의 중요도를 분석해 핵심 전문가는 유지하고 기여도가 낮은 모듈만 골라 제거하는 방식이다. 모든 층에서 전문가를 같은 비율로 줄이는 기존 방식과 달리 층마다 제거 비율을 달리해 성능 저하를 최소화했다.
키미 K3는 2조8000억 개의 매개변수를 갖춘 오픈웨이트 모델로, 입력값에 필요한 모듈만 선택해 활성화하는 전문가 혼합(MoE) 구조를 채택했다. 기존 모델을 구동하려면 엔비디아의 최신 고성능 GPU B300 8장이 필요했다. 학습 단계부터 가중치와 활성값이 각각 4비트와 8비트로 설계돼 일반적인 양자화만으로 추가 압축하기에도 한계가 있었다.
노타의 자체 평가에서 전문가 모듈을 50% 줄인 모델은 기존 방식인 REAP보다 대다수 벤치마크에서 높은 성능 보존율을 나타냈다. 고난도 과학·추론 평가인 GPQA-Diamond와 지시 수행 평가인 IFeval에서는 각각 2.52점과 2.22점 높았다. 노타는 앞서 업스테이지 ‘솔라 오픈2’의 GPU 수를 8장에서 2장으로 줄였으며, AMD 로보틱스 생태계 참여와 AI 칩 최적화 서비스 출시 등 연산 환경 최적화 범위를 넓혀 왔다. 김태호 최고기술책임자는 한정된 연산 자원에서도 프론티어급 AI 모델을 효율적으로 활용할 수 있도록 기술 적용 범위를 확대하겠다고 밝혔다.