노타, 키미 K3 압축해 B300 4장 구동
핵심 요약
노타가 키미 K3의 전문가 모듈을 줄여 구동에 필요한 B300 GPU를 8장에서 최대 4장으로 감축했다. 비균일 전문가 프루닝을 적용한 경량화 모델 2종은 자체 평가에서 핵심 성능을 유지했다. 솔라 오픈2에 이어 프론티어급 AI 모델을 제한된 연산 자원에서 운영할 수 있는 최적화 성과를 확보했다.
AI 모델 최적화 기업 노타가 중국 문샷AI의 거대언어모델 ‘키미 K3’를 경량화해 구동에 필요한 엔비디아 고성능 GPU ‘B300’ 수를 기존 8장에서 최대 4장으로 줄였다. 노타는 전문가 모듈을 25%와 50%씩 축소한 모델 2종을 공개했으며, 자체 평가에서는 핵심 성능이 유지된 것으로 확인했다.
노타는 자체 개발한 ‘비균일 전문가 프루닝’ 기술로 모델 성능에 미치는 기여도가 낮은 모듈을 선별해 제거했다. 전문가 모듈을 25% 줄인 모델은 B300 6장, 50% 줄인 모델은 4장에서 구동됐다. 기존 모델에 필요했던 8장과 비교하면 GPU 사용량이 각각 25%와 50% 감소해 프론티어급 모델 운영에 투입되는 인프라 비용을 낮출 수 있게 됐다.
키미 K3는 2조8000억개 매개변수를 갖추고 입력값에 필요한 모듈만 선택적으로 활성화하는 전문가 혼합 구조를 적용한 프론티어급 오픈웨이트 AI 모델이다. 학습 단계부터 가중치와 활성값의 정밀도를 각각 4비트와 8비트로 낮춰 설계됐다. 이 때문에 숫자 정밀도를 낮춰 모델 크기와 연산량을 줄이는 일반적인 양자화 방식만으로는 추가 압축 범위가 제한적이었다.
노타는 앞서 업스테이지의 독자 AI 파운데이션 모델 ‘솔라 오픈2’도 경량화해 메모리 용량 기준 GPU 8장이 필요했던 모델을 2장 환경에서 구동했다. 허깅페이스에 공개된 이 모델은 공개 2주 만에 누적 다운로드 6만8000회를 넘었다. 김태호 노타 최고기술책임자는 솔라 오픈2에 이어 키미 K3에서도 주요 성능을 유지하면서 연산 효율을 높였다며, 한정된 연산 자원에서 활용할 수 있는 프론티어급 AI 모델로 기술 적용 범위를 확대하겠다고 밝혔다.