노타, 키미 K3 GPU 요구량 절반으로 축소
핵심 요약
노타가 키미 K3 경량화 모델 2종을 공개했다. 구동에 필요한 B300 GPU는 기존 8장에서 최대 4장으로 줄었다. 회사는 비균일 전문가 프루닝의 적용 대상을 프론티어급 모델로 확대할 계획이다.
AI 모델 경량화·최적화 기업 노타가 문샷AI의 초거대 오픈웨이트 모델 ‘키미 K3’를 압축해 구동에 필요한 엔비디아 B300 GPU 수를 기존 8장에서 최대 4장으로 줄였다. 노타는 전문가 모듈을 25%와 50% 제거한 경량화 모델 2종을 공개했으며, 각 모델은 B300 GPU 6장과 4장에서 구동된다.
키미 K3는 2조8000억개 매개변수를 갖춘 프론티어급 모델로, 입력에 맞춰 필요한 모듈만 활성화하는 전문가 혼합(MoE) 구조를 사용한다. 학습 단계부터 가중치와 활성값이 각각 4비트와 8비트로 설계돼 정밀도를 낮추는 일반적인 양자화만으로 추가 압축하기는 제한적이었다. 노타는 층별 특성과 모듈 중요도를 분석하는 자체 ‘비균일 전문가 프루닝’ 기술을 적용해 이 문제에 대응했다.
비균일 전문가 프루닝은 핵심 전문가 모듈을 남기고 기여도가 낮은 모듈을 골라 제거하는 방식이다. 모든 층에서 같은 비율로 모듈을 덜어내는 기존 접근과 달리, 각 층의 제거 비율을 다르게 설정해 성능 손실을 줄이는 데 초점을 맞췄다. 자체 평가에서는 50% 경량화 모델이 REAP 방식보다 대다수 벤치마크에서 높은 성능 보존율을 기록했다. GPQA-다이아몬드와 IFEval 점수도 각각 2.52점과 2.22점 높았다.
노타는 앞서 업스테이지의 ‘솔라 오픈2’를 경량화해 허깅페이스에 공개했으며, 해당 모델은 공개 2주 만에 누적 다운로드 6만8000회를 넘어섰다. 김태호 노타 최고기술책임자는 솔라 오픈2에 이어 키미 K3에서도 주요 성능을 유지하면서 GPU 요구량을 최대 절반으로 낮췄다고 밝혔다. 회사는 한정된 연산 자원에서도 프론티어급 AI 모델을 활용할 수 있도록 기술 적용 범위를 넓힐 계획이며, 두 경량화 모델은 허깅페이스에서 확인할 수 있다.