3B만 가동해 670토큰…엔비디아의 경량 AI 승부
핵심 요약
엔비디아가 요청마다 30억 파라미터만 활성화하는 네모트론 3.5 라이트닝을 공개했다. 초당 약 670토큰을 처리하며 단일 DGX 스파크나 H100 GPU에서도 구동할 수 있다. 상업 이용 가능한 라이선스와 공개 학습 자산, 다양한 배포 경로를 갖췄다.
엔비디아가 항상 가동되는 AI 에이전트의 실행 계층을 겨냥한 소형 오픈가중치 모델 ‘네모트론 3.5 라이트닝’을 공개했다. 전체 규모는 300억 파라미터지만 혼합 전문가 구조를 적용해 요청을 처리할 때는 30억 개만 활성화한다. 가중치뿐 아니라 데이터와 학습 레시피도 함께 개방했다.
이 모델은 지능 벤치마크에서 오픈AI의 gpt-oss-120b와 비슷한 결과를 냈으며, 동급 모델 가운데 가장 빠른 초당 약 670토큰의 처리 속도를 기록했다. 에이전트 평가에서는 더 큰 네모트론 3 슈퍼를 앞섰다. 맘바와 트랜스포머를 결합한 하이브리드 구조에 멀티토큰 예측을 적용했고, 텍스트 전용 추론과 100만 토큰 컨텍스트 창을 지원한다.
가중치는 BF16과 4비트 양자화 방식의 NVFP4로 제공된다. NVFP4 모델은 단일 DGX 스파크나 H100 GPU에서 실행할 수 있으며, 추측 디코딩용 드래프트 모델 D스파크와 D플래시도 배포됐다. 오픈클로와 허메스 에이전트 등 오픈소스 하네스에서 바로 사용할 수 있도록 설계됐고, 엔비디아의 오픈소스 보안·관리 스택 네모클로도 지원한다.
네모트론 3 나노 30B A3B의 후속작인 이번 모델은 네모트론 3.5 계열의 첫 제품이며, 상업적 이용이 가능한 오픈MDW-1.1 라이선스를 채택했다. 빌드닷엔비디아닷컴과 오픈라우터에서 이용할 수 있고 딥인프라, 파이어웍스, 코어위브, 네비우스, 크루소가 서버리스 추론을 제공한다. 100억 파라미터 미만 모델로 에이전트 작업 비용을 10분의 1에서 30분의 1까지 낮출 수 있다는 지난해 연구를 제품으로 구체화한 사례로, 후속 라인업 확대 가능성도 열어뒀다.