엔비디아, 경량 개방형 AI로 GPU 수요 확장
핵심 요약
엔비디아가 단일 PC용 GPU에서도 구동되는 개방형 경량 모델 네모트론 3.5 라이트닝을 출시했다. 신제품은 토큰 생성 속도를 최대 4배 높이고 작업 시간을 30% 줄이는 데 초점을 맞췄다. 엔비디아는 네모 스위치야드와 네모트론 4 개발을 통해 개방형 AI 선택지와 GPU 수요 확대를 추진한다.
엔비디아가 11일(현지시간) PC의 단일 그래픽처리장치(GPU)에서도 구동할 수 있는 개방형 경량 인공지능 모델 ‘네모트론 3.5 라이트닝’을 출시했다. 매개변수 300억 개 규모의 경량 혼합전문가(MoE) 모델로, 이용자는 별도 비용이나 사전 승인 없이 모델을 사용하고 가중치까지 수정할 수 있다.
네모트론 3.5 라이트닝은 기존 네모트론과 달리 자율적으로 업무를 처리하는 AI 에이전트의 실행 속도와 비용 효율을 높이는 데 초점을 맞췄다. 크고 성능이 높은 모델의 지식을 작은 모델에 전달하는 증류 기술을 적용해 동급 모델보다 토큰 생성 속도를 최대 4배로 끌어올리고, 작업 시간은 30% 줄이도록 설계됐다.
엔비디아는 업무 종류에 맞는 최적의 모델을 자동으로 선택해 비용을 최대 3분의 1로 낮추는 ‘네모 스위치야드’도 함께 공개했다. 동시에 매개변수 1조 개를 처리하는 대규모 개방형 AI 모델 ‘네모트론 4’ 개발도 진행하고 있다. 최종 학습은 아직 끝나지 않았으며, 개발 일정이 계획대로 이어지면 이르면 늦가을 공개될 수 있다.
이번 제품군 확대는 오픈AI와 앤스로픽 등 엔비디아 고객사와 직접 경쟁하기보다 시장에 개방형 AI 선택지를 늘려 전체 GPU 수요를 키우려는 전략과 맞닿아 있다. 카리 브리스키 엔비디아 생성형AI 부문 부사장은 기업과 국가가 안전·보안을 강화하고 혁신을 앞당기려면 접근 가능한 최첨단 개방형 모델이 필요하다며, 이를 네모트론 투자 배경으로 제시했다.