RNGD, 고부하 LLM 추론서 전력 효율 확인
핵심 요약
RNGD가 동시 요청 256건에서 RTX PRO 6000 처리량의 95%를 기록했다. 같은 조건에서 전력 소비는 30% 적었고 전력당 처리량은 전체 구간에서 1.3~1.5배 높았다. 백서는 사내 LLM과 배치 추론, 기존 GPU 클러스터의 추론 계층 확장을 주요 활용처로 제시했다.
래블업은 7월 29일 퓨리오사AI와 함께 2세대 신경망처리장치(NPU) RNGD의 실제 구동 성능을 분석한 기술 백서를 발간했다. 백엔드닷에이아이 환경에서 RNGD와 엔비디아 RTX PRO 6000 블랙웰 서버 에디션을 비교한 결과, RNGD는 동시 요청 256건에서 상대 제품의 95%에 해당하는 토큰 처리량을 기록하면서도 전력 소비량은 30% 적었다.
시험에는 큐웬 3-32B FP8 모델과 각 가속기 카드 4장을 장착한 서버가 사용됐다. 동시 요청 1건에서 RNGD와 RTX PRO 6000의 처리량은 각각 초당 71토큰과 79토큰이었으며, 256건에서는 2336토큰과 2467토큰으로 격차가 줄었다. 같은 구간의 소비전력은 각각 692W와 983W였고, RNGD의 전력당 처리량은 전체 구간에서 1.3~1.5배 높게 측정됐다. 첫 토큰 생성 지연도 요청 1건에서 0.14초와 0.17초, 32건에서 0.54초와 1.73초, 256건에서 7.37초와 9.33초로 RNGD가 짧았다.
RNGD는 TSMC 5나노미터 공정과 독자적인 텐서 축약 프로세서 구조를 적용하고, 48GB HBM3 및 256MB 온칩 SRAM을 탑재했다. 열설계전력은 180W다. 사용자는 퓨리오사AI 컴파일러와 Furiosa-LLM으로 모델을 구동하고, 백엔드닷에이아이에서 자원 할당과 작업 관리, 사용량 측정 등을 통합 운영할 수 있다. 오픈AI와 앤트로픽의 표준 API 규격을 지원해 접속 주소 변경만으로 LLM을 연동할 수 있으며 폐쇄망 구축도 가능하다.
백서는 RNGD의 활용처로 사내 LLM 비서와 챗봇, 대량 문서 처리와 배치 추론, 기존 GPU 클러스터의 추론 계층 확장을 제시했다. 퓨리오사AI는 RNGD를 양산하며 삼성SDS 클라우드의 NPU 서비스, 포르투갈 리스본 데이터센터 배치, 스웨덴 15MW급 데이터센터 공급을 추진하고 있다. 정부도 K-클라우드 프로젝트와 국산 AI 반도체 기반 컴퓨팅 인프라 사업 등을 통해 NPU 도입을 지원하고 있어, 이번 시험 결과는 추론용 국산 반도체의 처리 성능과 운영 효율을 판단할 근거로 활용될 전망이다.