B200 7656장 집결한 NHN AI 인프라 거점
핵심 요약
NHN 팩토리X가 엔비디아 B200 GPU 7656장 기반의 정부 AI 컴퓨팅 인프라를 운영한다. 4080장을 묶은 클러스터1은 글로벌 슈퍼컴퓨터 TOP500에서 세계 20위를 기록했다. 전 층 직접수랭식 냉각과 24시간 관제, 분리 네트워크를 기반으로 운영 안정성과 보안을 관리한다.
서울 영등포구 NHN 팩토리X 서울 데이터센터에서는 정부 사업으로 조성된 엔비디아 B200 그래픽처리장치(GPU) 7656장이 가동되고 있다. 6일 찾은 6층 데이터홀에는 검은색 GPU 랙이 일정한 간격으로 길게 늘어서 있었고, 장비 작동음과 벽면에서 공급되는 찬 공기가 공간을 채웠다. 이곳은 NHN클라우드가 고성능 컴퓨팅 자원을 운영하는 인공지능 데이터센터(AIDC)로, 전체 IT 로드는 13㎿ 규모다.
NHN 팩토리X는 글로벌 인프라 투자사 액티스가 투자한 데이터센터의 3층부터 6층까지 사용한다. 3·4층에는 B200 GPU 4080장, 510노드를 하나의 연산 환경으로 묶은 클러스터1이 구축돼 글로벌 슈퍼컴퓨터 성능 순위 TOP500에서 세계 20위에 올랐다. 5층에는 GPU 2040장으로 구성된 255노드 클러스터가 자리하며, 6층의 자체 AI 클라우드 서비스 및 GPU 인프라는 192노드 규모로 운영된다.
고밀도 GPU에서 발생하는 열을 처리하기 위해 모든 층에 직접수랭식 냉각 방식이 적용됐다. GPU와 중앙처리장치에 콜드 플레이트를 맞대고 액체 냉매를 순환시켜 열을 제거하며, 서버 열의 약 70~80%를 차지하는 두 부품 이외의 메모리·네트워크 카드·인피니밴드 스위치·스토리지는 공랭으로 식힌다. B200 장비의 전력 요구량은 공랭 환경의 약 14.3㎾에서 수랭 적용 시 약 12.3㎾로 낮아진다.
관제실은 장비 사용률과 장애 여부, GPU·네트워크·스토리지 상태, 데이터센터 환경을 대형 모니터로 실시간 감시하며 24시간 운영된다. 냉각수 공급에 문제가 생기거나 온도가 지나치게 오르면 GPU 성능 저하와 자체 셧다운으로 이어질 수 있어 냉각수의 온도·압력·유량과 누수 여부도 별도로 관리한다. 정부 사업의 보안 요건에 맞춰 기존 NHN클라우드 환경과 네트워크를 분리했고, 방화벽과 디도스 대응 장비, 침입방지시스템(IPS), 관리 UTM을 배치해 계층형 방어 체계를 구성했다.