B200 7656장 품은 팩토리X, 수랭으로 열 잡는다
핵심 요약
NHN 팩토리X 서울에서 엔비디아 B200 GPU 7656장이 수랭식 냉각 환경으로 가동되고 있다. 관제 인력이 24시간 장비와 시설을 점검하고 GPU·CPU 열의 약 70%를 물로 제거한다. 전력 이중화와 고밀도 냉각 설계가 대규모 AI 자원의 안정적 운영을 뒷받침한다.
서울 영등포구 양평동의 AI 데이터센터 ‘NHN 팩토리X 서울’에서는 엔비디아 B200 GPU 7656장이 수랭식 냉각 환경에서 가동되고 있다. NHN클라우드는 글로벌 자산운용사 액티스의 데이터센터 일부를 임차해 정부와 AI 인프라를 구축했으며, 3층부터 6층까지 전력·냉각·네트워크·GPU를 하나의 체계로 관리한다. 단일 데이터센터 GPU 자원으로는 국내 최대 규모이며, 이 정도 규모의 GPU에 수랭 방식을 적용한 국내 첫 사례다.
2층 관제실 벽면에는 GPU 서버와 네트워크, 스토리지의 상태를 비롯해 장비 사용률, 장애 여부, 데이터홀 온도와 냉각 환경이 실시간으로 표시됐다. AI 모델 학습은 일주일 이상, 대규모 작업은 한 달 가까이 이어질 수 있어 연산 중단을 막는 상시 관리가 필요하다. 현장에는 주간 3명과 야간 2명이 2교대로 근무하고, 판교 인력은 서비스와 애플리케이션 영역을 원격 점검한다.
6층 데이터홀은 공랭 장비의 열기가 순환할 수 있도록 층고를 8m로 확보했다. 랙마다 GPU 서버 6대와 냉각수분배장치가 설치됐고, 상단에는 냉각수 공급·회수 배관과 전력 케이블 6개가 연결됐다. 서버 내부 콜드플레이트가 GPU와 CPU의 열을 직접 흡수하며, 발생 열의 약 70%는 수랭으로 제거한다. 수랭이 적용되지 않은 네트워크와 스토리지 장비의 나머지 열은 공랭 설비가 처리한다.
시설은 랙당 75kW급 고밀도 환경으로 설계됐으며 전체 수전 용량은 40MW, IT 장비용 전력은 26MW다. NHN클라우드가 사용하는 4개 층에는 약 13MW가 배정돼 정부 프로젝트와 자체 활용분 대부분을 가동하고 있다. 외부 전력 이중화와 UPS, 비상발전기로 정전에 대비하고, 냉각수 압력·유량·온도 이상 때 공급을 자동 차단한다. 광주 국가 AI 데이터센터와 비교한 운영 경험에서도 수랭 환경의 장비 장애가 상대적으로 적어, AI 인프라 경쟁의 무게중심이 GPU 확보를 넘어 전력·냉각의 안정적 운영으로 넓어지고 있다.