AI 메모리 확장 해법으로 떠오른 CXL
핵심 요약
CXL이 추론형 AI의 GPU 메모리 용량 부족을 보완할 기술로 부상했다. 삼성전자 실험에서 추론 처리량은 최대 9배 높아지고 첫 토큰 생성시간은 최대 16분의 1로 줄었다. 삼성전자·SK하이닉스·마이크론은 CXL 확장 기술을 공개하며 초기 시장 경쟁에 나섰다.
추론형 AI 확산으로 GPU 메모리의 용량 부담이 커지면서 CXL이 HBM의 한계를 보완할 확장 기술로 부상했다. 삼성전자 연구진은 CXL 메모리가 AI 서비스의 GPU 메모리 부족을 완화할 수 있다는 연구 결과를 최근 공개했다. 삼성전자와 SK하이닉스, 마이크론도 지난 4일부터 6일까지 미국에서 열린 ‘FMS 2026’에서 관련 기술과 활용 방안을 선보이며 초기 시장 선점 경쟁에 들어갔다.
삼성전자의 D램 기반 CXL 장치는 KV캐시 전송 실험에서 시스템 메인 D램과 비슷한 처리량을 나타냈다. 대화가 길어지는 환경에서는 GPU의 V램만 사용했을 때보다 추론 처리량이 최대 9배로 높아졌고, 첫 토큰 생성에 걸리는 시간은 최대 16분의 1로 단축됐다. 삼성전자는 CXL 2.0 기반 CMM-D 제품 ‘MD220’의 후속 모델인 ‘MD310’도 공개했으며 양산 시점을 조율하고 있다.
CXL은 메모리와 프로세서 등을 높은 대역폭과 메모리 일관성을 갖춘 방식으로 연결해 기존 D램 구성의 물리적 제약을 넘어 메모리 용량을 확장한다. CXL 스위치로 여러 메모리 장치를 공유 메모리풀로 묶으면 수요에 맞춰 용량을 유연하게 배분할 수 있다. 생성형 AI가 이전 처리 정보를 재활용하기 위해 저장하는 KV캐시는 대화가 이어질수록 커진다. 연산 속도가 중요한 데이터는 HBM에 두고, HBM에 모두 담기 어려운 대용량 KV캐시는 CXL D램으로 옮기는 계층형 구성이 주목받는 배경이다.
SK하이닉스는 여러 서버와 GPU가 연결된 분산 시스템에서 CXL로 KV캐시를 관리하는 메모리 확장 기술을 공개했다. 기존 네트워크 기반 방식에서 발생하는 데이터 이동 병목을 줄이는 기술과 함께, D램과 SSD를 결합한 CXL 하이브리드 메모리도 개발하고 있다. 대용량 데이터는 상대적으로 저렴한 SSD에 저장하고 자주 쓰는 데이터는 D램으로 미리 불러오는 구조다. 글로벌 CXL 연결형 D램 모듈 시장은 올해 15억9000만달러에서 2031년 63억1000만달러로 약 4배 성장할 전망이다.