글루시스, AI 학습 최적화 기술로 ExaStor 고도화
핵심 요약
글루시스가 ETRI의 AI 분산 학습·추론 최적화 프레임워크 기술을 이전받았다. 이 기술은 AI 모델 분석과 데이터·파이프라인·텐서 병렬화, 학습·추론 스케줄링을 자동화한다. 글루시스는 ExaStor 연동 검증을 거쳐 제품 적용과 사업화를 단계적으로 추진한다.
AI·고성능컴퓨터 스토리지 전문기업 글루시스가 한국전자통신연구원(ETRI)이 개발한 AI 분산 학습·추론 프레임워크 ‘OptimusPrime’의 기술이전을 완료했다. 양측은 2024년부터 SW컴퓨팅 원천기술개발사업의 ‘AI 연산 가속기 최적화 고효율 병렬 스토리지 SW 기술 개발’ 과제를 주관기관과 참여기관으로 함께 수행했으며, 이번 이전도 공동 연구의 연장선에서 추진됐다.
이 프레임워크는 PyTorch 기반 AI 모델을 중간 표현인 IR로 즉시 변환·분석해 모델 구조와 연산 특성을 파악하고, 컴퓨팅 인프라에 맞는 모델 변환과 학습·추론 스케줄링을 자동으로 수행한다. 기존 모델을 별도로 고치지 않고 데이터·파이프라인·텐서 병렬화를 적용할 수 있다. 글루시스 연구개발진은 프레임워크 구조와 동작 원리, IR 기반 모델 분석, 자동 병렬화 및 스케줄링 등 제품 적용에 필요한 기술 역량을 확보했다.
생성형·멀티모달 AI 확산으로 모델 규모가 커지면서 제한된 컴퓨팅 자원을 효율적으로 쓰는 병렬 학습 기술의 필요성이 확대되고 있다. 기존 분산 학습 방식은 인프라 환경과 모델 특성에 맞춘 별도 설정과 최적화가 필요하지만, 이전 기술은 적합한 병렬 학습·추론 구성을 자동화한다. DGX급 고성능 AI 시스템과 범용 GPU 서버에서 성능과 자원 활용 효율을 높일 수 있으며, GPU 자원이 제한된 대학·연구기관·중소기업의 대규모 모델 운용도 지원한다.
글루시스는 이 기술을 Lustre 기반 병렬 파일 시스템과 NVMe 아키텍처를 적용한 AI 병렬 스토리지 ‘ExaStor’와 연계할 계획이다. 대규모 학습 환경에서 GPU와 스토리지 사이의 데이터 처리 효율과 GPU 활용률을 높이고 학습·추론 시간을 줄이는 것이 목표다. 연동 가능성을 검증한 뒤 제품 적용과 사업화를 단계적으로 추진하며, ETRI와 함께 학습 체크포인트와 생성형 AI 추론의 KV-Cache 처리 성능을 개선하는 AI 스토리지 기술도 중장기적으로 고도화한다.