기기 연산에 맞춘 경량 언어모델 ‘옵트기어’ 출시
핵심 요약
옵트에이아이가 기기 자체 연산에 맞춰 설계한 오픈소스 경량 언어모델 옵트기어를 공개했다. 고정 크기 상태와 정적 연산 구조를 적용해 메모리 부담을 줄이고 다양한 처리장치로의 이식성을 높였다. 스마트폰 칩 속도와 지식·한국 문화 평가에서 비교 모델을 앞섰으며 가전·모빌리티·국방 분야 활용이 제시됐다.
온디바이스 인공지능 솔루션 기업 옵트에이아이가 자체 설계한 첫 파운데이션 모델 ‘옵트기어’를 6일 오픈소스로 공개했다. 스마트폰과 노트북뿐 아니라 마이크로컨트롤러에서도 구동할 수 있도록 개발됐으며, 매개변수 규모에 따라 10억개와 2억7000만개, 100만개 등 세 가지 모델로 구성됐다. 가중치와 배포 파일도 함께 제공된다.
옵트기어에는 자체 개발한 ‘콘브KV 게이티드 믹서’ 구조가 적용됐다. 문맥이 길어질수록 키-값 캐시가 커져 메모리 접근 부담이 증가하는 기존 방식과 달리, 다수의 지역 어텐션 계층을 합성곱 연산으로 바꿨다. 이에 따라 문맥 길이와 관계없이 고정된 상태를 유지하며, 6만4000토큰 문맥에서도 지역 계층이 보존하는 상태는 3개 위치로 제한된다.
서버를 거치지 않고 기기에서 직접 연산하는 온디바이스 AI는 응답 속도와 데이터 보호에 이점이 있지만, 제한된 메모리와 전력 안에서 모델을 작동시켜야 한다. 옵트기어는 서버용 거대 언어모델을 축소하는 대신 SRAM, 메모리 대역폭, 전력과 지연 시간의 제약을 반영해 구조를 새로 설계했다. 소프트맥스와 행렬곱 같은 동적 연산을 배제하고 정적 연산만 사용해 CPU와 GPU, NPU에 쉽게 이식할 수 있도록 했다. 기술 리포트는 논문 사전공개 사이트 아카이브에 등재됐다.
스마트폰용 칩에서 실시한 측정에서는 갤럭시 S26의 퀄컴 스냅드래곤 8 엘리트 Gen5 NPU가 입력 토큰을 초당 7042개 처리해 알리바바 ‘큐원 3-1.7B’보다 2.9배 빨랐다. 아이폰 17 프로의 토큰 생성 속도는 LG ‘엑사원 4.0-1.2B’의 4.9배였다. MMLU와 HAERAE 점수는 각각 43.2점과 44.2점으로, 구글 ‘젬마 3-1B’의 39.8점·35.3점과 엑사원 4.0-1.2B의 37.2점·30.2점을 웃돌았다. 사전학습에는 경쟁 모델의 4분의 1 이하인 0.5조개 토큰을 사용했고 증류 기법은 적용하지 않았다. 기업별 목적에 맞춘 도입이 가능해 가전과 모빌리티, 국방 등 실시간성과 보안이 중요한 분야가 활용 대상으로 제시됐다.