SKT·MIT, 추론 단계 학습으로 A.X K2 효율 높인다
핵심 요약
SK텔레콤과 MIT가 추론 시점 학습을 이용한 대규모 언어 모델 성능 향상 연구를 진행한다. 긴 문맥의 정보를 연결하고 충돌을 감지하는 통합 능력도 공동으로 고도화한다. 연구 성과는 A.X K2의 추론 연산 자원 대비 성능과 서비스 효율 개선에 활용될 수 있다.
SK텔레콤과 미국 매사추세츠공과대학교(MIT)가 ‘추론 시점 학습’을 활용해 대규모 언어 모델의 추론 성능을 높이는 공동 연구에 착수했다. 학습을 마친 모델이 문제와 관련 자료를 토대로 짧은 추가 학습을 거친 뒤 답을 생성하도록 하는 기술이다. 연구 성과는 독자 AI 파운데이션 모델 ‘A.X K2’의 연산 자원 대비 성능을 높이는 데 활용될 수 있다.
공동 연구는 MIT의 글로벌 산학 협력 컨소시엄 ‘MGAIC’ 소속 과제로 진행된다. MGAIC에는 SK텔레콤과 오픈AI, 코카콜라 등이 참여해 60개 넘는 프로젝트를 추진하고 있다. 연구진은 추론 단계의 추가 연산을 수학 문제 풀이와 다단계 판단에 효과적으로 배분하는 방법과 함께, 긴 문서의 앞뒤 정보를 연결하고 논리적 충돌을 감지하는 ‘통합’ 능력을 고도화할 계획이다.
AI 개발 경쟁은 매개변수와 학습 데이터, 연산량을 사전 학습 단계에서 확대하던 방식에서 답변 생성 과정에 연산 자원을 더 투입하는 방향으로 넓어지고 있다. 검색 능력이 방대한 텍스트에서 필요한 정보를 찾아내는 데 초점을 둔다면 통합 능력은 문서 전체의 일관성을 유지하는 데 목적이 있다. 처리 가능한 토큰 수가 100만개에 이르더라도 통합 능력이 부족하면 긴 문맥을 깊게 이해하지 못할 수 있다.
연구를 이끄는 김윤형 MIT 전기전자공학·컴퓨터과학부 교수는 추론 연산량이 늘면 성능과 함께 서비스 비용과 응답 시간도 증가할 수 있어 자원 효율이 중요하다고 진단했다. 독자 AI 평가는 화려한 신기술보다 글로벌 핵심 지표에서 선도 모델과의 격차를 얼마나 줄였는지 살펴야 한다는 입장도 제시했다. 소버린 AI의 기반으로는 연산 자원 확보를 넘어 대규모 시스템을 직접 구축·운영한 연구자와 기술자의 경험 축적을 꼽았다.