A.X K2, 국제 수학 평가서 정상급 추론력 확인
핵심 요약
A.X K2가 IMO 2026 평가에서 금메달 기준과 같은 29점을 기록했다. MathArena AIME 2026에서는 정확도 97.1%로 공동 최고점에 올랐다. 수학 추론 성능은 복잡한 산업 문제와 과학 연구에서 AI 활용 가능성을 가늠하는 지표다.
SK텔레콤의 독자 인공지능 모델 ‘A.X K2’가 IMO 2026 6개 문제 평가에서 42점 만점에 29점을 얻었다. 올해 국제수학올림피아드 금메달 기준선과 같은 점수다. 미국과 중국 이외 지역에서 개발된 모델 중 이 기준을 충족한 사례이며, 국내 모델로는 유일하다. 중국 샤오홍슈의 ‘dots-note-3.0’은 같은 평가에서 42점 만점을 기록했다.
A.X K2는 IMO 2025 기출문제에서도 42점 중 35점으로 당시 금메달 기준에 도달했고, KMO 2026 2차 평가에서는 만점을 받았다. 이전 모델 A.X K1 역시 KMO 1차 시험에서 국내 독자 모델 중 최고점을 거뒀다. 허깅페이스 ‘MathArena AIME 2026’에서는 정확도 97.1%로 싱킹 머신스 랩의 ‘잉클링’과 공동 1위에 올랐다. 스텝펀의 ‘Step-3.5-Flash’는 96.67%, 문샷AI의 ‘Kimi-K2.6’은 96.4%였다.
AIME는 미국수학올림피아드 선발 과정에 활용되는 시험이며, MathArena AIME 2026은 올해 문제를 토대로 공개한 30개 문항의 최종 답변 정확도를 측정한다. 수학 평가는 복잡한 문제를 여러 단계로 분해해 일관된 결론을 내리는 능력을 살필 수 있고 정답과 오답의 구분도 명확하다. 자연어 답변보다 정확성을 객관적으로 확인하기 쉬워 단순 계산을 넘어 AI의 논리적 추론 능력을 검증하는 지표로 쓰인다.
수학 추론력은 금융·회계, 제조 공정 최적화, 물류, 과학 연구처럼 복잡한 계산과 다단계 판단이 필요한 분야의 활용 가능성과 연결된다. 작은 오류도 비용 증가나 잘못된 의사결정으로 이어질 수 있어 정확성이 중요하다. 국제 AI 안전 보고서도 수학 추론 향상이 안전 필수 소프트웨어 검증과 과학 문제 해결, AI 연구의 성능 개선으로 이어질 가능성에 주목했다. 지난달 공개된 A.X K2는 6880억 개 매개변수를 갖췄으며 수학·과학 추론과 한국 지식, 장문 추론 능력을 강화했다.