SK텔레콤 AI 검증 기준, 사우디 통신 연구가 주목
핵심 요약
SK텔레콤의 텔에이전트벤치가 사우디 통신사와 대학의 공동 연구에서 주요 선행 평가체계로 다뤄졌다. 텔에이전트벤치는 실제 통신 업무와 유사한 환경에서 AI의 다섯 가지 핵심 역량을 1천700여 개 문항으로 검증한다. 통신 AI 에이전트 운영체계를 둘러싼 SK텔레콤의 국제 협력도 이어지고 있다.
SK텔레콤이 만든 통신 특화 인공지능 에이전트 평가체계 ‘텔에이전트벤치’가 사우디아라비아 최대 통신사 stc와 킹압둘라과학기술대학교의 공동 연구에서 주요 선행 벤치마크로 다뤄졌다. 양측이 지난달 공개한 ‘텔코-가이아’ 연구는 텔에이전트벤치를 연구 방향과 성격이 가장 가까운 기존 평가체계로 분류했다.
텔에이전트벤치는 SK텔레콤 연구진이 자연어처리학회 EMNLP 2025 산업 트랙에서 발표한 평가체계다. 추론과 계획, 도구 활용, 검색증강생성, 지시 이행 등 다섯 가지 역량을 1천700여 개 문항으로 측정한다. 요금 조회와 부가서비스 가입·해지, 데이터 사용량 확인, 요금제 안내, 가족 결합 조회 등 실제 고객 서비스 업무도 평가 항목에 담았다.
평가 환경은 통신사의 통합전산시스템과 유사하게 설계됐다. AI가 질문에 답하는 수준을 넘어 필요한 전산 기능을 고르고, 정해진 순서에 맞춰 업무를 마칠 수 있는지 검증하는 구조다. 텔코-가이아 역시 실제 통신사 웹사이트와 문서, 가상 고객정보를 이용해 여러 정보를 검색하고 업무를 처리하는 능력을 살피며, 영어와 아랍어 기반 100개 과제로 구성됐다.
두 체계는 통신 현장의 업무 수행 능력을 평가한다는 공통점을 지니지만 적용 언어와 자료 형식에는 차이가 있다. 텔에이전트벤치는 한국어를 기반으로 하며 이미지와 PDF 활용 범위도 텔코-가이아와 다르다. SK텔레콤은 관련 운영체계 개발에서 국제 협력을 이어가고 있다. TM 포럼은 지난달 SK텔레콤 등이 공동 제시한 통신 AI 에이전트 프레임워크가 고객 서비스 비용을 15∼20% 낮추고 고객관리와 네트워크 운영 생산성을 30∼40% 높일 잠재력이 있다고 평가했다.