AI 신모델 경쟁에 독립 평가 수요 급증
핵심 요약
2026년 7월 주요 AI 모델이 연이어 출시되며 아티피셜어낼리시스의 웹사이트 트래픽이 전월보다 40% 증가했다. 이 기관은 9개 벤치마크를 종합해 네 범주의 역량을 반영한 100점 만점 지능지수를 산출한다. 평가가 전문 지식과 실무 능력으로 확대되는 가운데 시험 최적화와 투명성 문제도 과제로 떠올랐다.
오픈AI의 GPT-5.6 시리즈를 비롯한 주요 인공지능 모델이 2026년 7월 잇달아 공개되면서 독립 성능 분석 기관이 주목받고 있다. 아티피셜어낼리시스의 7월 웹사이트 트래픽은 전월보다 40% 늘었다. 선택지가 급격히 많아진 기업과 개발자들이 모델별 성능을 비교하고 용도에 맞는 제품을 가려내려는 움직임을 보인 결과다.
7월에는 앤트로픽 오퍼스5, xAI 그록 4.5, 중국 키미 K3와 딥시크 V4 플래시도 시장에 나왔다. 아티피셜어낼리시스는 자체 종합 지능 벤치마크와 코딩 평가인 터미널벤치 2.1을 포함한 9개 시험 결과를 결합한다. 에이전트·코딩·과학적 추론·일반 능력 등 네 범주를 가중 평균해 100점 만점의 지능지수를 산출한다.
평가 방식도 모델의 발전 속도에 맞춰 복잡해지고 있다. AI 안전 센터와 스케일AI는 2024년 9월 전문 영역의 고난도 문제를 모은 ‘인류의 마지막 시험’을 추진했다. 2025년 4월 등장한 과학 분야 평가 도구 큐리는 긴 정보를 이해하고 추론하는 능력을 측정했으며, 제미나이 2.0 플래시의 정답률은 32%에 그쳤다. 같은 해 6월 공개된 페이퍼벤치는 코드 작성과 실험 복제 능력까지 평가 범위에 넣었다.
단일 시험 점수보다 여러 지표를 함께 보는 평가가 부상한 배경에는 기존 벤치마크가 기술 발전을 따라가지 못하고, 개발사가 자사에 유리한 결과를 선별해 제시하는 문제가 있다. 물리학과 고고학 등 전문 연구자 수준의 지식, 실제 업무 수행 능력, 환각 여부를 점검하는 시험도 등장했다. 다만 특정 시험에 맞춘 훈련이나 채점 오류, 평가 과정의 투명성 부족은 독립 기관이 공신력을 유지하기 위해 풀어야 할 과제로 남아 있다.