중국 AI 가격 양극화…기업 선택 기준은 업무 효율
핵심 요약
중국 AI 모델은 비슷한 시기에 출시됐지만 출력 가격이 최대 53배 차이를 보였다. 지능지수 3점 차이에도 평가 실행 비용은 약 30배 벌어졌다. 기업은 벤치마크 순위보다 업무별 실패 비용과 실제 작업당 비용을 기준으로 모델을 배치해야 한다.
중국 AI 업계가 7월 중순부터 8월 초까지 잇달아 새 모델을 공개하면서 성능뿐 아니라 가격 격차가 기업의 핵심 판단 요소로 떠올랐다. 키미 K3와 Qwen 3.8-맥스, 딥시크 V4 플래시는 지능지수에서 각각 57점, 53점, 50점을 기록했지만 출력 토큰 100만 개당 가격은 15달러, 6달러, 0.28달러로 크게 갈렸다.
키미 K3는 전체 2조8000억 파라미터 가운데 토큰당 1040억 개를 활성화하며, Qwen 3.8-맥스는 2조4000억 개 중 950억 개를 작동시킨다. 딥시크 V4 플래시는 2840억 개 가운데 130억 개만 활성화한다. 동일한 평가에서 딥시크는 출력 토큰 2억1000만 개를 사용해 72달러가 들었고, 큐원은 1억5000만 개에 2159달러를 지출했다. 딥시크가 토큰을 40% 더 썼지만 큐원의 비용은 약 30배였다.
벤치마크 점수도 실행 환경과 평가 항목을 구분해 해석해야 한다. Qwen 3.8-맥스는 터미널벤치 2.1에서 86.6점으로 페이블 5의 84.6점을 앞섰으나, SWE-bench 프로에서는 67.7점으로 80.0점에 뒤졌다. 프런티어SWE 역시 73.5점과 88.8점으로 차이가 났다. 같은 터미널벤치에서도 페이블 5 점수가 84.6점과 80.5점으로 달라지는 만큼 하네스와 추론 노력 설정이 다른 수치를 단순 비교해서는 정확한 구매 판단이 어렵다.
가중치 공개 역시 곧바로 손쉬운 자체 배포를 뜻하지 않는다. Qwen 3.8-맥스는 4비트 압축만 적용해도 가중치가 약 1.2테라바이트에 달해 다중 노드 데이터센터 자원이 필요하지만, 함께 공개가 예고된 27B 모델은 일반적인 온프레미스 GPU에서 운용할 수 있다. 라이선스도 딥시크와 GLM-5.2는 MIT, 키미 K3는 자체 조건을 적용한다. 기업은 실패 비용이 큰 작업에는 상위 모델을 배치하고, 분류·1차 요약처럼 검증하기 쉬운 대량 작업에는 저비용 모델을 투입한 뒤 실제 업무 100건의 작업당 비용을 비교할 필요가 있다.