AI 추론료 바닥 찍었지만 서버 비용 압박 커졌다
핵심 요약
글로벌 AI 평균 추론 가격이 100만 토큰당 1.16~1.18달러로 올해 최저 수준을 기록했다. 딥시크는 오픈라우터 토큰 처리량 점유율 27%를 넘기며 구글을 앞섰다. 급증한 서버와 컴퓨팅 비용으로 중국 AI 기업의 가격 인상 가능성이 커지고 있다.
중국 인공지능 기업의 저가 경쟁으로 글로벌 AI 평균 추론 가격이 올해 최저 수준으로 내려갔지만, 빠르게 늘어난 사용량과 서버·컴퓨팅 비용이 가격 전략의 변수로 떠올랐다. 지난 6~8일 평균 추론 가격은 100만 토큰당 1.16~1.18달러를 기록했다. 5월 31일 2.04달러에서 7월 말 1.45달러로 하락한 데 이어 이달 초에는 1.2달러 선마저 밑돌았다.
가격 하락을 주도한 모델 가운데 딥시크의 ‘V4-플래시-0731’은 작업당 비용이 약 0.03달러로 책정됐다. 여러 AI 모델을 제공하는 오픈라우터에서 딥시크의 토큰 처리량 점유율은 10일 기준 27%를 넘어 구글의 25%를 앞섰다. V4-플래시-0731은 지난주 8조2200억 토큰을 처리해 1위에 올랐고, 텐센트 ‘Hy3’는 7조1300억 토큰, 지난 4월 출시된 딥시크의 이전 모델은 6조500억 토큰을 기록했다.
AI 평균 추론 가격 지수는 개발자가 이용하는 기업용 API 사업자와 오픈웨이트 추론 플랫폼의 가격을 추적한다. 이 지표의 하락은 중국 업체들이 초저가 모델을 앞세워 이용 수요를 끌어올린 흐름과 맞물렸다. 그러나 추론 요청이 증가할수록 GPU와 서버 자원 투입도 함께 늘어난다. 낮은 단가를 유지한 채 급증하는 처리량을 감당해야 하는 구조가 중국 AI 기업의 비용 부담을 키우고 있다.
가격 조정은 최신 제품에서 이미 확인되고 있다. 딥시크와 즈푸AI, 미니맥스, 문샷AI가 최근 출시한 모델은 올해 초 제품보다 비싸게 제공되고 있다. 즈푸AI는 2월 ‘GLM-5’를 입력 토큰 100만 개당 1달러, 출력 기준 3.20달러에 내놨지만 후속 ‘GLM-5.2’ 가격을 각각 1.40달러와 4.40달러로 올렸다. 딥시크도 V4-플래시 이용 증가에 따른 서버 용량 부담을 이유로 기업 고객에게 큰 폭의 인상 가능성과 예산 조정 필요성을 알렸다. 중국 업체의 비용 압박이 커지면서 미국 기업까지 가세했던 글로벌 초저가 경쟁의 강도도 달라질 가능성이 생겼다.