딥시크 선두 탈환…중국 LLM 14주째 우세
핵심 요약
DeepSeek V4 Flash가 주간 7조2200억 토큰으로 OpenRouter 호출량 1위를 차지했다. 중국 모델은 28조1300억 토큰을 기록해 미국 모델을 14주 연속 앞섰다. 상위권 경쟁은 성능 개선과 추론 비용 효율성, 안정적인 서비스 품질을 중심으로 전개되고 있다.
딥시크의 V4 Flash가 7월 27일부터 8월 2일까지 OpenRouter에서 7조2200억 토큰을 기록해 글로벌 대형언어모델 호출량 1위에 올랐다. 8월 5일 최신 집계에서도 V4 Flash 0423은 6조9200억 토큰으로 선두를 지켰다. 중국 모델은 국가별 사용량에서도 미국 모델을 14주 연속 앞섰다.
V4 Flash는 8월 1일 하루 약 8조 토큰을 처리했으며 무료 체험이 5조 토큰, 유료 API 호출이 3조 토큰을 차지했다. 빠른 추론과 장문 콘텍스트 처리, 비용 효율성이 기업과 개발자 확산을 이끌었다. 지난주 전체 호출량 56조8000억 토큰 가운데 중국 모델은 28조1300억 토큰, 미국 모델은 4조3800억 토큰이었다.
2위 샤오미 MiMo-V2.5는 5조1000억 토큰으로 전주보다 52% 줄었다. 4월 공개 베타 후 오픈소스로 배포된 이 모델은 MoE 구조, 100만 토큰 콘텍스트와 텍스트·음성·이미지 멀티모달 기능을 갖췄다. 3위 텐센트 Hy3는 5조100억 토큰을 기록했다. 2950억개 파라미터와 최대 256K 콘텍스트를 지원하며 코드 생성과 AI 에이전트 기능을 강화했다.
4위는 3조4500억 토큰의 V4 Flash 0731, 5위는 2조9900억 토큰의 OpenAI GPT-5.6 Luna였다. Luna는 전주보다 738% 늘었다. 상위 5개 중 중국 모델이 4개였고, 딥시크는 상위 10개에 V4 Flash 0423·0731과 V4 Pro를 올렸다. Anthropic·Google·NVIDIA·MiniMax·StepFun·Zhipu AI도 순위권에 들었다. Nemotron 3 Ultra, Laguna S 2.1, Ling-3.0 Flash 등 무료 모델의 호출은 늘었지만 MiMo-V2.5, MiniMax M3, GLM 5.2는 감소해 경쟁의 무게가 성능과 추론 비용 효율성, 서비스 안정성으로 이동하는 흐름을 보였다.