불과 1년 전만 해도 중국 생성형 인공지능(AI) 시장의 경쟁 구도는 단순했다. 더 뛰어난 모델을 만드는 것보다 더 낮은 가격을 제시하는 기업이 시장을 선점할 수 있다는 믿음이 지배했다. DeepSeek는 그 중심에 있었다. 경쟁사보다 훨씬 저렴한 API 가격을 앞세워 국내외 개발자와 스타트업을 빠르게 끌어들였고, '가격 파괴자(Price Disruptor)'라는 별칭까지 얻었다.
그러나 2026년 여름, 분위기는 달라졌다. DeepSeek가 API 가격 인상을 예고한 데 이어 중국 주요 대형 언어모델(LLM) 기업들도 잇달아 가격 체계를 손질하거나 수익성 중심 전략으로 전환하고 있다. 시장 점유율을 위한 출혈 경쟁보다 지속 가능한 사업 모델을 선택하기 시작한 것이다. 중국 주요 언론들은 이를 단순한 가격 조정이 아니라 중국 AI 산업이 성장 단계에서 수익성 단계로 넘어가는 분기점으로 평가하고 있다.
DeepSeek가 시장에서 주목받은 가장 큰 이유는 성능보다 가격이었다. V4 시리즈 공개 이후 DeepSeek는 경쟁사 대비 현저히 낮은 API 요금을 유지했다. 캐시(Cache) 적중 시 입력 가격은 사실상 업계 최저 수준이었고, 출력 비용 역시 글로벌 경쟁 모델과 비교하면 매우 낮았다. 이 전략은 성공적이었다.
OpenRouter 주간 통계에서 DeepSeek V4 Flash는 글로벌 모델 가운데 가장 많은 호출량을 기록했고, 중국 안팎의 개발자들은 "가장 뛰어난 가성비를 가진 모델"이라는 평가를 내렸다. 하지만 성공은 곧 새로운 부담이 됐다. 경제참고보는 DeepSeek의 API 호출량이 폭발적으로 증가하면서 GPU 자원 부족과 운영 비용 상승이 동시에 나타났다고 분석했다. 실제로 8월 초 DeepSeek는 "전례 없는 접근량"으로 인해 일시적인 용량 부족 현상을 겪었다. 가격 경쟁에서 이긴 기업이 오히려 사용량 증가 때문에 비용 압박을 받는 역설적인 상황이 만들어진 것이다.
AI는 많이 팔수록 더 많이 돈이 드는 산업이다. 전통적인 소프트웨어 산업에서는 고객이 늘어날수록 규모의 경제가 작동한다. 하지만 생성형 AI는 다르다. 사용자가 질문을 한 번 입력할 때마다 GPU가 새로운 연산을 수행해야 한다. 긴 문서를 분석하거나 AI 에이전트(Agent)가 여러 단계를 거쳐 추론할 경우 GPU 사용량은 기하급수적으로 증가한다.
최근 AI 서비스가 단순한 챗봇을 넘어 코드 생성, 영상 제작, 연구 지원, 기업 업무 자동화 등으로 확대되면서 Token 소비량도 폭발적으로 늘어나고 있다. 상관신문은 "Agent 시대가 본격화되면서 Token 소비 구조 자체가 과거와 완전히 달라졌다"고 분석했다. 즉, 사용자가 늘어나는 것은 곧 비용 증가를 의미한다. AI 산업에서는 매출과 비용이 동시에 증가하는 구조가 형성되고 있는 것이다.
중국 언론들이 공통적으로 지적한 또 다른 요인은 GPU 비용이다. 대규모 언어모델을 운영하려면 수만 개 이상의 고성능 GPU가 필요하다. 여기에 전력, 냉각, 네트워크, 저장장치, 데이터센터 운영 비용까지 더하면 추론(Inference) 비용은 여전히 매우 높은 수준을 유지한다. 특히 AI 에이전트와 장문 추론 기능은 기존 챗봇보다 훨씬 많은 GPU 시간을 사용한다. 북경상보는 DeepSeek의 이번 가격 인상이 단순히 이익 확대를 위한 조치라기보다 급증한 추론 비용을 감당하기 위한 현실적인 선택이라고 평가했다.

이번 가격 정책 변화는 DeepSeek만의 사례가 아니다. 중국 AI 시장에서는 이미 여러 기업이 비슷한 움직임을 보이고 있다. 지푸AI(Zhipu AI)는 올해 API 가격을 인상했지만 호출량은 오히려 증가했다. ByteDance는 Doubao 전문 버전에 단계별 요금제를 도입했다. Kimi는 폭증한 사용량 때문에 신규 유료 가입을 일시 중단하기도 했다. Tencent 역시 기업 고객 중심의 과금 체계를 강화하고 있다. 공통점은 분명하다. 가격을 무조건 낮추기보다 안정적인 서비스 품질과 수익성을 함께 확보하는 방향으로 전략이 바뀌고 있다는 것이다. 이는 중국 AI 산업이 시장 확대 단계에서 산업 성숙 단계로 이동하고 있음을 보여준다.
중국만 예외는 아니다. OpenAI는 GPT 계열 모델의 가격을 지속적으로 조정하며 모델별 차등 요금 체계를 강화하고 있다. Anthropic은 Claude 모델을 성능에 따라 세분화했다. Google 역시 Gemini 제품군을 기업 고객 중심으로 재편하고 있다. 최근에는 모델 하나만 판매하는 것이 아니라 성능, 응답 속도, 컨텍스트 길이, 추론 수준에 따라 다양한 가격 체계를 운영하는 것이 글로벌 표준으로 자리 잡고 있다. 즉, AI 산업은 단순히 "얼마나 싸게 제공할 것인가"에서 "어떤 서비스를 어떤 비용으로 제공할 것인가"라는 방향으로 경쟁 축이 이동하고 있다.
중국 언론들은 이번 변화를 "가격 전쟁의 종료"라는 표현으로 설명하지 않는다. 오히려 가격만으로 경쟁하던 시대가 끝나고 가치(Value) 중심 경쟁이 시작됐다고 평가한다. 이제 기업 고객은 단순히 API 가격만 보지 않는다. 안정적인 서비스가 가능한지, GPU 공급 능력이 충분한지, API 응답 속도는 일정한지, 기업 환경에서 장기간 사용할 수 있는지가 더 중요한 선택 기준이 되고 있다. DeepSeek 역시 이러한 시장 변화를 반영해 가격보다 서비스 지속성과 운영 효율성을 선택한 것으로 해석된다.
국내 기업들은 이번 가격 인상을 단순한 해외 AI 기업의 요금 조정으로 받아들여서는 안 된다. 오히려 "AI는 시간이 갈수록 저렴해질 것"이라는 기존 가정 자체를 다시 검토할 필요가 있다. 장기적으로는 알고리즘 개선과 하드웨어 발전으로 Token 단가는 낮아질 가능성이 크다. 그러나 단기적으로는 GPU 공급 부족과 AI 에이전트 확산으로 인해 고성능 추론 비용은 오히려 상승할 수 있다. 이는 AI를 활용하는 기업이라면 'AI 사용량 증가 = 운영비 증가'라는 새로운 경영 환경을 고려해야 한다는 의미다.
특히 특정 모델 하나에 의존하는 구조는 가격 정책 변화에 취약할 수 있다. 여러 모델을 상황에 따라 선택하는 멀티 LLM 전략, 캐시 활용을 통한 Token 절감, 자체 모델 운영과 클라우드 API를 병행하는 하이브리드 구조 등을 검토해야 할 시점이다.
다음 회 예고 〈AI 산업 심층분석③〉
8조 Token 시대가 열렸다… AI의 새로운 비용 구조 'Token 경제학'
다음 편에서는 API 가격을 결정하는 핵심 변수인 Token을 중심으로 AI 산업의 비용 구조를 분석한다. Token은 왜 새로운 '전기요금'으로 불리는지, GPU 비용과 AI 에이전트 확산이 기업의 AI 투자 전략을 어떻게 바꾸고 있는지, 그리고 AI FinOps가 왜 새로운 경영 과제로 떠오르고 있는지를 심층적으로 살펴본다.
윤교원 대표 / The K Media & Commerce, kyoweon@naver.com
[이 기사의 저작권은 이비즈타임즈에 있습니다]
