중국 오픈웨이트 AI, 세계 산업의 ‘기반재’로

Kimi·DeepSeek, 후속학습과 합성데이터 생태계로 확장

  중국 인공지능 산업의 경쟁 방식이 달라지고 있다. 얼마 전까지만 해도 시장의 관심은 어느 모델이 더 많은 매개변수를 갖고 있는지, 벤치마크 점수가 몇 점 높은지에 쏠렸다. 이제 중요한 질문은 그 모델이 다른 기업의 제품과 연구에 얼마나 널리 들어가느냐로 이동하고 있다. Kimi와 DeepSeek를 비롯한 중국계 오픈웨이트 모델은 완성된 챗봇 서비스에 머물지 않고 해외 기업이 다시 학습시키고, 특정 산업에 맞춰 조정하며, 합성데이터를 만드는 기반 모델로 사용되고 있다. 모델의 가중치를 공개해 개발자가 구조를 살펴보고 목적에 맞게 수정할 수 있도록 한 전략이 중국 AI를 하나의 제품이 아니라 산업의 재료로 바꾸는 중이다.

  이 변화의 핵심은 ‘후속학습’이다. 범용 모델을 그대로 서비스에 붙이면 기업 고유의 업무 규칙이나 전문용어, 보안 조건을 충분히 반영하기 어렵다. 반면 공개된 가중치를 바탕으로 법률·금융·제조·의료·교육 분야의 데이터를 추가 학습시키면 비교적 짧은 시간 안에 목적형 모델을 만들 수 있다. 해외의 AI 스타트업과 연구기관이 중국 모델을 선택하는 이유도 최고 성능 하나만이 아니다. 사용 비용, 배포 자유도, 다국어 처리, 추론 효율, 자체 서버 운용 가능성까지 합친 총비용이 중요한 판단 기준이 되고 있다. 특히 데이터가 외부 클라우드로 나가면 곤란한 기업에는 로컬 배포가 가능한 오픈웨이트 모델이 매력적인 대안이다.

  합성데이터 생태계도 빠르게 커지고 있다. 실제 데이터를 무한정 수집하기 어렵고 개인정보와 저작권 문제가 커지면서, 기업들은 강력한 모델이 생성한 문제·답변·코드·시뮬레이션 결과로 소형 모델을 훈련한다. 중국 모델은 이러한 데이터 생산 공정의 한 축으로 들어가고 있다. 한 모델이 만든 결과를 다른 모델이 평가하고, 오류 사례만 사람이 검수하는 방식은 학습 비용을 낮춘다. 결과적으로 모델 경쟁은 ‘누가 가장 똑똑한가’에서 ‘누가 더 많은 후속 모델과 데이터 공정을 만들어 내는가’로 확장된다. 공개 모델의 영향력은 이용자 수뿐 아니라 그 위에서 만들어진 파생 모델, 도구, 데이터셋의 수로 측정해야 한다.

  중국 정부가 데이터 산업과 AI 인프라를 함께 강조하는 이유도 여기에 있다. 8월 28일 구이양에서 개막한 2026 중국국제빅데이터산업박람회는 데이터 요소의 가치 실현을 전면에 내걸었다. 중국 측 발표에 따르면 2025년 데이터 산업 규모는 6조7,800억 위안으로 전년보다 15.7% 성장했고, 2026년 8월까지 구축된 고품질 데이터셋은 12만6,000개를 넘어섰다. 데이터 인프라, 데이터 공급, 모델, 보안, 체화형 인공지능을 한 전시 안에서 연결한 것은 AI 경쟁력이 반도체나 알고리즘 하나로 결정되지 않는다는 판단을 보여준다. 데이터가 정제되고 거래되며 모델 학습에 재투입되는 순환 구조가 산업정책의 중심으로 들어온 것이다.

  그러나 ‘오픈’이라는 말이 모든 문제를 해결하지는 않는다. 가중치를 공개해도 학습데이터와 정렬 과정이 충분히 설명되지 않으면 편향과 저작권 위험을 검증하기 어렵다. 모델을 내려받아 기업 내부에서 운영하면 데이터 통제권은 높아지지만, 보안 패치와 유해 출력 관리, 성능 저하 감시는 이용 기업의 책임이 된다. 특정 모델에 맞춰 업무 시스템을 깊이 구축한 뒤 라이선스가 바뀌거나 개발이 중단될 가능성도 고려해야 한다. 따라서 기업은 성능표만 비교할 것이 아니라 라이선스 범위, 데이터 출처, 업데이트 정책, 취약점 대응, 모델 교체 가능성을 함께 평가해야 한다.

  미국 중심의 폐쇄형 모델과 중국 중심의 오픈웨이트 모델이 단순히 양분되는 것도 아니다. 실제 시장에서는 폐쇄형 모델을 중요한 판단과 고난도 추론에 사용하고, 공개 모델을 반복 업무와 사내 데이터 처리에 배치하는 혼합형 구조가 늘어날 가능성이 크다. 기업은 작업 난이도와 보안 등급에 따라 여러 모델을 연결하고, 비용과 지연시간을 실시간으로 비교해 적합한 모델을 선택하게 된다. 이런 환경에서는 모델 자체보다 여러 모델을 안전하게 바꿔 끼울 수 있는 운영 소프트웨어와 평가 체계가 더 큰 가치를 가질 수 있다.

  한국 기업과 연구기관에는 기회와 과제가 동시에 열린다. 중국 모델의 기술적 장점을 활용하되 중국어·한국어 혼합 문서, 국내 법규, 산업별 표현에서 오류가 얼마나 발생하는지 독립적으로 검증해야 한다. 중국어 교육 분야에서는 학습자의 발음과 문법 오류를 분석하는 소형 모델, 교과서 범위 안에서만 답하는 교사용 모델, 한중 용어를 연결하는 검색형 도구를 만들 수 있다. 다만 학생 데이터와 수업 기록을 다루는 만큼 개인정보 보호와 출력 검수 기준이 먼저 마련돼야 한다. 모델을 도입하는 것보다 교육 목표와 평가 기준을 설계하는 일이 더 중요하다.

  향후 경쟁의 승자는 하나의 거대 모델을 가진 기업이 아니라 모델·데이터·도구·개발자 공동체를 연결한 생태계일 가능성이 높다. 중국 오픈웨이트 AI가 세계 산업의 기반재가 된다는 것은 중국 제품이 모든 시장을 지배한다는 뜻이 아니다. 세계 각지의 기업이 중국 모델을 부품처럼 활용하고 다시 변형하면서 영향력이 공급망 전체로 퍼진다는 의미다. 한국은 어느 한 진영을 선택하는 데 머물지 말고, 다양한 모델을 검증하고 교체할 수 있는 기술 역량과 고품질 한국어·중국어 데이터를 확보해야 한다. AI 주권의 실질은 국적이 같은 모델 하나가 아니라 선택권을 유지할 수 있는 능력에 있다.

 

   [중역] 中国人工智能产业的竞争方式正在变化。过去,人们主要比较哪个模型参数更多、测试分数更高。现在,更重要的问题是一个模型能不能进入更多企业的产品和研究。Kimi、DeepSeek等中国开放权重模型,不只作为聊天机器人使用。海外企业可以继续训练它们,按照自己的行业需求进行调整,也可以用它们制造合成数据。公开模型权重,使开发者能够研究和修改模型结构,也让中国AI从一个产品逐渐变成产业的基础材料。

  这次变化的重点是“后训练”。通用模型如果直接用于企业服务,常常不能完全理解企业内部的规则、专业词语和安全要求。如果在开放权重的基础上,再加入法律、金融、制造、医疗或教育数据,就能较快地做出专用模型。海外公司选择中国模型,不只是因为性能。使用价格、部署自由、多语言能力、推理效率和能否在自己的服务器运行,都会影响选择。对不能把数据传到外部云端的企业来说,本地部署尤其重要。

  合成数据市场也在扩大。真实数据很难无限收集,而且还有个人信息和版权问题。企业开始让强大的模型生成题目、答案、代码和模拟结果,再用这些内容训练较小的模型。一个模型负责生成,另一个模型负责检查,最后只让人检查错误较多的部分,可以降低成本。因此,竞争已经从“谁最聪明”扩大到“谁能帮助产生更多模型和数据”。

  中国同时推动数据产业和AI基础设施。8月28日,2026中国国际大数据产业博览会在贵阳开幕,重点讨论数据要素的价值。中方资料显示,2025年中国数据产业规模达到6.78万亿元,同比增长15.7%;到2026年8月,高质量数据集已经超过12.6万个。数据基础设施、数据供应、模型、安全和具身智能被放在同一个产业体系中,说明AI竞争不只取决于芯片或算法,也取决于数据能不能不断整理、流通和再次用于训练。

  但是,“开放”并不代表没有风险。如果企业只拿到模型权重,却不了解训练数据和安全调整过程,就很难判断偏见和版权问题。企业在内部运行模型,可以加强数据控制,但也必须自己负责安全更新、有害内容管理和性能监测。企业还要注意许可证变化、开发停止和系统过度依赖等问题。因此,选择模型时不能只看分数,还要检查许可证、数据来源、更新政策、安全处理和替换模型的难度。

  未来也不会简单地分成美国封闭模型和中国开放模型两个世界。很多企业可能同时使用几种模型:困难任务使用强大的封闭模型,重复工作和内部数据处理使用开放模型。企业会按照任务难度、费用、安全等级和反应速度自动选择模型。在这种环境中,能够管理、评价和随时替换多个模型的软件可能比单一模型更有价值。

  韩国企业和研究机构既有机会,也有任务。使用中国模型之前,要独立检查它在韩中混合文件、韩国法律和行业词语中会不会发生错误。在中文教育领域,可以开发分析发音和语法错误的小模型,也可以开发只回答教材内容的教师工具。不过,学生信息和课堂记录非常敏感,所以必须先建立个人信息保护和答案检查规则。真正重要的不是简单引进模型,而是明确教育目标和评价方法。

  未来的赢家可能不是只拥有一个大模型的公司,而是能够连接模型、数据、工具和开发者社区的生态系统。中国开放权重AI成为世界产业的基础材料,并不等于中国模型会控制所有市场。它表示世界各地的企业把中国模型当作零部件,继续修改和使用,使影响力进入整个供应链。韩国需要保持多种选择,建设模型评价和替换能力,并准备高质量的韩语、中文数据。真正的AI自主能力,是一直拥有选择权。

시노인사이트 편집부 기자 bats21@naver.com
작성 2026.08.31 03:46 수정 2026.08.31 03:46

RSS피드 기사제공처 : 시노인사이트 SINOINSIGHT / 등록기자: 시노인사이트 편집부 무단 전재 및 재배포금지

해당기사의 문의는 기사제공처에게 문의

댓글 0개 (1/1 페이지)
댓글등록- 개인정보를 유출하는 글의 게시를 삼가주세요.
등록된 댓글이 없습니다.