2026년 7월 7일, 로이터가 3명의 소식통을 인용해 단독 보도했습니다. DeepSeek가 AI 추론(inference) 전용 자체 칩을 개발 중이며, 프로젝트는 약 1년 전에 시작되어 현재도 초기 단계에 있다고 전했습니다. 동시에, 알리바바 산하 평두거 반도체(T-Head)는 자체 개발한 진우(真武) 칩을 양산 중이며, 2026년 상반기 기준 누적 출하량이 56만 개 이상에 달하고 연간 매출은 수십억 위안 규모입니다. 한쪽은 '루머', 다른 한쪽은 '실적'—본 기사에서는 검증 가능한 사실에 기반하여 두 경로의 진실, 동기, 기술적 논리를 분석합니다.
01 글로벌 커스텀 실리콘 트렌드 개요
DeepSeek의 칩 루머를 이해하려면 글로벌 맥락이 필요합니다. TrendForce(2026년) 데이터에 따르면, 하이퍼스케일러의 커스텀 AI 칩 출하 성장률은 44.6%로, 범용 GPU의 16.1%를 크게 앞서고 있습니다. 커스텀 실리콘이 처음으로 GPU를 성장 속도에서 명확히 추월했습니다.
| 기업 | 칩 프로젝트 | 단계 | 주요 정보 |
|---|---|---|---|
| DeepSeek | 추론 전용 ASIC (미명명) | 초기 R&D | 74억 달러 조달; 비공개 채용; 미확인 |
| 알리바바 (T-Head) | 진우 810E / M890 | 양산 중 | 56만 개 이상 출하; 연매출 수십억 위안 |
| OpenAI | Jalapeño (Broadcom 협력) | 테이프아웃 완료, 배포 준비 | 설계~테이프아웃 9개월; 2026년 말 배포 |
| TPU v6/v7 | 대규모 상용 | Gemini 엔드투엔드 TPU 구동 | |
| Amazon | Trainium3 / Inferentia | 상용 | Anthropic이 Trainium으로 대규모 훈련 |
| Anthropic | Samsung 2nm 커스텀 칩 협의 | 검토 단계 | The Information, 2026년 7월 보도 |
핵심 인사이트: 추론 비용은 AI의 '월세'입니다. 훈련은 계약금(일회성), 추론은 월세(지속적, 사용자 수에 비례). 커스텀 ASIC은 영구적인 'Nvidia 세금'을 일회성 R&D 투자로 전환합니다.
02 로이터 보도 사실 확인: 무엇이 확인됐고 무엇이 미확인인가
로이터 보도(2026년 7월 7일)에는 5가지 검증 가능한 주장이 포함되어 있습니다.
- 대상 용도: 칩은 추론(inference) 전용으로, 훈련(training)이 아닙니다. 2025~2026년 출시된 주요 커스텀 칩 프로젝트 모두와 일치합니다.
- 프로젝트 시작: 보도 약 1년 전(2025년 중반)에 시작되어 현재도 초기 단계입니다.
- 공급망 접촉: DeepSeek는 칩 설계사, 파운드리(晶圓代工), 메모리 공급업체와 협의 중입니다.
- 채용 방식: 칩 엔지니어를 비공개로 채용 중이며, 공개 채용 플랫폼에는 게시하지 않고 있습니다.
- 이중 의존 해소: 성공하면 Nvidia와 화웨이 어센드(昇腾) 양쪽에 대한 의존도를 낮출 수 있습니다.
확인되지 않은 것: DeepSeek는 본 기사 작성 시점까지 칩 프로그램을 공식 확인하지 않았습니다.
간접 증거: 2026년 6월 시리즈 A 조달액 약 510억 위안(약 74억 달러)의 사용 목적에 '자체 AI 칩 개발'이 명시되었습니다.
1차 정보 출처:
로이터 — DeepSeek developing own AI chip (2026년 7월 7일)
OpenAI 공식 블로그 — OpenAI & Broadcom Jalapeño 추론 칩 발표
월스트리트저널 (WSJ) — Alibaba AI chip to fill Nvidia void
03 량원펑 CEO의 발언과 전략적 동기
량원펑(梁文鋒) CEO의 공개 인터뷰는 매우 드물며, 가장 중요한 것은 중국 미디어 '암용(暗湧, Waves)'과의 2023년 5월, 2024년 7월 두 차례 심층 인터뷰입니다. 칩/컴퓨팅 관련 핵심 발언을 소개합니다.
- 진짜 제약은 칩 규제: "우리의 진짜 과제는 자금이 아니라 첨단 칩 수출 규제입니다." (2024년 7월, 암용 인터뷰)
- 컴퓨팅 효율 격차 = 4배 리소스 소모: 국내 최고 수준은 해외 대비 훈련 효율에서 약 1세대, 데이터 효율에서 약 1세대 뒤처져 있어, 동등한 결과를 얻으려면 약 4배의 컴퓨팅 파워가 필요합니다.
- 에코시스템의 중요성: "많은 국산 칩이 보급되지 못하는 이유는 하드웨어가 아니라 개발자 커뮤니티가 없기 때문입니다. 중국은 반드시 기술 최전선에 서는 사람이 필요합니다."
- 컴퓨팅에 대한 갈망: "연구자들에게 컴퓨팅에 대한 갈망은 끝이 없습니다. 우리는 의식적으로 최대한 많은 컴퓨팅을 배포할 것입니다."
중요한 구분: 량원펑의 발언은 전략적 동기를 보여주지만, 로이터가 보도한 것은 기업의 행동(채용, 공급업체 협상)입니다. '창업자의 장기적 입장' ≠ '공식 프로젝트 발표'를 혼동해서는 안 됩니다.
04 알리바바 T-Head: 잭 마의 2018년 베팅이 2026년에 결실
DeepSeek의 '루머'와 달리, 알리바바의 칩 개발은 수년간 지속된 전략의 실행 결과이며 현재 양산·상업화 단계에 있습니다. 2018년 9월 윈치 컨퍼런스에서 잭 마는 중텐웨이와 다모 아카데미 칩팀을 통합해 평두거 반도체(T-Head Semiconductor)를 설립했습니다. '평두거(蜜獾, 꿀오소리)'라는 이름은 잭 마가 직접 선정—'두려움 없음'을 의미하며 칩에 대한 장기 헌신을 나타냅니다.
| 모델 | 출시 | 주요 스펙 | 상태 |
|---|---|---|---|
| 함광800 | 2019년 | 초기 AI 추론 칩 | 구형 |
| 진우810E | 2026년 1월 | 훈련+추론 통합; 96GB HBM2e; Nvidia A800~H20 수준; CUDA 생태계 호환 | 양산 중 |
| 진우M890 | 2026년 | 144GB 메모리; 칩간 연결 800GB/s; 810E 대비 약 3배 성능 | 출시 중 |
| 진우V900 | 2027년 Q3 예정 | 216GB 메모리; 1,200GB/s 연결 | 로드맵 |
| 진우J900 | 2028년 Q3 예정 | 자체 병렬 컴퓨팅 아키텍처 차세대 | 로드맵 |
2026년 상업화 주요 지표: 누적 출하량 56만 개 이상; 연간 매출 수십억 위안 규모; 400개 이상 기업 고객이 진우 클러스터 사용; T-Head 등록 자본 10억 위안으로 증액(2026년 6월); 알리바바 향후 3년간 클라우드 및 AI 인프라에 3,800억 위안(약 520억 달러) 투자 예정; 진우 810E는 Nvidia CUDA 생태계와 호환(WSJ 보도).
Caixin Global — Alibaba's New Processor Shows Applications Are Key to AI Chip Success
05 대형 AI 기업이 커스텀 칩을 개발하는 5가지 이유
대형 기업이 커스텀 칩을 개발하는 이유는 '칩 자체를 위한 것'이 아니라, AI 경쟁이 '누가 최고의 모델을 가졌는가'에서 '누가 가장 저렴하고 통제 가능한 컴퓨팅을 보유했는가'로 이동했기 때문입니다. 중요도 순으로 5가지 동인을 분석합니다.
- ① 경제적 합리성: 추론 비용은 AI의 '월세'. 훈련은 계약금(일회성 대규모 투자), 추론은 월세(지속적, 사용자 수에 비례 증가)입니다. Nvidia 데이터센터 GPU 영업이익률은 70% 이상입니다. 대규모 장기 추론 배포에서 커스텀 ASIC은 범용 GPU 대비 TCO 40~65% 절감이 가능합니다.
- ② 공급망 안보와 지정학적 리스크. 미국의 대중 첨단 AI 칩 수출 규제(H100/H800/H20 순차 규제)로 중국 AI 기업들은 대안을 모색할 수밖에 없습니다. 안보는 사이버 보안만이 아니라 공급망의 예측 가능성을 의미합니다.
- ③ 하드웨어-소프트웨어 협조 설계(Co-design). DeepSeek의 UE8M0 FP8, MLA 아키텍처는 특정 하드웨어 특성에 최적화되어 있습니다. OpenAI의 Jalapeño는 ChatGPT의 실제 서빙 패턴(KV 캐시, 배칭, 지연 시간)에 맞게 설계되었습니다.
- ④ 경쟁 우위와 협상력. Nvidia를 완전히 대체하지 않더라도 자체 칩은 조달 협상에서 협상 카드가 되고, '모델+클라우드+칩' 풀스택 스토리를 구축할 수 있습니다.
- ⑤ 에너지 효율과 지속 가능성. 추론 칩은 와트당 성능(performance-per-watt)을 중시합니다. ASIC은 GPU에서 AI 워크로드가 사용하지 않는 범용 회로를 제거하여 전력 소비를 크게 줄입니다.
06 추론 칩 vs 훈련 칩: 왜 추론부터 시작하는가
2025~2026년에 등장한 거의 모든 커스텀 칩 프로그램이 추론을 대상으로 합니다. 다음 비교표에서 근본적인 이유를 확인합니다.
| 항목 | 훈련(Training) | 추론(Inference) |
|---|---|---|
| 워크로드 특성 | 동적, 실험적, 아키텍처 자주 변경 | 정적, 고정 모델, 요청 패턴 예측 가능 |
| 소프트웨어 생태계 의존도 | CUDA 의존도 높음(cuDNN, NCCL) | 고정 모델용 커스텀 커널 가능, 의존도 낮음 |
| 경제 규모 | 클러스터 일회성 대규모 투자 | 7×24시간 지속, 사용자 수에 비례 증가 |
| 커스텀 ASIC 우위 | 제한적(CUDA 잠금) | 상당함(TCO 40~65% 절감) |
| 현재 주요 제품 | Nvidia H100/B200 지배적 | TPU, Trainium, Maia, Jalapeño, DeepSeek(루머) |
결론: 훈련은 여전히 Nvidia의 주전장입니다. 추론이 커스텀 ASIC의 핵심 전장입니다. DeepSeek가 추론에 특화된 자체 칩을 목표로 하는 것은 경제적으로 합리적인 선택입니다.
초기 단계 프로젝트의 리스크:
- 높은 실패율: 테이프아웃에서 안정적인 양산까지 보통 2~4년이 걸립니다. 수율, 아키텍처 변화, 파운드리 제약 등으로 중단될 수 있습니다.
- Meta의 MTIA 재설계: Meta의 MTIA 칩은 처음부터 완전히 재설계된 후 추천 시스템 프로덕션에 투입되었습니다.
- DeepSeek의 병렬 전략: 자체 칩 개발과 병행하여 화웨이 어센드와의 협력을 지속—합리적인 리스크 헤지입니다.
07 기술 의사결정자를 위한 6단계 행동 프레임워크
커스텀 실리콘 시대에 대비하는 기술 리더와 아키텍트를 위한 실용적인 프레임워크를 소개합니다.
- 현재 추론 비용 정량화(Nvidia 세금 산출): 최근 12개월간 GPU 컴퓨팅 비용을 확인하고 훈련과 추론의 비율을 분리합니다. 추론이 50% 이상이면 커스텀 실리콘 대안을 진지하게 검토할 가치가 있습니다.
- 워크로드 특성 분석: 추론 시나리오의 요청 패턴 안정성, 배치 크기 예측 가능성, 지연 시간 요구 사항을 평가합니다. 안정적이고 예측 가능한 추론이 ASIC 전환에 가장 적합합니다.
- CUDA 생태계 의존도 평가: 기존 추론 코드의 cuDNN, NCCL 등 CUDA 전용 API 의존도를 매핑합니다. 의존도가 높을수록 전환 비용과 기간이 증가합니다.
- 컴플라이언스 요건에 따른 벤더 로드맵 검토: 알리바바 진우(CUDA 호환, 국내 제조), 화웨이 어센드(폐쇄 생태계, 규정 친화), 해외 ASIC(Google TPU, AWS Trainium)—비즈니스 관할권과 규정 요건에 따라 후보를 압축합니다.
- 하이브리드 컴퓨팅 전략 설계: 모든 것을 한꺼번에 교체하는 것은 권장하지 않습니다. Nvidia GPU(유연한 훈련·실험)+커스텀 ASIC(안정적인 대규모 추론)+베어메탈 물리 머신(저지연 AI Agent 워크플로우)의 하이브리드 구성을 유지합니다.
- 공급망 다양화 목록 구축: 최소 2개의 독립적인 컴퓨팅 공급망을 확보합니다. 수출 규제 동향을 분기마다 검토하고 비상 계획을 업데이트합니다.
08 자주 묻는 질문
Q1: DeepSeek 칩 개발 보도는 신뢰할 수 있나요?
A: 로이터가 2026년 7월 7일 3명의 소식통을 인용해 보도했으며 신뢰도는 높지만, DeepSeek는 공식적으로 확인하지 않았습니다. 프로젝트는 초기 단계입니다.
Q2: 량원펑 CEO가 칩 개발을 공식 발표했나요?
A: 아니오. 2024년 인터뷰에서 '가장 큰 과제는 첨단 칩 수출 규제'라고 말했으며 전략적 동기를 보여주지만, 자체 칩 프로그램의 공식 발표는 하지 않았습니다.
Q3: 알리바바와 DeepSeek는 어떻게 다른가요?
A: 단계가 완전히 다릅니다. 알리바바 T-Head는 2018년부터 개발하여 현재 진우 810E를 양산 중이며 56만 개 이상을 출하했습니다. DeepSeek는 초기 R&D 루머 단계이며 공식 확인이 없습니다.
Q4: 왜 훈련 칩보다 추론 칩을 먼저 개발하나요?
A: 추론 워크로드는 반복적이고 예측 가능하여 ASIC 최적화에 이상적입니다. 훈련은 CUDA 의존도가 높고 Nvidia GPU가 계속 우위를 차지합니다.
Q5: 안보를 위한 것인가요, 비용 절감을 위한 것인가요?
A: 둘 다이지만 경제적 합리성이 주요 동기입니다. 대규모 추론에서 커스텀 ASIC은 TCO를 40~65% 절감할 수 있습니다. 수출 규제가 기존의 경제적 동기를 가속화하고 있습니다.
최종 업데이트: 2026-07-10 | DeepSeek는 본 기사 작성 시점에 칩 프로그램을 공식 확인하지 않았습니다. 모든 참조는 로이터 등 공개 정보 출처에 기반합니다.
DeepSeek와 알리바바의 이야기는 AI 산업의 더 깊은 변화를 보여줍니다. 추론 비용이 AI 상업화의 핵심 변수가 되었습니다. 범용 GPU 클라우드의 알려진 문제—공유 리소스 풀에서 피크 시간대의 성능 불안정, 제한된 환경, 높은 추론 단가—에 대응하여, ZUKCLOUD 베어메탈 Mac mini 클라우드 노드는 전용 Apple Silicon 물리 머신, 하이퍼바이저 없는 제로 오버헤드, 7×24 AI Agent 온라인 운영, 일/주/월 유연한 요금제를 제공합니다. 커스텀 ASIC 시장이 성숙하기까지의 전환 기간에 안정적이고 통제 가능한 추론 워크플로우 환경입니다.