Главная / Блог / AIChipInsights
ENGINEERING BLOG · 2026.07.10

Разрабатывает ли DeepSeek собственный AI-чип?
Полный анализ отчёта Reuters, июль 2026

24 июня 2026 года OpenAI и Broadcom представили Jalapeño — кастомный чип для инференса, разработанный всего за девять месяцев. 2 июля появились сообщения о переговорах Anthropic с Samsung по 2-нм кастомному чипу. Затем 7 июля Reuters процитировало трёх источников, сообщающих, что DeepSeek разрабатывает собственный AI-чип для инференса. Это не только история про Китай — это отраслевой сдвиг от стандартных GPU к кастомному кремнию во всём мире. В этой статье мы разбираем, что подтверждено, что остаётся слухом, и почему все крупные AI-лаборатории теперь строят собственные чипы.

01

Данные TrendForce (2026): рост поставок кастомных AI-чипов гиперскейлеров составил 44,6% — значительно выше роста стандартных GPU на 16,1%. Кастомный кремний впервые отчётливо обгоняет GPU по темпу роста.

Основные проекты кастомных AI-чипов в мире (июль 2026)
Компания Чип-проект Фаза Ключевые данные
DeepSeek Безымянный ASIC для инференса Ранняя R&D Привлечено $7,4 млрд; тайный найм; не подтверждено
Alibaba (T-Head) Zhenwu 810E / M890 Серийное производство Поставлено 560 000+ единиц; годовая выручка — миллиарды юаней
OpenAI Jalapeño (с Broadcom) Tape-out завершён, развёртывание конец 2026 9 месяцев от проектирования до tape-out
Google TPU v6/v7 Коммерческое использование в больших масштабах Gemini работает на TPU end-to-end
Amazon Trainium3 / Inferentia Коммерческий Anthropic использует Trainium для крупного обучения
Anthropic Переговоры с Samsung о 2-нм чипе Стадия изучения The Information, июль 2026

Ключевой тезис: инференс-затраты — это «аренда» AI. Обучение — первоначальный взнос (разовый). Инференс — ежемесячная аренда (непрерывно, растёт пропорционально числу пользователей). Кастомные ASIC конвертируют постоянный «налог Nvidia» в разовые R&D инвестиции.

02

Репортаж Reuters от 7 июля 2026 года содержит пять проверяемых утверждений:

  • Целевой сценарий использования: Чип предназначен для инференса (inference), а не для обучения — соответствует направлению всех крупных проектов кастомных чипов 2025–2026 годов.
  • Начало проекта: Примерно за год до репортажа (середина 2025 года), проект всё ещё находится на ранней стадии.
  • Контакты в цепочке поставок: DeepSeek ведёт переговоры с разработчиками чипов, литейными производствами (foundry) и поставщиками памяти.
  • Стратегия найма: Инженеры нанимаются непублично, без открытых вакансий на биржах труда.
  • Двойная независимость: Успех снизит зависимость как от Nvidia, так и от Huawei Ascend — особенно значимо, учитывая глубокую адаптацию DeepSeek к Ascend.

Не подтверждено: на момент написания статьи DeepSeek официально не подтвердил чип-программу.

Косвенные свидетельства: раунд финансирования серии A в июне 2026 года (~51 млрд юаней / ~$7,4 млрд) прямо указывает «разработку собственных AI-чипов» как цель использования средств. Формат данных UE8M0 FP8 в моделях интерпретируется экспертами как сигнал аппаратно-программной ко-оптимизации под отечественные чипы.

Первичные источники:

Reuters — DeepSeek developing own AI chip (7 июля 2026)

Официальный блог OpenAI — Анонс чипа для инференса Jalapeño

Wall Street Journal — Alibaba AI chip to fill Nvidia void

03

Лян Вэньфэн (梁文鋒), основатель и генеральный директор DeepSeek, крайне редко даёт публичные интервью. Наиболее содержательные — два углублённых материала с китайским изданием Waves (Angyong) в мае 2023 и июле 2024 годов. Ключевые цитаты, связанные с чипами и вычислительными мощностями:

  • Реальное ограничение: «Наш настоящий вызов никогда не был в финансировании — это экспортные ограничения на продвинутые чипы.» (Июль 2024, интервью Waves)
  • Разрыв в вычислительной эффективности: Китайские лаборатории нуждаются примерно в четырёхкратном объёме вычислений по сравнению с международными конкурентами для получения аналогичных результатов.
  • Проблема экосистемы: «Многие отечественные чипы не получают распространения не из-за аппаратного обеспечения, а из-за отсутствия сообщества разработчиков. Китаю нужны люди на технологической передовой.»
  • Жажда вычислительных мощностей: «Для исследователей жажда вычислительных мощностей бесконечна. Мы будем сознательно развёртывать как можно больше вычислительных ресурсов.»

Важное разграничение: цитаты Лян Вэньфэна устанавливают стратегическую мотивацию. Reuters сообщает о действиях компании (найм, переговоры с поставщиками). Это принципиально разные утверждения. «Долгосрочная позиция основателя» ≠ «официальное объявление проекта».

04

В отличие от ранней стадии DeepSeek, чип-программа Alibaba — это многолетняя стратегия, уже вышедшая в серийное производство. В сентябре 2018 года Джек Ма основал T-Head Semiconductor (平頭哥), объединив CTP и команду по чипам академии Damo. Название «медоед» (honey badger) — бесстрашный и упорный — символизирует долгосрочную приверженность разработке чипов.

Линейка чипов Zhenwu от Alibaba T-Head (2026)
Модель Выпуск Ключевые характеристики Статус
Hanguang 800 2019 Ранний AI-чип для инференса Устаревшая модель
Zhenwu 810E Январь 2026 Обучение + инференс; 96 ГБ HBM2e; производительность между Nvidia A800 и H20; совместим с экосистемой CUDA Серийное производство
Zhenwu M890 2026 144 ГБ памяти; межчиповое соединение 800 ГБ/с; ~3× производительность 810E Запускается
Zhenwu V900 Запланировано Q3 2027 216 ГБ памяти; соединение 1200 ГБ/с Дорожная карта
Zhenwu J900 Запланировано Q3 2028 Собственная архитектура параллельных вычислений Дорожная карта

Ключевые коммерческие метрики (1П 2026): совокупные поставки 560 000+ единиц; годовая выручка исчисляется миллиардами юаней; 400+ корпоративных клиентов используют кластеры Zhenwu; уставный капитал T-Head увеличен до 1 млрд юаней (июнь 2026); Alibaba обязалась инвестировать 380 млрд юаней (~52 млрд $) в облачную и AI-инфраструктуру за 3 года; Zhenwu 810E совместим с экосистемой CUDA Nvidia (WSJ), снижая стоимость миграции для разработчиков.

Caixin Global — Alibaba's New Processor Shows Applications Are Key to AI Chip Success

05

Компании разрабатывают кастомные чипы не ради самих чипов — конкуренция в AI сместилась с «у кого лучшая модель» на «у кого самые дешёвые и контролируемые вычислительные мощности». Пять движущих сил по важности:

  • 1. Экономика: стоимость инференса — это «аренда» AI. Обучение — первоначальный взнос (разовый). Инференс — ежемесячная аренда (непрерывно, растёт с числом пользователей). Маржа валовой прибыли Nvidia на GPU для ЦОД превышает 70%. Кастомные ASIC конвертируют постоянный «налог Nvidia» в разовые R&D инвестиции. При крупномасштабном многолетнем развёртывании инференса TCO может быть снижен на 40–65% по сравнению со стандартными GPU.
  • 2. Безопасность цепочки поставок и геополитические риски. Американские экспортные ограничения на продвинутые AI-чипы (H100/H800/H20 последовательно ограничиваются) вынуждают китайские AI-компании искать альтернативы. Безопасность означает также предсказуемость цепочки поставок — не зависеть от одного поставщика или политики одного государства.
  • 3. Аппаратно-программная ко-оптимизация (Co-design). Формат UE8M0 FP8 и архитектура MLA от DeepSeek оптимизированы под конкретные аппаратные характеристики. Jalapeño от OpenAI разработан под реальные паттерны обслуживания ChatGPT (KV-кэш, батчинг, задержки). Стандартные GPU жертвуют эффективностью ради гибкости; кастомные ASIC жертвуют гибкостью ради эффективности на известных рабочих нагрузках.
  • 4. Конкурентное преимущество и переговорные позиции. Даже частичная альтернатива Nvidia усиливает позиции в закупочных переговорах и позволяет строить нарратив полного стека (модель + облако + чип).
  • 5. Энергоэффективность и устойчивое развитие. Чипы для инференса ориентированы на производительность на ватт (performance-per-watt). В ЦОД масштаба гигаватт стоимость энергии и охлаждения равна или превышает стоимость оборудования. ASIC устраняют неиспользуемые универсальные схемы GPU.

06

Почти все кастомные чип-программы 2025–2026 годов ориентированы на инференс. Следующая таблица объясняет фундаментальные причины:

Сравнение чипа для инференса и GPU для обучения
Параметр Обучение (Training) Инференс (Inference)
Характер рабочей нагрузки Динамичный, экспериментальный, архитектура часто меняется Статичная, фиксированная модель, паттерны запросов предсказуемы
Зависимость от программной экосистемы Глубокая зависимость от CUDA (cuDNN, NCCL) Возможны кастомные ядра; слабая зависимость от экосистемы
Экономический масштаб Разовые крупные инвестиции в кластер 7×24 ч непрерывно, растёт с числом пользователей
Преимущество кастомного ASIC Ограниченное (привязка к CUDA) Значительное (снижение TCO на 40–65%)
Текущие лидеры рынка Nvidia H100/B200 доминирует TPU, Trainium, Maia, Jalapeño, DeepSeek (слухи)

Вывод: обучение остаётся вотчиной Nvidia. Инференс — главное поле битвы для кастомных ASIC. Ориентация DeepSeek на инференс является экономически рациональным выбором.

Риски ранних проектов:

  • Высокий процент неудач на ранних стадиях: От tape-out до стабильного серийного производства обычно требуется 2–4 года. Проекты могут потерпеть неудачу из-за выхода, смены архитектуры или ограничений литейного производства.
  • Полная переработка MTIA от Meta: Meta пришлось полностью переработать дизайн чипа MTIA, прежде чем он был внедрён в производственные системы рекомендаций.
  • Параллельная стратегия DeepSeek: Продолжение сотрудничества с Huawei Ascend наряду с разработкой собственного чипа — рациональное хеджирование рисков.

07

Практический фреймворк для технических лидеров и архитекторов, оценивающих влияние тренда кастомного кремния:

  1. Количественная оценка текущих затрат на инференс (расчёт «налога Nvidia»): Изучите расходы на GPU-вычисления за последние 12 месяцев, разделив обучение и инференс. Если инференс превышает 50%, альтернативы кастомного кремния заслуживают серьёзного изучения.
  2. Анализ характеристик рабочих нагрузок: Оцените стабильность паттернов запросов, предсказуемость размеров батчей и требования к задержке. Стабильный, предсказуемый инференс лучше всего подходит для миграции на ASIC.
  3. Оценка глубины зависимости от экосистемы CUDA: Составьте карту зависимостей кода инференса от проприетарных API CUDA. Более высокая зависимость означает более высокие затраты на миграцию.
  4. Фильтрация дорожных карт поставщиков по требованиям соответствия: Alibaba Zhenwu (совместим с CUDA, отечественное производство), Huawei Ascend (закрытая экосистема), международные ASIC (Google TPU, AWS Trainium) — выбирайте по юрисдикции и регуляторным требованиям.
  5. Проектирование гибридной вычислительной архитектуры: Не заменяйте всё сразу. Поддерживайте GPU Nvidia (гибкое обучение и эксперименты) + кастомные ASIC (стабильный массовый инференс) + bare-metal физические машины (рабочие процессы AI Agent с низкой задержкой).
  6. Создание перечня диверсификации цепочки поставок: Обеспечьте как минимум две независимые цепочки поставок вычислительных мощностей. Ежеквартально пересматривайте изменения в экспортном контроле и обновляйте планы действий в чрезвычайных ситуациях.

08

В: Насколько достоверен репортаж Reuters о разработке чипа DeepSeek?
О: Reuters процитировало трёх источников 7 июля 2026 — высокая степень достоверности по стандартам агентства. Однако DeepSeek официально не подтвердил проект. Он находится на ранней стадии разработки.

В: Объявлял ли генеральный директор Лян Вэньфэн о программе разработки чипов?
О: Нет. В интервью 2024 года он описывал экспортные ограничения на чипы как главный вызов — это демонстрирует стратегическую мотивацию, но не является официальным объявлением программы. Reuters сообщает о действиях компании, а не о заявлениях основателя.

В: В чём разница между Alibaba и DeepSeek в части чипов?
О: Принципиально разные фазы. T-Head от Alibaba разрабатывает чипы с 2018 года и серийно производит Zhenwu 810E с поставками более 560 000 единиц. DeepSeek находится на ранней R&D стадии без официального подтверждения.

В: Почему сначала чипы для инференса, а не для обучения?
О: Рабочие нагрузки инференса повторяемы и предсказуемы — идеальны для оптимизации ASIC. Обучение требует гибкости CUDA, где доминирует Nvidia. Инференс — ежемесячная аренда, обучение — первоначальный взнос.

В: Это про национальную безопасность или снижение затрат?
О: И то, и другое, но экономика является основным драйвером. Кастомные ASIC могут снизить TCO на 40–65% при крупномасштабном инференсе. Экспортные ограничения ускоряют уже экономически мотивированный сдвиг.

Последнее обновление: 10 июля 2026 | Оговорка: DeepSeek на момент написания статьи официально не подтвердил чип-программу. Все ссылки основаны на общедоступных источниках (Reuters, WSJ, Caixin).

История DeepSeek и Alibaba раскрывает структурный сдвиг: стоимость инференса стала центральной переменной в коммерциализации AI. Стандартное GPU-облако имеет известные ограничения — непредсказуемая производительность в пуле общих ресурсов в часы пиковой нагрузки, ограниченные среды выполнения, высокая стоимость инференса на токен в масштабе. Bare-metal узлы ZUKCLOUD на Mac mini отвечают конкретной и растущей потребности: выделенные физические машины на Apple Silicon, нулевые накладные расходы гипервизора, работа AI Agent 7×24 ч, гибкое ценообразование по дням/неделям/месяцам — стабильная, контролируемая среда для рабочих процессов инференса в переходный период до созревания рынка кастомных ASIC.