24 июня 2026 года OpenAI и Broadcom представили Jalapeño — кастомный чип для инференса, разработанный всего за девять месяцев. 2 июля появились сообщения о переговорах Anthropic с Samsung по 2-нм кастомному чипу. Затем 7 июля Reuters процитировало трёх источников, сообщающих, что DeepSeek разрабатывает собственный AI-чип для инференса. Это не только история про Китай — это отраслевой сдвиг от стандартных GPU к кастомному кремнию во всём мире. В этой статье мы разбираем, что подтверждено, что остаётся слухом, и почему все крупные AI-лаборатории теперь строят собственные чипы.
01 Глобальная волна кастомного кремния
Данные TrendForce (2026): рост поставок кастомных AI-чипов гиперскейлеров составил 44,6% — значительно выше роста стандартных GPU на 16,1%. Кастомный кремний впервые отчётливо обгоняет GPU по темпу роста.
| Компания | Чип-проект | Фаза | Ключевые данные |
|---|---|---|---|
| DeepSeek | Безымянный ASIC для инференса | Ранняя R&D | Привлечено $7,4 млрд; тайный найм; не подтверждено |
| Alibaba (T-Head) | Zhenwu 810E / M890 | Серийное производство | Поставлено 560 000+ единиц; годовая выручка — миллиарды юаней |
| OpenAI | Jalapeño (с Broadcom) | Tape-out завершён, развёртывание конец 2026 | 9 месяцев от проектирования до tape-out |
| TPU v6/v7 | Коммерческое использование в больших масштабах | Gemini работает на TPU end-to-end | |
| Amazon | Trainium3 / Inferentia | Коммерческий | Anthropic использует Trainium для крупного обучения |
| Anthropic | Переговоры с Samsung о 2-нм чипе | Стадия изучения | The Information, июль 2026 |
Ключевой тезис: инференс-затраты — это «аренда» AI. Обучение — первоначальный взнос (разовый). Инференс — ежемесячная аренда (непрерывно, растёт пропорционально числу пользователей). Кастомные ASIC конвертируют постоянный «налог Nvidia» в разовые R&D инвестиции.
02 Отчёт Reuters: что подтверждено и что нет
Репортаж Reuters от 7 июля 2026 года содержит пять проверяемых утверждений:
- Целевой сценарий использования: Чип предназначен для инференса (inference), а не для обучения — соответствует направлению всех крупных проектов кастомных чипов 2025–2026 годов.
- Начало проекта: Примерно за год до репортажа (середина 2025 года), проект всё ещё находится на ранней стадии.
- Контакты в цепочке поставок: DeepSeek ведёт переговоры с разработчиками чипов, литейными производствами (foundry) и поставщиками памяти.
- Стратегия найма: Инженеры нанимаются непублично, без открытых вакансий на биржах труда.
- Двойная независимость: Успех снизит зависимость как от Nvidia, так и от Huawei Ascend — особенно значимо, учитывая глубокую адаптацию DeepSeek к Ascend.
Не подтверждено: на момент написания статьи DeepSeek официально не подтвердил чип-программу.
Косвенные свидетельства: раунд финансирования серии A в июне 2026 года (~51 млрд юаней / ~$7,4 млрд) прямо указывает «разработку собственных AI-чипов» как цель использования средств. Формат данных UE8M0 FP8 в моделях интерпретируется экспертами как сигнал аппаратно-программной ко-оптимизации под отечественные чипы.
Первичные источники:
Reuters — DeepSeek developing own AI chip (7 июля 2026)
Официальный блог OpenAI — Анонс чипа для инференса Jalapeño
Wall Street Journal — Alibaba AI chip to fill Nvidia void
03 Заявления Лян Вэньфэна и стратегическая мотивация
Лян Вэньфэн (梁文鋒), основатель и генеральный директор DeepSeek, крайне редко даёт публичные интервью. Наиболее содержательные — два углублённых материала с китайским изданием Waves (Angyong) в мае 2023 и июле 2024 годов. Ключевые цитаты, связанные с чипами и вычислительными мощностями:
- Реальное ограничение: «Наш настоящий вызов никогда не был в финансировании — это экспортные ограничения на продвинутые чипы.» (Июль 2024, интервью Waves)
- Разрыв в вычислительной эффективности: Китайские лаборатории нуждаются примерно в четырёхкратном объёме вычислений по сравнению с международными конкурентами для получения аналогичных результатов.
- Проблема экосистемы: «Многие отечественные чипы не получают распространения не из-за аппаратного обеспечения, а из-за отсутствия сообщества разработчиков. Китаю нужны люди на технологической передовой.»
- Жажда вычислительных мощностей: «Для исследователей жажда вычислительных мощностей бесконечна. Мы будем сознательно развёртывать как можно больше вычислительных ресурсов.»
Важное разграничение: цитаты Лян Вэньфэна устанавливают стратегическую мотивацию. Reuters сообщает о действиях компании (найм, переговоры с поставщиками). Это принципиально разные утверждения. «Долгосрочная позиция основателя» ≠ «официальное объявление проекта».
04 Alibaba T-Head: ставка Джека Ма в 2018 году даёт результаты
В отличие от ранней стадии DeepSeek, чип-программа Alibaba — это многолетняя стратегия, уже вышедшая в серийное производство. В сентябре 2018 года Джек Ма основал T-Head Semiconductor (平頭哥), объединив CTP и команду по чипам академии Damo. Название «медоед» (honey badger) — бесстрашный и упорный — символизирует долгосрочную приверженность разработке чипов.
| Модель | Выпуск | Ключевые характеристики | Статус |
|---|---|---|---|
| Hanguang 800 | 2019 | Ранний AI-чип для инференса | Устаревшая модель |
| Zhenwu 810E | Январь 2026 | Обучение + инференс; 96 ГБ HBM2e; производительность между Nvidia A800 и H20; совместим с экосистемой CUDA | Серийное производство |
| Zhenwu M890 | 2026 | 144 ГБ памяти; межчиповое соединение 800 ГБ/с; ~3× производительность 810E | Запускается |
| Zhenwu V900 | Запланировано Q3 2027 | 216 ГБ памяти; соединение 1200 ГБ/с | Дорожная карта |
| Zhenwu J900 | Запланировано Q3 2028 | Собственная архитектура параллельных вычислений | Дорожная карта |
Ключевые коммерческие метрики (1П 2026): совокупные поставки 560 000+ единиц; годовая выручка исчисляется миллиардами юаней; 400+ корпоративных клиентов используют кластеры Zhenwu; уставный капитал T-Head увеличен до 1 млрд юаней (июнь 2026); Alibaba обязалась инвестировать 380 млрд юаней (~52 млрд $) в облачную и AI-инфраструктуру за 3 года; Zhenwu 810E совместим с экосистемой CUDA Nvidia (WSJ), снижая стоимость миграции для разработчиков.
Caixin Global — Alibaba's New Processor Shows Applications Are Key to AI Chip Success
05 Пять причин, по которым крупные AI-компании разрабатывают собственные чипы
Компании разрабатывают кастомные чипы не ради самих чипов — конкуренция в AI сместилась с «у кого лучшая модель» на «у кого самые дешёвые и контролируемые вычислительные мощности». Пять движущих сил по важности:
- 1. Экономика: стоимость инференса — это «аренда» AI. Обучение — первоначальный взнос (разовый). Инференс — ежемесячная аренда (непрерывно, растёт с числом пользователей). Маржа валовой прибыли Nvidia на GPU для ЦОД превышает 70%. Кастомные ASIC конвертируют постоянный «налог Nvidia» в разовые R&D инвестиции. При крупномасштабном многолетнем развёртывании инференса TCO может быть снижен на 40–65% по сравнению со стандартными GPU.
- 2. Безопасность цепочки поставок и геополитические риски. Американские экспортные ограничения на продвинутые AI-чипы (H100/H800/H20 последовательно ограничиваются) вынуждают китайские AI-компании искать альтернативы. Безопасность означает также предсказуемость цепочки поставок — не зависеть от одного поставщика или политики одного государства.
- 3. Аппаратно-программная ко-оптимизация (Co-design). Формат UE8M0 FP8 и архитектура MLA от DeepSeek оптимизированы под конкретные аппаратные характеристики. Jalapeño от OpenAI разработан под реальные паттерны обслуживания ChatGPT (KV-кэш, батчинг, задержки). Стандартные GPU жертвуют эффективностью ради гибкости; кастомные ASIC жертвуют гибкостью ради эффективности на известных рабочих нагрузках.
- 4. Конкурентное преимущество и переговорные позиции. Даже частичная альтернатива Nvidia усиливает позиции в закупочных переговорах и позволяет строить нарратив полного стека (модель + облако + чип).
- 5. Энергоэффективность и устойчивое развитие. Чипы для инференса ориентированы на производительность на ватт (performance-per-watt). В ЦОД масштаба гигаватт стоимость энергии и охлаждения равна или превышает стоимость оборудования. ASIC устраняют неиспользуемые универсальные схемы GPU.
06 Чипы для инференса vs обучающие GPU: почему сначала инференс?
Почти все кастомные чип-программы 2025–2026 годов ориентированы на инференс. Следующая таблица объясняет фундаментальные причины:
| Параметр | Обучение (Training) | Инференс (Inference) |
|---|---|---|
| Характер рабочей нагрузки | Динамичный, экспериментальный, архитектура часто меняется | Статичная, фиксированная модель, паттерны запросов предсказуемы |
| Зависимость от программной экосистемы | Глубокая зависимость от CUDA (cuDNN, NCCL) | Возможны кастомные ядра; слабая зависимость от экосистемы |
| Экономический масштаб | Разовые крупные инвестиции в кластер | 7×24 ч непрерывно, растёт с числом пользователей |
| Преимущество кастомного ASIC | Ограниченное (привязка к CUDA) | Значительное (снижение TCO на 40–65%) |
| Текущие лидеры рынка | Nvidia H100/B200 доминирует | TPU, Trainium, Maia, Jalapeño, DeepSeek (слухи) |
Вывод: обучение остаётся вотчиной Nvidia. Инференс — главное поле битвы для кастомных ASIC. Ориентация DeepSeek на инференс является экономически рациональным выбором.
Риски ранних проектов:
- Высокий процент неудач на ранних стадиях: От tape-out до стабильного серийного производства обычно требуется 2–4 года. Проекты могут потерпеть неудачу из-за выхода, смены архитектуры или ограничений литейного производства.
- Полная переработка MTIA от Meta: Meta пришлось полностью переработать дизайн чипа MTIA, прежде чем он был внедрён в производственные системы рекомендаций.
- Параллельная стратегия DeepSeek: Продолжение сотрудничества с Huawei Ascend наряду с разработкой собственного чипа — рациональное хеджирование рисков.
07 Шестишаговый фреймворк для технических руководителей
Практический фреймворк для технических лидеров и архитекторов, оценивающих влияние тренда кастомного кремния:
- Количественная оценка текущих затрат на инференс (расчёт «налога Nvidia»): Изучите расходы на GPU-вычисления за последние 12 месяцев, разделив обучение и инференс. Если инференс превышает 50%, альтернативы кастомного кремния заслуживают серьёзного изучения.
- Анализ характеристик рабочих нагрузок: Оцените стабильность паттернов запросов, предсказуемость размеров батчей и требования к задержке. Стабильный, предсказуемый инференс лучше всего подходит для миграции на ASIC.
- Оценка глубины зависимости от экосистемы CUDA: Составьте карту зависимостей кода инференса от проприетарных API CUDA. Более высокая зависимость означает более высокие затраты на миграцию.
- Фильтрация дорожных карт поставщиков по требованиям соответствия: Alibaba Zhenwu (совместим с CUDA, отечественное производство), Huawei Ascend (закрытая экосистема), международные ASIC (Google TPU, AWS Trainium) — выбирайте по юрисдикции и регуляторным требованиям.
- Проектирование гибридной вычислительной архитектуры: Не заменяйте всё сразу. Поддерживайте GPU Nvidia (гибкое обучение и эксперименты) + кастомные ASIC (стабильный массовый инференс) + bare-metal физические машины (рабочие процессы AI Agent с низкой задержкой).
- Создание перечня диверсификации цепочки поставок: Обеспечьте как минимум две независимые цепочки поставок вычислительных мощностей. Ежеквартально пересматривайте изменения в экспортном контроле и обновляйте планы действий в чрезвычайных ситуациях.
08 Часто задаваемые вопросы
В: Насколько достоверен репортаж Reuters о разработке чипа DeepSeek?
О: Reuters процитировало трёх источников 7 июля 2026 — высокая степень достоверности по стандартам агентства. Однако DeepSeek официально не подтвердил проект. Он находится на ранней стадии разработки.
В: Объявлял ли генеральный директор Лян Вэньфэн о программе разработки чипов?
О: Нет. В интервью 2024 года он описывал экспортные ограничения на чипы как главный вызов — это демонстрирует стратегическую мотивацию, но не является официальным объявлением программы. Reuters сообщает о действиях компании, а не о заявлениях основателя.
В: В чём разница между Alibaba и DeepSeek в части чипов?
О: Принципиально разные фазы. T-Head от Alibaba разрабатывает чипы с 2018 года и серийно производит Zhenwu 810E с поставками более 560 000 единиц. DeepSeek находится на ранней R&D стадии без официального подтверждения.
В: Почему сначала чипы для инференса, а не для обучения?
О: Рабочие нагрузки инференса повторяемы и предсказуемы — идеальны для оптимизации ASIC. Обучение требует гибкости CUDA, где доминирует Nvidia. Инференс — ежемесячная аренда, обучение — первоначальный взнос.
В: Это про национальную безопасность или снижение затрат?
О: И то, и другое, но экономика является основным драйвером. Кастомные ASIC могут снизить TCO на 40–65% при крупномасштабном инференсе. Экспортные ограничения ускоряют уже экономически мотивированный сдвиг.
Последнее обновление: 10 июля 2026 | Оговорка: DeepSeek на момент написания статьи официально не подтвердил чип-программу. Все ссылки основаны на общедоступных источниках (Reuters, WSJ, Caixin).
История DeepSeek и Alibaba раскрывает структурный сдвиг: стоимость инференса стала центральной переменной в коммерциализации AI. Стандартное GPU-облако имеет известные ограничения — непредсказуемая производительность в пуле общих ресурсов в часы пиковой нагрузки, ограниченные среды выполнения, высокая стоимость инференса на токен в масштабе. Bare-metal узлы ZUKCLOUD на Mac mini отвечают конкретной и растущей потребности: выделенные физические машины на Apple Silicon, нулевые накладные расходы гипервизора, работа AI Agent 7×24 ч, гибкое ценообразование по дням/неделям/месяцам — стабильная, контролируемая среда для рабочих процессов инференса в переходный период до созревания рынка кастомных ASIC.